Журнал Новость
Новость Новость · 3 мин

Уважаемый Манвел Аветисян — когда-то коллега в одном там «Зелёном великане», а ныне…

Авторы материала опытные практики: сооснователь и директор по робототехнике Agility Robotics Джонатан Херст и Ханс Петер Брёндмо, возглавлявший до 2023 года проект Everyday Robots в лаборатории…

361.Robotics
22 мая 2026 г.

🧠  Уважаемый Манвел Аветисян — когда-то коллега в одном там «Зелёном великане», а ныне разработчик тротуарных роботов-доставщиков — привлек внимание к статье «Возникнет ли в робототехнике “момент ChatGPT”» в IEEE Spectrum. Недавно и я задавался аналогичным вопросом.

Авторы материала опытные практики: сооснователь и директор по робототехнике Agility Robotics Джонатан Херст и Ханс Петер Брёндмо, возглавлявший до 2023 года проект Everyday Robots в лаборатории Google X. Мужики набили немало шишек, а потому позиция у них довольно консервативная, если не сказать скептическая.

🤖  При чтении у меня возникла стойкая параллель со знаменитой разгромной книгой «Перцептроны» Марвина Минского и Сеймура Пейперта — двух пионеров и столпов ИИ. Напомню, что этот труд на долгие годы поставил крест на экспериментах с нейросетями. А ещё, вероятно, послужил косвенной причиной трагической гибели изобретателя перцептрона Фрэнка Розенблатта — «дедушки глубокого обучения».

Вот пять тезисов статьи и их критический разбор:

Тезис: большие языковые модели работают с текстом, а роботы должны взаимодействовать с непредсказуемым физическим миром. Поэтому здесь невозможен такой прорыв, каким были трансформеры с механизмом внимания в генеративном ИИ.

Антитезис: аналогом трансформеров вообще и GPT в частности в робототехнике станут фундаментальные модели (foundation model), обученные на огромных массивах разнородных мультимодальных данных.

Тезис: робот должен одновременно воспринимать мир, планировать действия, управлять движением, соблюдать безопасность и работать в реальном времени. Эти функции слишком отличаются, чтобы их эффективно решала одна модель. Нужно несколько модулей.

Антитезис: в индустрии сейчас обратный тренд. Все стремятся к архитектурам, объединяющим восприятие, рассуждение и управление внутри одной фундаментальной модели. А мультимодальность позволит легко адаптировать её под разнородные задачи.

🔎 Для понимания. Вы командуете своему домашнему гуманоиду: «Возьми красную кружку со стола и поставь её рядом с ноутбуком». Сейчас для этого нужен набор разных специализированных алгоритмов и механизм их взаимодействия.

Тогда как фундаментальная модель одновременно:

➡️ распознает и понимает человеческую речь; ➡️детектирует целевой объект — находит кружку; ➡️оценивает окружающую среду и положение других объектов; ➡️строит последовательность действий; ➡️прокладывает маршрут; ➡️генерирует управляющие команды для робота.

Тезис: роботы сталкиваются с сенсорным шумом, механическими ограничениями, случайностями среды и требованиями безопасности.

Антитезис: главная проблема не механика роботов, а качество моделей принятия решений у них на борту. Фундаментальные модели постепенно снимают многие ограничения.

Появляются системы, которые ещё несколько лет назад считались невозможными. Роботы осваивают сотни новых манипуляций за день на основе минимального количества демонстраций.

Тезис: недостаток данных тормозит разработки. У OpenAI были миллионы текстов из интернета. А у робототехники нет сопоставимого объёма данных о физических действиях.

Антитезис: существует множество решений. Это могут быть синтетические данные, симуляторы, объединение датасетов многих организаций в единое обучающее пространство, кросс-платформенное обучение и самообучение роботов.

Тезис: многие компании обещают скорое появление домашних гуманоидов, однако между YouTube-демонстрациями и реальной эксплуатацией сохраняется огромный разрыв.

Антитезис: да, рынок пока на ранней стадии, но все недооценивают скорость прогресса. Текущий этап робототехники сравним с генеративным ИИ в 2017-2018 годах — возможности ещё ограничены, но траектория развития уже определена.

Читать оригинал в Telegram →

Журнал

Читать дальше