ВНИМАНИЕ! ЭТО ОЧЕНЬ СЕРЬЁЗНЫЙ ТЕКСТ ДЛЯ ГИКОВ! ЧИТАЙТЕ, ТОЛЬКО ЕСЛИ НЕ МОЖЕТЕ УСНУТЬ!
💚💚 В комментариях к посту о «моменте ChatGPT» в робототехнике наш подписчик задал отличный вопрос, достойный развернутого ответа:
А как в мультимодальных моделях с обработкой сигналов разного приоритета? Когда это и картинка, и звук, и генерация действий в одном, — данные поступают и обрабатываются асинхронно?
Если резко возникло какое-то препятствие, обработчик его отдельно от остального потока информации обработает и успеет скорректировать управляющее воздействие? Или все одним потоком обрабатывается за цикл, потом выдается команда, потом снова обработка всей информации и вновь команда?
Тогда фундаментальная модель будет иметь задержку в шаг времени обработки и генерации.
И если не завезти асинхронную обработку и приоритеты в фундаментальную модель, то лучше уже модульная структура.
👆 Это один из главных споров об архитектуре воплощенного ИИ (embodied AI).
Существует классическая модульная архитектура из относительно независимых блоков внутри робототехнической системы:
1️⃣ Восприятие 2️⃣Построение мира или картирование рабочей среды 2️⃣Планирование действий 4️⃣Построение движений 5️⃣Контроль 6️⃣Безопасность и мониторинг
При таком устройстве робот представляет собой конвейер:
камера или лидар → распознавание объекта → карта мира → планировщик → генератор траектории → контроллер → моторы
⭕️🚫 Каждый модуль разрабатывается отдельно и взаимодействует с другими через четко определенные интерфейсы. Именно из-за удобства интеграции разных модулей стала так популярна ROS (Robot Operating System).
🦿У данной архитектуры есть ахиллесова пята: по отдельности каждый модуль работает хорошо, но система в целом оказывается нестабильна. Происходит накопление ошибок между блоками.
Примеры возможных ошибок:
➖ Если на этапе распознавания объекта система компьютерного зрения перепутала кружку с кастрюлей, то планировщик построит сценарий поведения на основе ошибочной информации.
➖ Если генератор траектории движений задает физически невыполнимую задачу локомоции.
Преимущества модульной архитектуры:
➕ Да, действительно, отдельные модули проще тестировать, сертифицировать и заменять. Именно поэтому промышленные роботы ещё долго будут использовать подобную архитектуру.
Трудные проблемы фундаментальных моделей:
🧠 Сейчас невозможно создать систему, где бы одна гигантская мультимодальная модель получала всю входящую информацию от сенсоров и, условно, раз в секунду выдавала бы следующую команду.
➖ Физический мир слишком быстр и непредсказуем для такого подхода.
➖ Контур стабилизации, балансировки и экстренного торможения робота должен работать на частотах от десятков до сотен герц, тогда как фундаментальная модель рассуждает на порядки медленнее.
➖ Кроме того, у автономных роботов сейчас существует ограничение вычислительных мощностей — у них просто не хватит ресурсов и энергии для тяжелых моделей.
Текущий компромисс:
✅ В настоящий момент это иерархия уровней. Фундаментальная модель отвечает за понимание задачи, планирование и выбор стратегии («возьми красную кружку справа от ноутбука»), а низкоуровневые контроллеры непрерывно управляют приводами и реагируют на внезапные события.
✅ Если перед роботом внезапно появляется ребёнок или падает предмет, аварийная реакция срабатывает локально, не дожидаясь полного прогона через фундаментальную модель.
✅ Фактически получается асинхронная система с разными временными масштабами принятия решений.
✅ Фундаментальная модель отвечает за восприятие, рассуждение и общую стратегию действий, а вокруг неё сохраняются специализированные контуры безопасности, контроля движения и аппаратных ограничений.
✅ Модульность остается, но перестает быть основным способом реализации поведения робота.
Перспектива:
❗️Поиск оптимального разделения труда. Вероятнее всего, робототехнический аналог GPT будет не монолитом, а гигантской мультимодальной моделью в центре системы, окруженной набором высокочастотных и критически важных локальных подсистем.
Файл с инфографикой в комментариях