Матрица для агентов роботов: в России никто не обратил внимания, а компания Xiaomi совершила переворот в области воплощенного ИИ (embodied AI) 🅰
🦿Уже давно складывается ощущение, что инженеры-робототехники окончательно превратились в инструкторов по производственной гимнастике. Чтобы научить робота любому простому действию, приходится повторять его сотни раз, меняя условия. Робот смотрит, человек показывает, исследователи записывают терабайты видео. И все преисполненные ангельского терпения.
❗️В Xiaomi предложили поменять парадигму обучения разом. А вместе с ней и сверхдорогую экономику:
1️⃣Собираем относительно небольшой объём реальных данных.
2️⃣ Затем используем фундаментальную модель понимания физического мира (world foundation model) как фабрику контента для роботов.
3️⃣ Производим практически неограниченное количество новых, согласованных и разнообразных демонстраций.
4️⃣ Проверяем жизнеспособность и масштабируемость подхода.
Если всё сработает, то на смену лабам с роботами, камерами и «тренерами» придут очередные вычислительные кластеры с генеративными моделями. И будут вырублены ещё гектары леса, потрачены тонны воды и гигаватты электричества!
👁️ Xiaomi-Robotics-U0 — это генеративная модель на 38 миллиардов параметров, которая создаёт для роботов новые тренировочные данные. Она умеет генерировать изображения по тексту, редактировать существующие сцены, синтезировать видео и даже придумывать новые варианты уже записанных демонстраций.
Что прямо очень круто?
⏺Многокамерное зрение. Для людей кружка остаётся той же самой кружкой независимо от того, смотрим мы на неё сверху или сбоку — это называется константностью восприятия. У робота же картина часто строится со многих камер, что искажает трёхмерную геометрию окружающего мира.
Поэтому U0 генерирует сразу полный набор синхронизированных изображений одной и той же сцены, сохраняя согласованность положения объектов, рук робота, теней и перспективы между всеми ракурсами. И для обучения это просто топ!
⏺ Режим embodied transfer — метод генерации синтетических робототехнических данных, при котором сохраняется воплощённое взаимодействие (embodied interaction) между роботом и объектом, а окружающая среда целенаправленно изменяется для получения новых обучающих демонстраций.
Предположим, робот научился складывать полотенце на белом столе. Раньше, чтобы проверить его в других условиях, пришлось бы снова устраивать съёмки. Теперь достаточно попросить модель:
«Оставь движения робота прежними, но перенеси всё действие на кухню, выключи дневной свет, добавь комнатные растения, а полотенце сделай синим».
Робот при этом продолжает выполнять ту же задачу, а исследователь получает совершенно новую демонстрацию.
Проверка на практике:
Специалисты Xiaomi использовали синтетические данные, созданные U0, чтобы дообучить существующую робототехническую модель pi₀.₅.
👍 Результат оказался весьма убедительным: успешность выполнения задач в условиях, отличающихся от обучающих (OOD) выросла с 36,9% до 63,2%.
🧠 Не менее важна и инженерная сторона работы: для ускорения генерации изображений в U0 используется схема FlashAR+, которая сокращает время создания изображения 1024×1024 примерно с 451 до 5,4 секунды, обеспечивая ускорение до 82,9 раза.
Кажется, даже сами процессоры GPU наконец смогли перевести дух!
🤖 «Теперь я знаю кунг-фу» — скоро будет отвечать ваш Walker, подгрузив симуляции из храма в Удане.
Почитать ArXiv | Изучить Xiaomi-Robotics-U0 и 💚💚💚💚💚