❗️Час пробил! Появилась Humanoid-GPT — новая фундаментальная модель для управления человекоподобными роботами. И да, это генеративный трансформер с каузальным вниманием. Рассказываем в шести тезисах и одном перечне цифр:
1️⃣ Самый большой датасет в истории:
Для обучения модели был собран корпус движений гуманоидов объёмом около 2 млрд фреймов. В него вошли как крупнейшие открытые датасеты с захватом движения (motion capture), включая AMASS, LAFAN1, MotionMillion и PHUMA, так и значительные собственные записи авторов.
2️⃣ Снят конфликт между ловкостью и универсальностью:
Раньше роботы хорошо умели выполнять что-то одно: либо определенную последовательность очень сложных и динамичных действий, либо обобщать новые движения. Совместить оба качества одновременно было сложно. Как оказалось, это противоречие легко преодолевается за счет большого масштаба данных и размера модели.
2️⃣ Трансформер вместо перцептронов:
До сих пор системы захвата движений строились на многослойных перцептронах Румельхарта (multi-layer perceptron, MLP). Обычно это неглубокие модели, обученные на небольших корпусах движений (около 7 млн фреймов).
В новой работе представлен GPT-подобный трансформер с каузальным вниманием (causal attention) — механизмом, который ограничивает модель доступом только к предыдущим токенам и задаёт направленную структуру последовательности. Или, говоря проще, предсказывает следующее действие робота, основываясь на последовательности его прошлых позиций и поз.
4️⃣ От сбора данных к дистилляции, или обучение в три этапа:
✅ Организация данных (curation data) в 300 кластеров.
✅✅ Обучение 300 специализированных нейросетей-экспертов на данных кластеров с использованием PPO-алгоритмов глубокого обучения с подкреплением за отслеживание ключевых точек.
✅✅✅ Дистилляция всех экспертов в единый трансформер Humanoid-GPT с помощью алгоритма DAgger. На входе модель получает последовательность состояний робота и целевых поз, а на выходе предсказывает команды для моторов.
5️⃣ Робот сходу учится новым движениям:
Одного предобученного чекпоинта достаточно, чтобы робот без дообучения (zero-shot) осваивал любые, даже самые экзотические движения — от танцев и прыжков до боевых искусств. (как сказал бы Нео, «теперь я знаю кунг фу»).
Модель получала движение, которого никогда раньше не видела, и сразу воспроизводила его в испытаниях на реальном гуманоиде Unitree G1.
6️⃣ Масштабирование работает:
Законы масштабирования (scaling laws) при использовании трансформеров верны и для робототехники. Качество управления гуманоидов предсказуемо растёт при увеличении объёма данных и размера модели. Тогда как традиционные MLP-контроллеры быстро выходят на плато и начинают переобучаться.
Результаты и цифры (только для профи):
Эксперименты показали, что базовая модель (Humanoid-GPT-B) с 200 млн токенов и 22 млн параметров достигает 88,27% успешного отслеживания против 76,89% у MLP, а ошибка положения суставов снижается с 0,1191 до 0,0793 рад. Старшая модель (Humanoid-GPT-L) на 2 млрд токенов и 80 млн параметров повышает успешность до 92,58%, а MPJPE падает до 0,0735 рад.
Кроме того, система демонстрирует впечатляющую скорость: инференс на GPU с оптимизацией TensorRT занимает всего 0,58 мс на шаг, что в 5,7 раза быстрее конкурента TWIST и позволяет работать в реальном времени с частотой более 1000 Гц.
Короче говоря, как я уже писал ранее, Humanoid-GPT может стать для моторного контроля роботов тем же, чем GPT стал для обработки языка: единой фундаментальной моделью, способной заменить множество специализированных контроллеров. Работа первые демонстрирует масштабируемый подход к обучению универсального «двигательного интеллекта» для гуманоидных платформ.
🤩 Прочитать оригинальное исследование
🤩 Посмотреть дополнительные материалы и видеодемонстрации
и, наконец,
, , ,