Журнал Китай
Китай Новость · 3 мин

Час пробил! Появилась Humanoid-GPT — новая фундаментальная модель для управления…

1️⃣ Самый большой датасет в истории:

361.Robotics
8 июня 2026 г.

❗️Час пробил! Появилась Humanoid-GPT — новая фундаментальная модель для управления человекоподобными роботами. И да, это генеративный трансформер с каузальным вниманием. Рассказываем в шести тезисах и одном перечне цифр:

1️⃣ Самый большой датасет в истории:

Для обучения модели был собран корпус движений гуманоидов объёмом около 2 млрд фреймов. В него вошли как крупнейшие открытые датасеты с захватом движения (motion capture), включая AMASS, LAFAN1, MotionMillion и PHUMA, так и значительные собственные записи авторов.

2️⃣ Снят конфликт между ловкостью и универсальностью:

Раньше роботы хорошо умели выполнять что-то одно: либо определенную последовательность очень сложных и динамичных действий, либо обобщать новые движения. Совместить оба качества одновременно было сложно. Как оказалось, это противоречие легко преодолевается за счет большого масштаба данных и размера модели.

2️⃣ Трансформер вместо перцептронов:

До сих пор системы захвата движений строились на многослойных перцептронах Румельхарта (multi-layer perceptron, MLP). Обычно это неглубокие модели, обученные на небольших корпусах движений (около 7 млн фреймов).

В новой работе представлен GPT-подобный трансформер с каузальным вниманием (causal attention) — механизмом, который ограничивает модель доступом только к предыдущим токенам и задаёт направленную структуру последовательности. Или, говоря проще, предсказывает следующее действие робота, основываясь на последовательности его прошлых позиций и поз.

4️⃣ От сбора данных к дистилляции, или обучение в три этапа:

✅ Организация данных (curation data) в 300 кластеров.

✅✅ Обучение 300 специализированных нейросетей-экспертов на данных кластеров с использованием PPO-алгоритмов глубокого обучения с подкреплением за отслеживание ключевых точек.

✅✅✅ Дистилляция всех экспертов в единый трансформер Humanoid-GPT с помощью алгоритма DAgger. На входе модель получает последовательность состояний робота и целевых поз, а на выходе предсказывает команды для моторов.

5️⃣ Робот сходу учится новым движениям:

Одного предобученного чекпоинта достаточно, чтобы робот без дообучения (zero-shot) осваивал любые, даже самые экзотические движения — от танцев и прыжков до боевых искусств. (как сказал бы Нео, «теперь я знаю кунг фу»).

Модель получала движение, которого никогда раньше не видела, и сразу воспроизводила его в испытаниях на реальном гуманоиде Unitree G1.

6️⃣ Масштабирование работает:

Законы масштабирования (scaling laws) при использовании трансформеров верны и для робототехники. Качество управления гуманоидов предсказуемо растёт при увеличении объёма данных и размера модели. Тогда как традиционные MLP-контроллеры быстро выходят на плато и начинают переобучаться.

Результаты и цифры (только для профи):

Эксперименты показали, что базовая модель (Humanoid-GPT-B) с 200 млн токенов и 22 млн параметров достигает 88,27% успешного отслеживания против 76,89% у MLP, а ошибка положения суставов снижается с 0,1191 до 0,0793 рад. Старшая модель (Humanoid-GPT-L) на 2 млрд токенов и 80 млн параметров повышает успешность до 92,58%, а MPJPE падает до 0,0735 рад.

Кроме того, система демонстрирует впечатляющую скорость: инференс на GPU с оптимизацией TensorRT занимает всего 0,58 мс на шаг, что в 5,7 раза быстрее конкурента TWIST и позволяет работать в реальном времени с частотой более 1000 Гц.

Короче говоря, как я уже писал ранее, Humanoid-GPT может стать для моторного контроля роботов тем же, чем GPT стал для обработки языка: единой фундаментальной моделью, способной заменить множество специализированных контроллеров. Работа первые демонстрирует масштабируемый подход к обучению универсального «двигательного интеллекта» для гуманоидных платформ.

🤩 Прочитать оригинальное исследование

🤩 Посмотреть дополнительные материалы и видеодемонстрации

🤩 Изучить код в репозитории

и, наконец,

, , ,

Читать оригинал в Telegram →

Журнал

Читать дальше