🍾 Хотите, чтобы робот открывал вам бутылки с пивом? Сначала покажите ему миллион часов со своей кухни, а потом добавьте четверть часа профильной практики!

🤝 Dyna Robotics представила Dyna‑2 — модель для управления роботами, предварительно обученную более чем на миллионе часов видео от первого лица. Люди готовят еду, складывают одежду, убирают, работают с инструментами. Камера на голове фиксирует их действия. А нейросеть наблюдает за человеческими руками и учится предсказывать, что произойдёт дальше и какие действия к этому приведут.

Миллион часов эквивалентен примерно 170 годам человеческого опыта, если считать по 16 часов бодрствования в сутки. При круглосуточном пересчёте это около 114 лет непрерывной записи. Интересно, сколько заплатили отчаянным домохозяйкам, чтобы они носили GoPro на голове днями напролёт?

❗️ Dyna‑2 относится к классу World-Action Model (WAM). Их особенность в том, что они одновременно прогнозируют, как будет меняться окружающая среда, и генерируют действия робота, которые нужно совершить, чтобы этого добиться.

⏺ Видеодиффузионная архитектура со связанными блоками трансформеров позволяет преобразовать видео и действия в отдельные последовательности токенов. Модель также получает текстовую инструкцию и проприоцептивные данные о состоянии исполнительного устройства. Видеопредсказание влияет на общие параметры модели и тем самым улучшает представления, используемые модулем действий.

⏺ Однако при непосредственном управлении роботом не генерирует видеоролик перед каждым движением и не использует предсказанные кадры как промежуточный план. Исполнительная политика выдаёт действия напрямую и остаётся реактивной. Моделирование видео служит исключительно для обучающей задачи на этапе предобучения (pretraining).

🥒 На практике это означает, что после просмотра сотен часов «готовки с GoPro» робот понимает, что крышку банки с солеными огурчиками нужно не просто сжимать, а вращать. И, судя по тестам, с каждым удвоением обучающего корпуса он понимает это всё лучше!

🕔 Исследователи обучили четыре версии Dyna‑2 — на 1 тыс., 10 тыс., 100 тыс. и 1 млн часов. Чем больше человеческого опыта получала модель, тем точнее она прогнозировала действия на данных незнакомых роботизированных установок.

⏺ После дообучения на небольших наборах демонстраций средний результат в 14 физических задачах вырос по цепочке: 20% → 28% → 45% → 53%. Впору вспомнить старую мудрость: «Смотри, как бабушка лепит пельмени, и однажды сам слепишь». А у роботов теперь есть насмотренность на всех бабушек мира!

⏺ В отдельных тестах масштаб оказался особенно важен. Версии до 100 тыс. часов ни разу не смогли повернуть ключ в замке, а миллионная справилась в 9 из 10 попыток.

⏺ Для откручивания крышки двумя пяти­палыми роборуками ей понадобилось всего около 13 минут локальных демонстраций. Выбор нужного напитка по текстовой команде улучшился с 58 до 83%.

👁️ В общем, путь к технологической сингулярности лежит через безмолвное наблюдение за тем, как мы чистим картошку и режем сельдерей. Так что если заметите, как ваш робот-пылесос пристально смотрит на вас во время утренней йоги — не обольщайтесь, он не заворожен красотой и динамикой исполнения виньяс...

...он просто собирает данные для робототехнической компании, чтобы через пару лет какой-нибудь гуманоид сделал «собаку мордой вниз» лучше вас.

Читать оригинал в Telegram →