Журнал Россия для роботов
Россия для роботов Новость · 2 мин

Дорога как память: пока только склероз у роботов позволяет предотвратить восстание…

Главный тренд воплощенного ИИ в робототехнике — это VLA-модели (Vision-Language-Action) на основе трансформеров. Архитектура, аналогичная большим языковым моделям. Но с ней есть трудности 🤩

361.Robotics
29 июня 2026 г.

Дорога как память: пока только склероз у роботов позволяет предотвратить восстание машин, но ученые под эгидой Сбера работают над их «лечением». Команда «Воплощенные агенты» из Института AIRI и МФТИ представила на конференции ICLR 2026 очень интересную работу 👨🏻‍🎓🤖

Главный тренд воплощенного ИИ в робототехнике — это VLA-модели (Vision-Language-Action) на основе трансформеров. Архитектура, аналогичная большим языковым моделям. Но с ней есть трудности 🤩

❓ ПРОБЛЕМА:

✅ В двух словах: робот видит сцену, понимает человеческую речь и сразу совершает действие. И пока всё, что ему нужно, находится перед глазами, система работает.

✅ Но стоит переместить предмету в ящик и закрыть его, а задаче — прозвучать пару минут назад, как наш железный друг превращается в растерянного пенсионера, который забыл, зачем пришёл на кухню.

✅ Дело в том, что в трансформерах память — это контекстное окно, куда пытаются запихнуть всё, что модель видела и слышала. Но есть нюанс: механизм внимания имеет квадратичную сложность по длине последовательности.

✅ Грубо говоря, каждый новый кадр или токен заставляет модель пересчитывать взаимосвязи со всеми предыдущими, и чем дольше робот действует, тем дороже ему обходится каждый следующий шаг. Просто расширять контекст до бесконечности — значит сжигать гигаватты ради воспоминания о том, где лежит отвертка.

❗️РЕШЕНИЕ:

✅ Для преодоления описанного ограничения ребята из Института AIRI и МФТИ предложили архитектуру ELMUR. Вместо того, чтобы бесконечно раздувать контекстное окно, они добавили трансформеру компактную внешнюю память. Длинная последовательность контекста разбивается на сегменты, а после обработки каждого из них модель обновляет внешнее состояние памяти и передает его следующему сегменту.

✅ Благодаря этому трансформер может использовать информацию, полученную очень давно, без квадратичного роста вычислений. Получается что-то вроде долговременной памяти: роботу уже не нужно снова и снова прокручивать всю историю наблюдений, чтобы вспомнить важный факт.

🙂  Результаты получились впечатляющими. В классическом тесте T-Maze модель успешно сохраняет и использует подсказку, полученную почти миллион шагов назад, хотя рабочий контекст составляет всего 10 шагов.

На робототехническом бенчмарке MIKASA-Robo архитектура ELMUR заметно превосходит существующие методы в задачах, где нужно помнить объекты, давно исчезнувшие из поля зрения, а на наборе POPGym становится лучшим методом более чем в половине тестов.

🤖  Как итог, современным роботам не хватает не интеллекта как такового, а долговременной памяти. И если машины когда-нибудь действительно захватят мир, то это будут не терминаторы, а робот-полицейский, который наконец перестанет забывать, куда положил ключи от шкафа с оружием.

Почитать оригинал на GitHub и  💚💚💚💚💚

Читать оригинал в Telegram →

Журнал

Читать дальше