Дорога как память: пока только склероз у роботов позволяет предотвратить восстание машин, но ученые под эгидой Сбера работают над их «лечением». Команда «Воплощенные агенты» из Института AIRI и МФТИ представила на конференции ICLR 2026 очень интересную работу 👨🏻🎓🤖
Главный тренд воплощенного ИИ в робототехнике — это VLA-модели (Vision-Language-Action) на основе трансформеров. Архитектура, аналогичная большим языковым моделям. Но с ней есть трудности 🤩
❓ ПРОБЛЕМА:
✅ В двух словах: робот видит сцену, понимает человеческую речь и сразу совершает действие. И пока всё, что ему нужно, находится перед глазами, система работает.
✅ Но стоит переместить предмету в ящик и закрыть его, а задаче — прозвучать пару минут назад, как наш железный друг превращается в растерянного пенсионера, который забыл, зачем пришёл на кухню.
✅ Дело в том, что в трансформерах память — это контекстное окно, куда пытаются запихнуть всё, что модель видела и слышала. Но есть нюанс: механизм внимания имеет квадратичную сложность по длине последовательности.
✅ Грубо говоря, каждый новый кадр или токен заставляет модель пересчитывать взаимосвязи со всеми предыдущими, и чем дольше робот действует, тем дороже ему обходится каждый следующий шаг. Просто расширять контекст до бесконечности — значит сжигать гигаватты ради воспоминания о том, где лежит отвертка.
❗️РЕШЕНИЕ:
✅ Для преодоления описанного ограничения ребята из Института AIRI и МФТИ предложили архитектуру ELMUR. Вместо того, чтобы бесконечно раздувать контекстное окно, они добавили трансформеру компактную внешнюю память. Длинная последовательность контекста разбивается на сегменты, а после обработки каждого из них модель обновляет внешнее состояние памяти и передает его следующему сегменту.
✅ Благодаря этому трансформер может использовать информацию, полученную очень давно, без квадратичного роста вычислений. Получается что-то вроде долговременной памяти: роботу уже не нужно снова и снова прокручивать всю историю наблюдений, чтобы вспомнить важный факт.
🙂 Результаты получились впечатляющими. В классическом тесте T-Maze модель успешно сохраняет и использует подсказку, полученную почти миллион шагов назад, хотя рабочий контекст составляет всего 10 шагов.
На робототехническом бенчмарке MIKASA-Robo архитектура ELMUR заметно превосходит существующие методы в задачах, где нужно помнить объекты, давно исчезнувшие из поля зрения, а на наборе POPGym становится лучшим методом более чем в половине тестов.
🤖 Как итог, современным роботам не хватает не интеллекта как такового, а долговременной памяти. И если машины когда-нибудь действительно захватят мир, то это будут не терминаторы, а робот-полицейский, который наконец перестанет забывать, куда положил ключи от шкафа с оружием.
Почитать оригинал на GitHub и 💚💚💚💚💚