Google DeepMind SIMA 2 с Gemini перешла от команд к самостоятельному планированию и обучению
Интеграция модели Gemini в агента SIMA 2 превращает его из исполнителя команд в самостоятельного планировщика, способного обучаться на собственном опыте. Система теперь адаптируется к незнакомым играм без участия человека, что открывает путь к созданию роботов, переносящих виртуальные навыки в реальный мир.
Google DeepMind представила обновленную версию агента SIMA 2, интегрировав в его ядро модель Gemini. Это позволяет системе перейти от простого выполнения команд к самостоятельному планированию действий и диалогу с пользователем в трехмерных виртуальных мирах. Агенты теперь способны обучаться на собственном опыте, адаптироваться к незнакомым играм и переносить навыки между разными проектами без дополнительного обучения людьми.
От исполнения команд к логическому мышлению
Первая версия SIMA выполняла более 600 простых действий, таких как «открой карту» или «поднимись по лестнице», реагируя на визуальные стимулы экрана. Новая архитектура меняет подход: система не просто реагирует на ввод, а анализирует цель, строит цепочку рассуждений и объясняет свои шаги.
- Понимание контекста: SIMA 2 интерпретирует абстрактные запросы и логические цепочки, оценивая окружение и намерения пользователя.
- Мультиязычность и мультимодальность: Агент понимает команды на разных языках, реагирует на эмодзи и даже на рисунки, сделанные пользователем прямо на экране.
- Смена роли: Взаимодействие перестает напоминать отдачу приказов и превращается в сотрудничество с помощником, который способен аргументировать свои действия.
Важный нюанс: Переход от слепого следования инструкциям к осознанному планированию позволяет агенту справляться с задачами, которые не были заложены в его базу данных при обучении.
Работа в незнакомых мирах и перенос навыков
Ключевое достижение версии 2 — способность к обобщению (генерализации). Система успешно выполняет задачи в играх, которые никогда не входили в набор для обучения, например, в выживальщике ASKA или исследовательской версии MineDojo (аналог Minecraft).
- Перенос концепций: Если агент научился «добывать ресурсы» в одной игре, он применяет эту логику для «сбора урожая» в другой, даже если механики отличаются.
- Тестирование на новых мирах: В связке с моделью Genie 3, генерирующей новые миры по текстовому описанию, SIMA 2 демонстрирует способность ориентироваться в абсолютно невиданных ранее пространствах.
- Близость к человеку: Показатели успешного выполнения задач в новых средах значительно выросли и приблизились к уровню человеческого игрока.
Стоит учесть: Успех в незнакомых играх свидетельствует о том, что система начинает формировать абстрактные модели поведения, а не просто запоминать последовательности нажатий клавиш.
Самостоятельное обучение и перспективы для робототехники
SIMA 2 получил функцию самосовершенствования. После начального обучения на демонстрациях людей, агент может переходить к самостоятельной практике. Ошибки и успехи фиксируются, а модель Gemini анализирует их, формируя базу опыта для следующей итерации обучения.
- Цикл улучшения: Агент может обучаться в сгенерированных мирах без участия человека, используя данные собственного опыта для повышения эффективности.
- Ограничения: На текущем этапе сохраняются сложности с задачами, требующими очень длинной цепочки рассуждений, а также с точным управлением на низком уровне (манипуляции мышью и клавиатурой).
- Связь с физическим миром: Навыки навигации, использования инструментов и совместной работы, отработанные в играх, рассматриваются как фундамент для создания реальных роботизированных помощников.
На фоне этого: Способность к самообучению в виртуальной среде снижает потребность в сборе огромных массивов данных от людей, что критически важно для масштабирования технологий в робототехнику.
Операционные последствия и тренды
- Снижение зависимости от разметки данных: Механизм самосовершенствования позволяет сократить объем необходимых демонстраций от людей, что упрощает процесс обучения агентов для специфических задач.
- Новый этап тестирования ПО: Возможность запускать агентов в процедурно генерируемых мирах (через Genie 3) открывает пути для автоматического тестирования игр и симуляторов в бесконечном количестве сценариев.
- Риск ошибок в цепочках рассуждений: Несмотря на прогресс, сложность задач с длительным горизонтом планирования остается уязвимым местом, что требует доработки алгоритмов верификации целей.
- Перенос в реальность: Навыки, отработанные в играх, могут быть адаптированы для управления физическими роботами, однако точность визуального восприятия и моторики в реальных условиях пока требует дополнительных исследований.
Проект находится на стадии ограниченного исследовательского превью. Доступ к технологии предоставлен небольшой группе ученых и разработчиков игр для сбора обратной связи и оценки рисков.
Источник: deepmind.google