Microsoft Echoverse: качество симуляции важнее объема данных для обучения ИИ
Обучение ИИ на реальных сайтах рискованно и часто блокирует аккаунты, поэтому Microsoft создала 12 цифровых копий банков и сервисов для безопасных тренировок. Точность выполнения задач моделью выросла почти вдвое, доказав, что качество симуляции важнее объема данных, а ошибки в коде среды могут сводить на нет все усилия разработчиков.
Команда Microsoft Research представила проект Echoverse — платформу из 12 синтетических сред для обучения искусственного интеллекта работе с компьютерными интерфейсами. Вместо того чтобы заставлять модели кликать по реальным сайтам, где каждое действие меняет данные и может заблокировать аккаунт, исследователи создали цифровые копии сложных систем: от банковских приложений до календарей и почтовых сервисов. Обучение на этих «глубоких» мирах позволило модели с 9 миллиардами параметров повысить точность выполнения задач с 36,5% до 67,1%, приблизившись к показателям флагманской модели GPT-5.4.
Ключевая находка эксперимента: количество тренировочных данных не так важно, как их качество. Простые имитации интерфейсов, где не работают сложные зависимости между экранами, лишь ухудшают работу модели. Только среды, полностью повторяющие логику реальных приложений и сохраняющие состояние данных, дают навык, который переносится на реальный интернет.
Глубина против количества: почему простые симуляции не работают
Исследователи сравнили обучение на «поверхностных» и «глубоких» версиях одних и тех же задач. Поверхностные миры имитируют только внешний вид кнопок и ссылок, игнорируя то, как действия влияют на базу данных и другие части системы.
- Результат на поверхностных мирах: Модель, обученная на таких данных, показала падение эффективности. На тесте Allrecipes точность упала с 80,0% до 75,0%, а на Hugging Face осталась на уровне базовой модели (48,0%). Модель училась «правильным» кликам, но не понимала последствий, что приводило к зацикливанию и ошибкам в реальных условиях.
- Результат на глубоких мирах: В средах, где каждое действие меняло состояние системы (например, отправка письма действительно появлялась в чужом ящике), модель научилась планировать шаги. Точность на Allrecipes выросла до 85,0%, а на Hugging Face — до 65,0%.
Важный нюанс: Синтетические миры должны воспроизводить не визуальный интерфейс, а причинно-следственные связи внутри приложения. Если симуляция не учитывает, как изменение одной переменной влияет на доступность других функций, модель выучит бесполезные паттерны, которые не сработают в реальном мире.
Фокус на сложных элементах управления
Вместо того чтобы создавать тысячи разных сайтов, команда сфокусировалась на конкретных элементах интерфейса, где агенты чаще всего ошибаются: выбор даты (date pickers) и вложенные фильтры.
Были созданы специальные миры, где эти элементы представлены в десятках вариаций: от календарных тепловых карт до прокручиваемых колес и фильтров по сложным условиям.
- Навык выбора даты: После обучения точность выросла с 60,0% до 82,6% на известных интерфейсах и с 34,0% до 54,0% на совершенно новых, невиданных ранее.
- Навык фильтрации: Точность работы с неизвестными фильтрами увеличилась с 62,8% до 84,1%.
Обучение на этих узкоспециализированных задачах дало общий прирост производительности на открытых сайтах, которые модель никогда не видела в процессе обучения. Это доказывает, что ИИ учится не запоминать конкретный дизайн, а понимать логику работы элемента управления.
Коэволюция: мир учится вместе с моделью
В проекте реализован цикл обратной связи, где среда улучшается вместе с моделью. Если агент не может выполнить задачу, система проверяет, где ошибка: в самом агенте, в сценарии задачи или в баге симуляции.
- Исправление среды: В мире EchoStay (аналог бронирования жилья) выяснилось, что ошибка была в коде симуляции: контроллер количества гостей не работал. После исправления доля выполнимых задач выросла с 48% до 78%.
- Исправление верификатора: В чат-приложении EchoChat система проверки ответов была рассинхронизирована с данными. После настройки доля задач, которые можно было проверить, выросла с 34% до 99%.
- Рост модели: После двух циклов улучшения среды и переобучения на ней, производительность модели на EchoStay выросла более чем в два раза — с 16,2% до 38,5%.
Ключевой момент: Ошибка в тесте не всегда означает некомпетентность ИИ. Часто проблема кроется в дефекте самой симуляции или некорректной постановке задачи. Без механизма исправления среды обучение на таких данных лишь закрепляет ошибки.
От подражания к самостоятельному обучению
Первый этап обучения строился на подражании (имитационное обучение), где модель копировала успешные действия эталонного ИИ. Однако этот метод имеет предел: модель не учится исправлять собственные ошибки, так как видит только идеальные сценарии.
Для прорыва этого предела исследователи применили обучение с подкреплением (Reinforcement Learning) прямо внутри синтетических миров. Поскольку эти миры можно мгновенно сбрасывать и перезапускать, модель может совершать тысячи попыток, получая награду только за реальный результат в базе данных, а не за красивую картинку на экране.
- Результат: На пяти сложных мирах (EchoBank, EchoForge и др.) точность выполнения задач выросла с 58% до 69%.
- Эффективность: Модель научилась достигать цели за меньшее количество шагов, понимая, когда стоит остановиться или вернуться назад, вместо того чтобы бесконечно повторять действия.
Практические последствия для разработки ИИ
- Смена парадигмы тестирования: Вместо создания статичных наборов данных (бенчмарков) для оценки ИИ, индустрия движется к созданию динамических сред, которые эволюционируют вместе с моделями. Это требует от разработчиков не просто написания кода для генерации задач, но и создания инфраструктуры для автоматического поиска и исправления багов в самой симуляции.
- Рост требований к инфраструктуре: Для обучения с подкреплением необходимы среды, которые можно быстро сбрасывать и запускать параллельно. Реальные сайты для этого не подходят из-за ограничений по скорости и блокировок, поэтому создание высококачественных синтетических клонов становится критически важным ресурсом.
- Доступ к закрытым системам: Проект демонстрирует возможность обучения агентов на логике закрытых систем (банкинг, медицина, корпоративные порталы) без риска для реальных данных. Это открывает путь к автоматизации сложных внутренних процессов, которые ранее были недоступны для ИИ из-за требований безопасности.
Команда Microsoft открыла код и данные для четырех миров (EchoStay, EchoForge, а также миры с дата-пикерами и фильтрами), чтобы исследователи могли развивать технологию создания глубоких синтетических сред.
Источник: microsoft.com