Август 2026   |   В фокусе

Microsoft Echoverse: качество симуляции важнее объема данных для обучения ИИ

Обучение ИИ на реальных сайтах рискованно и часто блокирует аккаунты, поэтому Microsoft создала 12 цифровых копий банков и сервисов для безопасных тренировок. Точность выполнения задач моделью выросла почти вдвое, доказав, что качество симуляции важнее объема данных, а ошибки в коде среды могут сводить на нет все усилия разработчиков.

Команда Microsoft Research представила проект Echoverse — платформу из 12 синтетических сред для обучения искусственного интеллекта работе с компьютерными интерфейсами. Вместо того чтобы заставлять модели кликать по реальным сайтам, где каждое действие меняет данные и может заблокировать аккаунт, исследователи создали цифровые копии сложных систем: от банковских приложений до календарей и почтовых сервисов. Обучение на этих «глубоких» мирах позволило модели с 9 миллиардами параметров повысить точность выполнения задач с 36,5% до 67,1%, приблизившись к показателям флагманской модели GPT-5.4.

Ключевая находка эксперимента: количество тренировочных данных не так важно, как их качество. Простые имитации интерфейсов, где не работают сложные зависимости между экранами, лишь ухудшают работу модели. Только среды, полностью повторяющие логику реальных приложений и сохраняющие состояние данных, дают навык, который переносится на реальный интернет.

Глубина против количества: почему простые симуляции не работают

Исследователи сравнили обучение на «поверхностных» и «глубоких» версиях одних и тех же задач. Поверхностные миры имитируют только внешний вид кнопок и ссылок, игнорируя то, как действия влияют на базу данных и другие части системы.

  • Результат на поверхностных мирах: Модель, обученная на таких данных, показала падение эффективности. На тесте Allrecipes точность упала с 80,0% до 75,0%, а на Hugging Face осталась на уровне базовой модели (48,0%). Модель училась «правильным» кликам, но не понимала последствий, что приводило к зацикливанию и ошибкам в реальных условиях.
  • Результат на глубоких мирах: В средах, где каждое действие меняло состояние системы (например, отправка письма действительно появлялась в чужом ящике), модель научилась планировать шаги. Точность на Allrecipes выросла до 85,0%, а на Hugging Face — до 65,0%.

Важный нюанс: Синтетические миры должны воспроизводить не визуальный интерфейс, а причинно-следственные связи внутри приложения. Если симуляция не учитывает, как изменение одной переменной влияет на доступность других функций, модель выучит бесполезные паттерны, которые не сработают в реальном мире.

Фокус на сложных элементах управления

Вместо того чтобы создавать тысячи разных сайтов, команда сфокусировалась на конкретных элементах интерфейса, где агенты чаще всего ошибаются: выбор даты (date pickers) и вложенные фильтры.

Были созданы специальные миры, где эти элементы представлены в десятках вариаций: от календарных тепловых карт до прокручиваемых колес и фильтров по сложным условиям.

  • Навык выбора даты: После обучения точность выросла с 60,0% до 82,6% на известных интерфейсах и с 34,0% до 54,0% на совершенно новых, невиданных ранее.
  • Навык фильтрации: Точность работы с неизвестными фильтрами увеличилась с 62,8% до 84,1%.

Обучение на этих узкоспециализированных задачах дало общий прирост производительности на открытых сайтах, которые модель никогда не видела в процессе обучения. Это доказывает, что ИИ учится не запоминать конкретный дизайн, а понимать логику работы элемента управления.

Коэволюция: мир учится вместе с моделью

В проекте реализован цикл обратной связи, где среда улучшается вместе с моделью. Если агент не может выполнить задачу, система проверяет, где ошибка: в самом агенте, в сценарии задачи или в баге симуляции.

  • Исправление среды: В мире EchoStay (аналог бронирования жилья) выяснилось, что ошибка была в коде симуляции: контроллер количества гостей не работал. После исправления доля выполнимых задач выросла с 48% до 78%.
  • Исправление верификатора: В чат-приложении EchoChat система проверки ответов была рассинхронизирована с данными. После настройки доля задач, которые можно было проверить, выросла с 34% до 99%.
  • Рост модели: После двух циклов улучшения среды и переобучения на ней, производительность модели на EchoStay выросла более чем в два раза — с 16,2% до 38,5%.

Ключевой момент: Ошибка в тесте не всегда означает некомпетентность ИИ. Часто проблема кроется в дефекте самой симуляции или некорректной постановке задачи. Без механизма исправления среды обучение на таких данных лишь закрепляет ошибки.

От подражания к самостоятельному обучению

Первый этап обучения строился на подражании (имитационное обучение), где модель копировала успешные действия эталонного ИИ. Однако этот метод имеет предел: модель не учится исправлять собственные ошибки, так как видит только идеальные сценарии.

Для прорыва этого предела исследователи применили обучение с подкреплением (Reinforcement Learning) прямо внутри синтетических миров. Поскольку эти миры можно мгновенно сбрасывать и перезапускать, модель может совершать тысячи попыток, получая награду только за реальный результат в базе данных, а не за красивую картинку на экране.

  • Результат: На пяти сложных мирах (EchoBank, EchoForge и др.) точность выполнения задач выросла с 58% до 69%.
  • Эффективность: Модель научилась достигать цели за меньшее количество шагов, понимая, когда стоит остановиться или вернуться назад, вместо того чтобы бесконечно повторять действия.

Практические последствия для разработки ИИ

  • Смена парадигмы тестирования: Вместо создания статичных наборов данных (бенчмарков) для оценки ИИ, индустрия движется к созданию динамических сред, которые эволюционируют вместе с моделями. Это требует от разработчиков не просто написания кода для генерации задач, но и создания инфраструктуры для автоматического поиска и исправления багов в самой симуляции.
  • Рост требований к инфраструктуре: Для обучения с подкреплением необходимы среды, которые можно быстро сбрасывать и запускать параллельно. Реальные сайты для этого не подходят из-за ограничений по скорости и блокировок, поэтому создание высококачественных синтетических клонов становится критически важным ресурсом.
  • Доступ к закрытым системам: Проект демонстрирует возможность обучения агентов на логике закрытых систем (банкинг, медицина, корпоративные порталы) без риска для реальных данных. Это открывает путь к автоматизации сложных внутренних процессов, которые ранее были недоступны для ИИ из-за требований безопасности.

Команда Microsoft открыла код и данные для четырех миров (EchoStay, EchoForge, а также миры с дата-пикерами и фильтрами), чтобы исследователи могли развивать технологию создания глубоких синтетических сред.

Коротко о главном

Почему обучение на «поверхностных» имитациях интерфейсов привело к падению эффективности модели?

Имитации, не учитывающие изменение состояния базы данных, заставили модель учить бесполезные паттерны, что снизило точность на тесте Allrecipes с 80,0% до 75,0% и вызвало зацикливание в реальных условиях.

Какой результат дало создание специализированных миров для отработки выбора даты и фильтрации?

Точность работы с неизвестными ранее интерфейсами выросла с 34,0% до 54,0% для выбора даты и с 62,8% до 84,1% для фильтров, так как модель научилась понимать логику элементов управления, а не запоминать их дизайн.

Как исправление ошибок в симуляции EchoStay повлияло на долю выполнимых задач?

После устранения бага в контроллере количества гостей доля выполнимых задач увеличилась с 48% до 78%, что доказало: ошибка в тесте часто вызвана дефектом среды, а не некомпетентностью ИИ.

Что позволило применить обучение с подкреплением в проектах EchoBank и EchoForge?

Возможность мгновенно сбрасывать и перезапускать синтетические миры дала модели шанс совершать тысячи попыток, получая награду только за реальный результат в базе данных, что повысило точность с 58% до 69%.

Какие практические возможности открывает использование синтетических клонов для банковских и корпоративных систем?

Технология позволяет обучать агентов на логике закрытых систем без риска для реальных данных, что делает доступной автоматизацию процессов, ранее заблокированных требованиями безопасности.

Какие ресурсы Microsoft сделала доступными для развития технологии глубоких синтетических сред?

Команда открыла код и данные для четырех миров, включая EchoStay и EchoForge, чтобы исследователи могли создавать и улучшать среды, эволюционирующие вместе с моделями.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Передовые технологии

Материалы по теме