ИИ-агенты воспроизводят память, а не изобретают новое — риски переоценки возможностей
Исследование VIDRAFT_LAB показало, что ИИ-агенты чаще воспроизводят заученные сценарии из обучающих данных, чем создают новые решения. Это ставит под сомнение заявления о «прорывной» самостоятельности нейросетей и требует от разработчиков пересмотра методов оценки их реальных возможностей.
Команда VIDRAFT_LAB опубликовала результаты эксперимента CIVOS, который ставит под сомнение популярный нарратив об «эмерджентности» (возникновении новых свойств) в мультиагентных системах. Исследователи выяснили, что значительная часть поведения ИИ-агентов, создающих цивилизации и делящих труд, является не результатом поиска новых решений, а воспроизведением знаний, полученных при обучении на человеческой истории. Без специального контрольного механизма эти два процесса выглядят идентично, что делает многие прошлые отчеты о «прорыве» ИИ статистически несостоятельными.
Методология: Как отличить поиск от памяти
Проблема заключается в том, что современные языковые модели уже знают базовые принципы выживания: удар по камню дает лезвие, огонь предшествует земледелию. Когда группа из тысяч агентов демонстрирует сложное поведение, невозможно понять, где они сами додумались до этого, а где просто воспроизвели заученный сценарий.
Для решения этой задачи команда CIVOS разработала экспериментальную установку:
- Фиксация структуры: Задача оставалась неизменной, менялась только доступность знаний модели.
- Манипуляция знаниями: Условия варьируются от полного доступа к базе знаний до их полной блокировки или замены на заведомо неверные данные.
- Контрольная группа: Базовый уровень производительности определяется без использования языковой модели вообще.
Если агенты действительно исследуют мир, их эффективность не должна падать при удалении предварительных знаний. Если же они «цитируют» историю, результат резко ухудшится. Статистический анализ проводился методом перестановок (200 000 повторений) с поправкой на множественные сравнения для исключения ложных срабатываний.
Ключевые выводы эксперимента
Эксперимент показал, что «эмерджентность» в значительной степени иллюзорна:
- Зависимость от памяти: При блокировке доступа к предварительным знаниям производительность агентов резко падает, даже если структура задачи не меняется. Размер этого падения показывает долю пути, которую обеспечивала память модели.
- Вред неверных данных: Использование заведомо неправильных знаний оказалось хуже, чем их полное отсутствие. Этот эффект подтвердился в 40 из 40 и 37 из 40 парных тестов соответственно.
- Подпись воспроизведения: При сохранении доступа к знаниям результаты были практически одинаковыми для разных случайных семян (стартовых условий). Настоящий поиск решений должен давать вариативные результаты; их отсутствие указывает на механическое воспроизведение заученного сценария.
Отсутствие статистической значимости в малых выборках не является доказательством отсутствия эффекта. В данном исследовании это привело к двум противоположным ошибкам: сначала реальный эффект был пропущен из-за малого размера выборки, а затем ложный эффект был принят за истинный из-за отсутствия поправки на множественные сравнения.
Ошибки измерений и их цена
Авторы честно описывают две критические ошибки, типичные для отрасли:
- Недостаточная мощность выборки: На начальном этапе (6 семян) эффект был положительным, но статистически не значимым. Команда ошибочно сочла это «отсутствием эффекта» и дважды пыталась исправить конструкцию эксперимента. Позже расчеты показали, что при таком малом размере выборки вероятность пропустить реальный эффект составляла 80%.
- Отсутствие поправки на множественность: При повторном тестировании результат показал значимость (p ≈ 0.04). Однако так как из одного набора данных было сделано четыре сравнения, после поправки Бонферрони (α = 0.0125) этот результат перестал быть достоверным.
Обе ошибки указывают на системную проблему: стандартные размеры выборок в подобных исследованиях слишком малы, чтобы надежно детектировать эффекты такого масштаба.
Особенности виртуального мира
В отличие от абстрактных головоломок, агенты CIVOS живут в функционирующей планете с физическими законами:
- Физика: Гравитация и орбитальные периоды рассчитаны по формулам Кеплера. Размер существа зависит от гравитации (чем выше g, тем короче и толще тело).
- Измерения: Единицы длины основаны на анатомии местных обитателей (палец, ладонь, шаг), а не на метрической системе.
- Биология: Экологические цепочки работают: исчезновение хищников ведет к росту популяции травоядных и падению растительности.
- Язык: Стартовый словарь состоит из 285 слов. Новые понятия создаются путем соединения существующих. Например, понятие «съедобный» (которое отсутствовало в языке) было создано одним агентом как комбинация «плод-тело» и «мягкий».
Практические ограничения и перспективы
Результаты пока получены только для одной семейства моделей. Повторные тесты на втором семействе показывают тот же эффект, но с большей амплитудой. До завершения этих испытаний нельзя утверждать, что обнаруженная зависимость от памяти является универсальным свойством всех языковых моделей — это может быть особенностью конкретного алгоритма.
Для бизнеса и разработчиков ИИ-агентов это сигнал о необходимости пересмотра методологии оценки:
- Валидация через «слепые» тесты: Без контрольных условий, исключающих влияние обучающих данных, результаты демонстраций мультиагентных систем могут быть переоценены.
- Риски масштабирования: Если текущие системы полагаются на воспроизведение паттернов из интернета, их способность к настоящему инновационному поведению в новых, неизученных средах может быть значительно ниже заявленной.
Полный доступ к симуляции открыт через Hugging Face: пользователь получает уникальную планету на основе своего имени, где время течет со скоростью 2.4 секунды реального времени за один игровой день. Наблюдатели не могут вмешиваться в процесс, что гарантирует объективность данных в таблице рекордов.
Подтверждение: huggingface.co