Июль 2026   |   В фокусе

Настройка окружения GPT-5.6 Sol утроила результат и сократила расходы в шесть раз

Настройка тестового окружения изменила результат модели GPT‑5.6 Sol в три раза: с 13,3% до 38,3%. Это доказывает, что низкие оценки часто связаны не со слабостью алгоритма, а с потерей памяти диалога, что ведет к ошибочным выводам о возможностях ИИ и лишним затратам ресурсов.

Исследование компании OpenAI показало, что низкие показатели модели GPT‑5.6 Sol в тесте ARC-AGI‑3 были вызваны не слабостью алгоритма, а особенностями настройки тестового окружения. После включения двух параметров — сохранения внутренней логики и сжатия истории диалога — результат модели вырос с 13,3% до 38,3%. Это изменение также сократило количество генерируемых токенов в 6 раз. Тест ARC-AGI‑3 оценивает способность ИИ осваивать новые правила в двумерных играх без инструкций, где средний человек набирает около 48% баллов.

Ключевой момент: Разрыв между реальными возможностями модели и её результатами в тестах часто определяется не качеством алгоритма, а тем, как разработчики тестового стенда обрабатывают контекст и память диалога.

Как настройки окружения влияют на память модели

Стандартный тестовый инструмент ARC-AGI‑3 использует упрощенную схему работы, которая не учитывает особенности современных моделей. В оригинальной версии теста после каждого хода модели вся её внутренняя логика («размышления») удалялась. Это заставляло GPT‑5.6 Sol каждый раз заново анализировать правила игры, не имея доступа к предыдущим выводам.

Кроме того, тест применял механизм «скользящего окна» для обрезки истории. Когда диалог становился слишком длинным, старые сообщения просто удалялись. Модель теряла не только свои мысли, но и память о прошлых действиях. Это создавало эффект амнезии: агент не мог выстроить стратегию, так как не помнил, что уже пробовал и к чему это привело.

Технические решения для повышения эффективности

Команда OpenAI заменила стандартный инструмент на собственное решение на базе Responses API, которое имитирует работу в реальных продуктах ChatGPT и Codex. Это позволило реализовать два критически важных изменения:

  • Сохранение логики: Внутренние рассуждения модели теперь сохраняются в истории диалога. Агент видит свои прошлые планы и инсайты, что позволяет ему учиться на ходу и не тратить ресурсы на повторный анализ ситуации.
  • Сжатие контекста (Compaction): Вместо удаления старых сообщений система сжимает историю, сохраняя суть событий. Это позволяет модели работать с длинными сессиями, не теряя важные детали из начала игры.

В результате модель стала действовать быстрее и точнее. Она тратила меньше времени на раздумья перед каждым ходом, так как опиралась на накопленный опыт, а не начинала с нуля.

Важный нюанс: Использование стандартных, «универсальных» тестовых окружений может давать искаженную картину возможностей ИИ, заставляя мощные модели выглядеть менее эффективными, чем они есть на практике.

Практические выводы для разработчиков

Эксперимент демонстрирует, что оценка качества ИИ зависит от корректности настройки среды тестирования. Разработчикам, стремящимся получить максимальную производительность от моделей, рекомендуется использовать те же параметры, что и в продакшене OpenAI.

Для достижения лучших результатов необходимо:

  • Использовать Responses API вместо устаревшего Chat Completions API.
  • Включать функцию сохранения внутренней логики (Retain reasoning).
  • Активировать режим сжатия истории (Compaction) для работы с длинными контекстами.

При сравнении разных моделей важно опираться на тесты, использующие эти настройки, так как они ближе всего отражают реальное поведение ИИ в коммерческих приложениях. Без учета этих факторов сравнение может быть некорректным.

Операционные последствия и тренды

  • Риск ложных выводов: Использование упрощенных тестовых стендов без сохранения контекста может привести к ошибочному заключению о неспособности модели решать сложные задачи, что тормозит внедрение технологий.
  • Экономия ресурсов: Переход на режим сжатия контекста позволяет сократить объем передаваемых данных в 6 раз, что снижает затраты на вычислительные мощности и ускоряет работу приложения.
  • Зависимость от инфраструктуры: Высокая эффективность моделей в сложных сценариях (как в играх) требует поддержки со стороны API, способного управлять длинной историей диалога и сохранять промежуточные рассуждения.

Коротко о главном

Как стандартная настройка теста ARC-AGI‑3 приводила к потере памяти у модели?

Удаление внутренней логики после каждого хода и применение механизма «скользящего окна» лишали модель доступа к прошлым выводам, создавая эффект амнезии и мешая выстраиванию стратегии.

Какое техническое решение позволило сократить количество генерируемых токенов в 6 раз?

Переход на Responses API с функцией сжатия контекста заменил простое удаление старых сообщений на сохранение их сути, что уменьшило объем передаваемых данных без потери важных деталей.

Почему замена Chat Completions API на Responses API изменила оценку возможностей ИИ?

Новое решение имитирует работу реальных продуктов, сохраняя промежуточные рассуждения, что предотвращает искажение результатов, характерное для упрощенных тестовых стендов.

Как отсутствие сохранения контекста влияет на внедрение технологий?

Использование устаревших тестов без поддержки длинной истории диалога может привести к ложному выводу о неспособности модели решать сложные задачи, что тормозит развитие проектов.

Какой результат показывает средний человек в тесте ARC-AGI‑3 для сравнения с моделью?

В этом тесте, оценивающем освоение новых правил в играх без инструкций, человек набирает около 48% баллов, что служит ориентиром для оценки улучшений после настройки окружения.

Почему модель тратила меньше времени на раздумья после обновления настроек?

Сохранение предыдущих планов и инсайтов позволило агенту опираться на накопленный опыт, исключая необходимость начинать анализ ситуации с нуля перед каждым ходом.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Аналитика и исследования

Материалы по теме