Июль 2026   |   В фокусе

ИИ Codex GPT-5.5: навыки повышают точность анализа с 0% до 100%, но рискуют закрепить ошибки

ИИ-агент Codex без четких инструкций ошибается в бизнес-задачах в 83% случаев, но добавление структурированных правил повышает точность расчетов комиссий более чем в два раза. Технология превращает скрытые бизнес-правила в жесткий алгоритм, однако риск закрепления человеческих ошибок в системе требует постоянного контроля со стороны аналитика.

Исследование, опубликованное в рамках проекта DataMind, показывает, что использование структурированных «навыков» (Skills) повышает точность работы ИИ-агента Codex в задачах анализа данных. Эксперименты на открытых данных подтвердили: если превратить неявные бизнес-правила и частые ошибки в готовые инструкции, модель реже допускает логические сбои. В тестовых сценариях научного анализа точность выросла с 0% до 100%, а в бизнес-задачах по расчету комиссий — с 17% до 42%. Это означает, что ИИ способен перенимать опыт, но требует четкого человеческого контроля над формулировкой правил.

Механизм работы и результаты тестирования

Для проверки гипотезы исследователи использовали фреймворк DataCOPE. Он автоматически извлекает успешные и неудачные сценарии работы агента, формируя из них файл SKILL.md с правилами и скриптами. Процесс идет циклично: агент выполняет задачу, система проверяет результат, а менеджер навыков обновляет инструкции на основе найденных ошибок. В экспериментах участвовали две группы задач: анализ пространственных данных клеток и расчет стоимости транзакций в платежных системах.

Тестирование проводилось на модели Codex GPT-5.5 с использованием Claude Code Sonnet 4.6 для управления навыками. Результаты показали, что навыки помогают модели справляться с задачами, где важны скрытые контекстные правила:

  • Научный анализ (DSBio Spatial Neighbor): Без навыков Codex не мог правильно отфильтровать данные и сравнивать типы клеток, показав результат 0 из 4. С навыками точность составила 4 из 4. Модель научилась исключать пары одинаковых типов клеток и правильно использовать координаты.
  • Бизнес-анализ (DABstep Highest Cost): Задача поиска сценария с максимальной комиссией. Без навыков результат составил 2 из 12, с навыками — 5 из 12. Улучшение произошло за счет правильного накопления всех применимых правил комиссий, а не выбора только одного.
  • Оптимизация маршрутизации (DABstep Routing): Выбор платежной системы с минимальной стоимостью. Точность выросла с 5 из 12 до 9 из 12. Навыки помогли избежать ошибок при пересчете стоимости транзакций для разных схем карт.

Важный нюанс: Рост точности наблюдается только при наличии четких правил в навыках. Если модель не понимает суть задачи, навык может зафиксировать ошибку и заставить ИИ делать её последовательно и уверенно.

Как навыки меняют работу ИИ

Основная проблема ИИ в анализе данных — не неспособность считать, а непонимание неявных договоренностей и бизнес-логики. Навыки решают это четырьмя способами:

  1. Явное описание скрытых правил. В платежных системах пустой список aci: [] означает «применить ко всем», а не «нет данных». Без навыка Codex интерпретировал это как отсутствие правила. Навык фиксирует это как жесткое требование, убирая необходимость гадать.
  2. Уточнение цели задачи. В научном эксперименте модель часто возвращала пары одинаковых клеток (например, макрофаг-макрофаг), хотя требовалось найти связь между разными типами. Навык добавил правило: «сравнивать только разные типы», что устранило ошибку.
  3. Структурирование рабочих процессов. Сложные задачи, такие как расчет стоимости, разбиты на 9 шагов: от фильтрации дат до финального форматирования. Навык превращает этот процесс в жесткий алгоритм, который Codex выполняет по шагам, не пропуская этапы.
  4. Чек-лист ошибок. Навыки содержат список типичных сбоев, которые нужно проверять перед выдачей ответа. Например: «не считать пустой массив как отсутствие данных» или «не использовать годовые данные для месячного отчета».

Ограничения и риски внедрения

Несмотря на рост точности, технология не является универсальным решением. Исследование выявило три критических ограничения, которые важно учитывать при внедрении:

  • Риск закрепления ошибок. Если в обучающей выборке была ошибка, навык может превратить её в правило. В тестах это привело к тому, что Codex стал последовательно давать неверный, но логически обоснованный ответ на вопросы по кодам категорий (MCC), так как навык не описал процедуру сравнения для этого конкретного случая достаточно полно.
  • Узкая специализация. Навык, созданный для анализа пространственных клеток, не поможет в задачах финансового анализа. Попытка объединить слишком разные задачи в одном навыке размывает его эффективность. Правила должны быть разделены по типам рабочих процессов.
  • Необходимость человеческого контроля. Навыки не гарантируют правильность результата. Они лишь снижают количество повторяющихся ошибок. При неясных формулировках задачи, нестандартных данных или отсутствии покрытия в обучающей выборке финальную проверку должен проводить человек.

Стоит учесть: Навыки работают как «память» для ИИ, но эта память ограничена тем, что в нее записал человек. Без постоянного обновления правил и валидации результатов система может деградировать, воспроизводя устаревшие или неверные сценарии.

Практические рекомендации по использованию

Для эффективного применения навыков в реальных проектах исследователи предлагают следующую структуру:

  • Разделяйте описание правил и процедур. Навык должен содержать три четких блока: определения полей и формулы, пошаговый алгоритм анализа и требования к формату вывода. Смешивание этих элементов приводит к ошибкам.
  • Используйте конкретные, а не общие предупреждения. Вместо «проверьте качество данных» пишите: «не используйте статистику за год, если требуется месячный объем». Чем конкретнее правило, тем лучше его исполняет ИИ.
  • Дополняйте навыки скриптами. Для сложных расчетов (объединение таблиц, пересчет комиссий) одного текстового описания мало. Лучше прикрепить готовый скрипт (например, solve_routing.py), который стандартизирует вычисления и предотвращает ошибки реализации.

Операционные последствия, тренды и практические аспекты

  • Снижение порога входа для сложных аналитических задач: Внедрение навыков позволяет делегировать ИИ рутинные этапы анализа, требующие знания специфических бизнес-правил, но сохраняет за человеком контроль над критическими решениями.
  • Рост зависимости от качества обучающих данных: Эффективность системы напрямую зависит от полноты и точности начального набора задач. Ошибки в этом наборе могут привести к систематическим сбоям в работе агента на новых данных.
  • Необходимость обновления правил: Навыки требуют регулярного пересмотра. При изменении бизнес-логики или появлении новых типов транзакций старые навыки могут стать источником ошибок, если их не актуализировать.
  • Изменение роли аналитика: Аналитик переходит от написания кода для каждой задачи к проектированию и валидации наборов правил (навыков), которые ИИ будет использовать автономно.

На фоне этого: ИИ-агенты становятся более надежными помощниками, но только при условии, что человек берет на себя роль архитектора правил и финального валидатора, а не просто исполнителя запросов.

Коротко о главном

Как фреймворк DataCOPE формирует файл SKILL.md для улучшения работы агента?

Система автоматически извлекает успешные и неудачные сценарии, создавая циклический процесс, где менеджер навыков обновляет инструкции на основе найденных ошибок, что позволяет модели учиться на практике.

Почему модель Codex без навыков показала результат 0 из 4 в задаче DSBio Spatial Neighbor?

Без явных правил ИИ не мог корректно фильтровать данные и сравнивать типы клеток, но после внедрения навыка, запрещающего сравнивать одинаковые типы, точность достигла 4 из 4.

Как навыки помогли повысить точность поиска сценария с максимальной комиссией с 2 до 5 из 12?

Улучшение произошло благодаря правилу, обязывающему модель накапливать все применимые условия комиссий, вместо того чтобы ошибочно выбирать только одно правило.

Какой критический риск возникает, если в обучающей выборке навыков содержится ошибка?

Навык может зафиксировать неверное действие как правило, заставляя ИИ последовательно и уверенно выдавать ошибочные ответы, как это случилось с кодами категорий MCC.

Почему навык, созданный для анализа клеток, неэффективен для финансовых задач?

Технология обладает узкой специализацией, и попытка объединить разнородные процессы в одном навыке размывает его эффективность, требуя разделения правил по типам рабочих потоков.

Каким образом навыки устраняют непонимание ИИ пустого списка `aci: []` в платежных системах?

Навык фиксирует это как жесткое требование «применить ко всем», предотвращая ошибочную интерпретацию пустого массива как отсутствия данных, что было типично для модели без инструкций.

Какие три обязательных блока должна содержать структура навыка для избежания ошибок?

Эффективный навык разделяет определения полей и формулы, пошаговый алгоритм анализа и требования к формату вывода, так как смешивание этих элементов приводит к сбоям в логике.

Как меняется роль аналитика при внедрении системы навыков в рабочие процессы?

Специалист переходит от написания кода для каждой задачи к проектированию и валидации наборов правил, которые ИИ использует автономно, сохраняя за человеком контроль над финальным результатом.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Аналитика и исследования; Управление и стратегия

Материалы по теме