ИИ Codex GPT-5.5: навыки повышают точность анализа с 0% до 100%, но рискуют закрепить ошибки
ИИ-агент Codex без четких инструкций ошибается в бизнес-задачах в 83% случаев, но добавление структурированных правил повышает точность расчетов комиссий более чем в два раза. Технология превращает скрытые бизнес-правила в жесткий алгоритм, однако риск закрепления человеческих ошибок в системе требует постоянного контроля со стороны аналитика.
Исследование, опубликованное в рамках проекта DataMind, показывает, что использование структурированных «навыков» (Skills) повышает точность работы ИИ-агента Codex в задачах анализа данных. Эксперименты на открытых данных подтвердили: если превратить неявные бизнес-правила и частые ошибки в готовые инструкции, модель реже допускает логические сбои. В тестовых сценариях научного анализа точность выросла с 0% до 100%, а в бизнес-задачах по расчету комиссий — с 17% до 42%. Это означает, что ИИ способен перенимать опыт, но требует четкого человеческого контроля над формулировкой правил.
Механизм работы и результаты тестирования
Для проверки гипотезы исследователи использовали фреймворк DataCOPE. Он автоматически извлекает успешные и неудачные сценарии работы агента, формируя из них файл SKILL.md с правилами и скриптами. Процесс идет циклично: агент выполняет задачу, система проверяет результат, а менеджер навыков обновляет инструкции на основе найденных ошибок. В экспериментах участвовали две группы задач: анализ пространственных данных клеток и расчет стоимости транзакций в платежных системах.
Тестирование проводилось на модели Codex GPT-5.5 с использованием Claude Code Sonnet 4.6 для управления навыками. Результаты показали, что навыки помогают модели справляться с задачами, где важны скрытые контекстные правила:
- Научный анализ (DSBio Spatial Neighbor): Без навыков Codex не мог правильно отфильтровать данные и сравнивать типы клеток, показав результат 0 из 4. С навыками точность составила 4 из 4. Модель научилась исключать пары одинаковых типов клеток и правильно использовать координаты.
- Бизнес-анализ (DABstep Highest Cost): Задача поиска сценария с максимальной комиссией. Без навыков результат составил 2 из 12, с навыками — 5 из 12. Улучшение произошло за счет правильного накопления всех применимых правил комиссий, а не выбора только одного.
- Оптимизация маршрутизации (DABstep Routing): Выбор платежной системы с минимальной стоимостью. Точность выросла с 5 из 12 до 9 из 12. Навыки помогли избежать ошибок при пересчете стоимости транзакций для разных схем карт.
Важный нюанс: Рост точности наблюдается только при наличии четких правил в навыках. Если модель не понимает суть задачи, навык может зафиксировать ошибку и заставить ИИ делать её последовательно и уверенно.
Как навыки меняют работу ИИ
Основная проблема ИИ в анализе данных — не неспособность считать, а непонимание неявных договоренностей и бизнес-логики. Навыки решают это четырьмя способами:
- Явное описание скрытых правил. В платежных системах пустой список
aci: []означает «применить ко всем», а не «нет данных». Без навыка Codex интерпретировал это как отсутствие правила. Навык фиксирует это как жесткое требование, убирая необходимость гадать. - Уточнение цели задачи. В научном эксперименте модель часто возвращала пары одинаковых клеток (например, макрофаг-макрофаг), хотя требовалось найти связь между разными типами. Навык добавил правило: «сравнивать только разные типы», что устранило ошибку.
- Структурирование рабочих процессов. Сложные задачи, такие как расчет стоимости, разбиты на 9 шагов: от фильтрации дат до финального форматирования. Навык превращает этот процесс в жесткий алгоритм, который Codex выполняет по шагам, не пропуская этапы.
- Чек-лист ошибок. Навыки содержат список типичных сбоев, которые нужно проверять перед выдачей ответа. Например: «не считать пустой массив как отсутствие данных» или «не использовать годовые данные для месячного отчета».
Ограничения и риски внедрения
Несмотря на рост точности, технология не является универсальным решением. Исследование выявило три критических ограничения, которые важно учитывать при внедрении:
- Риск закрепления ошибок. Если в обучающей выборке была ошибка, навык может превратить её в правило. В тестах это привело к тому, что Codex стал последовательно давать неверный, но логически обоснованный ответ на вопросы по кодам категорий (MCC), так как навык не описал процедуру сравнения для этого конкретного случая достаточно полно.
- Узкая специализация. Навык, созданный для анализа пространственных клеток, не поможет в задачах финансового анализа. Попытка объединить слишком разные задачи в одном навыке размывает его эффективность. Правила должны быть разделены по типам рабочих процессов.
- Необходимость человеческого контроля. Навыки не гарантируют правильность результата. Они лишь снижают количество повторяющихся ошибок. При неясных формулировках задачи, нестандартных данных или отсутствии покрытия в обучающей выборке финальную проверку должен проводить человек.
Стоит учесть: Навыки работают как «память» для ИИ, но эта память ограничена тем, что в нее записал человек. Без постоянного обновления правил и валидации результатов система может деградировать, воспроизводя устаревшие или неверные сценарии.
Практические рекомендации по использованию
Для эффективного применения навыков в реальных проектах исследователи предлагают следующую структуру:
- Разделяйте описание правил и процедур. Навык должен содержать три четких блока: определения полей и формулы, пошаговый алгоритм анализа и требования к формату вывода. Смешивание этих элементов приводит к ошибкам.
- Используйте конкретные, а не общие предупреждения. Вместо «проверьте качество данных» пишите: «не используйте статистику за год, если требуется месячный объем». Чем конкретнее правило, тем лучше его исполняет ИИ.
- Дополняйте навыки скриптами. Для сложных расчетов (объединение таблиц, пересчет комиссий) одного текстового описания мало. Лучше прикрепить готовый скрипт (например,
solve_routing.py), который стандартизирует вычисления и предотвращает ошибки реализации.
Операционные последствия, тренды и практические аспекты
- Снижение порога входа для сложных аналитических задач: Внедрение навыков позволяет делегировать ИИ рутинные этапы анализа, требующие знания специфических бизнес-правил, но сохраняет за человеком контроль над критическими решениями.
- Рост зависимости от качества обучающих данных: Эффективность системы напрямую зависит от полноты и точности начального набора задач. Ошибки в этом наборе могут привести к систематическим сбоям в работе агента на новых данных.
- Необходимость обновления правил: Навыки требуют регулярного пересмотра. При изменении бизнес-логики или появлении новых типов транзакций старые навыки могут стать источником ошибок, если их не актуализировать.
- Изменение роли аналитика: Аналитик переходит от написания кода для каждой задачи к проектированию и валидации наборов правил (навыков), которые ИИ будет использовать автономно.
На фоне этого: ИИ-агенты становятся более надежными помощниками, но только при условии, что человек берет на себя роль архитектора правил и финального валидатора, а не просто исполнителя запросов.
Источник: huggingface.co