Июль 2026   |   В фокусе

Microsoft SkillOpt: рост эффективности GPT-5.5 с 58,8 до 82,3 баллов без дообучения

Автоматическая оптимизация текстовых инструкций подняла эффективность GPT-5.5 на 23,5 пункта, позволив малым моделям обогнать крупные аналоги без дорогостоящего дообучения. Технология превращает навыки агентов в версионный актив, но требует внедрения сложной инфраструктуры для автоматической проверки результатов, иначе система не сможет отфильтровать ошибки.

Исследователи Microsoft представили метод SkillOpt, который превращает редактирование инструкций для ИИ-агентов в процесс обучения. Вместо ручного подбора промптов или генерации их «на лету», система автоматически оптимизирует файл навыков, не меняя веса самой нейросети. В тестах на 52 различных комбинациях задач и моделей метод показал лучшие результаты, подняв среднюю эффективность GPT-5.5 с 58,8 до 82,3 баллов. Это позволяет малым моделям с оптимизированными навыками работать эффективнее, чем крупные модели без них.

Как работает оптимизация навыков

Технология меняет подход к созданию агентов: вместо того чтобы искать идеальную формулировку команды, система «тренирует» файл с инструкциями. Процесс напоминает обучение нейросети, но происходит в текстовом пространстве.

  • Замороженная модель: Основная нейросеть (агент) не меняет свои внутренние параметры. Она выполняет задачи, используя текущий файл навыков.
  • Цикл обучения: Отдельная модель-оптимизатор анализирует результаты выполнения задач (траектории). Она выделяет успешные паттерны и ошибки.
  • Контролируемые правки: Оптимизатор предлагает небольшие изменения в тексте навыков (добавление, удаление, замена). Каждое изменение проходит строгую проверку: новая версия принимается только если она показывает результат лучше предыдущей на тестовом наборе данных.
  • Обратная связь: Отклоненные правки не удаляются, а сохраняются в буфере как негативный пример, чтобы система не повторяла ошибки в будущем.

Важный нюанс: Метод не просто улучшает промпты, а создает переносимый файл навыков, который содержит обобщенную логику работы, а не инструкции, привязанные к конкретной задаче.

Результаты тестирования и переносимость

Эффективность SkillOpt проверялась на шести бенчмарках, включая работу с таблицами (SpreadsheetBench), документами (OfficeQA) и математическими задачами (LiveMathematicianBench). Тесты проводились на семи моделях разного размера: от GPT-5.5 до открытой модели Qwen3.5-4B.

  • Универсальность: Метод показал лучший или сопоставимый с лучшим результат во всех 52 ячейках оценки.
  • Рост производительности: На примере GPT-5.5 средний балл вырос на 23,5 пункта. На сложных процедурных задачах прирост был еще выше:
    • SpreadsheetBench: с 41,8 до 80,7.
    • OfficeQA: с 33,1 до 72,1.
    • LiveMathematicianBench: с 37,6 до 66,9.
  • Перенос между средами: Навык, обученный в одной среде (например, Codex), успешно работал в другой (Claude Code) без дообучения. Перенос навыка по таблицам поднял результат с 22,1 до 81,8 баллов.

Стоит учесть: Оптимизированный навык позволяет маленькой модели GPT-5.4-mini (средний балл 64,3) превзойти более крупную модель GPT-5.4 без навыков (балл 59,7).

Практическая ценность для бизнеса

Финальный результат работы системы — компактный текстовый файл best_skill.md. В отличие от «черного ящика» весов нейросети, этот файл остается читаемым и понятным человеку.

  • Компактность: Медианная длина итогового файла составляет около 920 токенов.
  • Минимализм: Для достижения значительного прироста часто требуется всего 1–4 принятых правки. Например, рост на 39 баллов в задаче OfficeQA был достигнут одной единственной правкой.
  • Аудит: Поскольку файл текстовый и правки ограничены, легко отследить, какое именно изменение улучшило работу агента.

На фоне этого: Компании могут адаптировать агентов под специфические задачи без дорогостоящего дообучения (fine-tuning) моделей, используя лишь автоматическую генерацию и проверку текстовых инструкций.

Операционные последствия и скрытые риски

  • Зависимость от верификатора: Метод требует наличия автоматической системы оценки (верификатора), которая может проверить результат выполнения задачи. Без надежного способа проверить, правильно ли агент решил задачу, цикл обучения не сможет отфильтровать плохие правки.
  • Сложность внедрения: Для работы системы необходим не только целевой агент, но и отдельная модель-оптимизатор, а также инфраструктура для сбора траекторий и проведения валидации. Это усложняет архитектуру по сравнению с простым использованием промптов.
  • Границы применимости: Метод эффективен для процедурных задач, где есть четкий критерий успеха. В задачах, требующих творческого подхода или где результат сложно оценить автоматически, эффективность метода может быть ниже.
  • Риск переобучения под тест: Если валидационный набор данных слишком мал или не репрезентативен, система может оптимизировать навыки под конкретные тестовые примеры, а не под реальные рабочие сценарии.

Важно: Технология предлагает альтернативу ручному написанию промптов экспертами, но требует перехода к процессу, где навыки становятся управляемым активом, который можно версионировать и обновлять.

Коротко о главном

Почему малая модель GPT-5.4-mini превзошла более крупную GPT-5.4?

Использование оптимизированного файла навыков позволило модели с меньшим размером (балл 64,3) обогнать большую модель без навыков (балл 59,7), поскольку навыки содержат обобщенную логику работы, а не просто привязанные к задаче инструкции.

Какой прирост производительности был достигнут на бенчмарке SpreadsheetBench?

Тестирование показало рост результата с 41,8 до 80,7 баллов, потому что алгоритм SkillOpt последовательно вносил и проверял правки в текстовом пространстве, оставляя только те изменения, которые улучшали выполнение задач.

Сколько правок потребовалось для достижения роста на 39 баллов в задаче OfficeQA?

Значительное улучшение было получено всего одной единственной правкой, что демонстрирует способность метода находить критически важные изменения в логике агента без необходимости множественных итераций.

Как метод обеспечивает переносимость навыков между разными средами?

Навык, обученный в среде Codex, успешно заработал в Claude Code без дообучения и поднял результат с 22,1 до 81,8 баллов, так как созданный файл содержит универсальную логику, независимую от конкретной платформы.

Какой размер итогового файла best_skill.md позволяет сохранить читаемость?

Медианная длина финального файла составляет около 920 токенов, что обеспечивает возможность для человека легко аудировать изменения и понимать, какое именно редактирование привело к улучшению работы агента.

Почему метод SkillOpt не может работать без автоматической системы оценки?

Цикл обучения зависит от верификатора, который проверяет результат выполнения задачи, так как без надежного способа отфильтровать плохие правки система не сможет принимать только те изменения, что дают положительный эффект.

В каких случаях эффективность метода может снизиться из-за риска переобучения?

Если валидационный набор данных слишком мал или не репрезентативен, система оптимизирует навыки под конкретные тестовые примеры вместо реальных сценариев, что ограничивает применимость метода в задачах без четких критериев успеха.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Аналитика и исследования; Передовые технологии

Материалы по теме