Microsoft SkillOpt: рост эффективности GPT-5.5 с 58,8 до 82,3 баллов без дообучения
Автоматическая оптимизация текстовых инструкций подняла эффективность GPT-5.5 на 23,5 пункта, позволив малым моделям обогнать крупные аналоги без дорогостоящего дообучения. Технология превращает навыки агентов в версионный актив, но требует внедрения сложной инфраструктуры для автоматической проверки результатов, иначе система не сможет отфильтровать ошибки.
Исследователи Microsoft представили метод SkillOpt, который превращает редактирование инструкций для ИИ-агентов в процесс обучения. Вместо ручного подбора промптов или генерации их «на лету», система автоматически оптимизирует файл навыков, не меняя веса самой нейросети. В тестах на 52 различных комбинациях задач и моделей метод показал лучшие результаты, подняв среднюю эффективность GPT-5.5 с 58,8 до 82,3 баллов. Это позволяет малым моделям с оптимизированными навыками работать эффективнее, чем крупные модели без них.
Как работает оптимизация навыков
Технология меняет подход к созданию агентов: вместо того чтобы искать идеальную формулировку команды, система «тренирует» файл с инструкциями. Процесс напоминает обучение нейросети, но происходит в текстовом пространстве.
- Замороженная модель: Основная нейросеть (агент) не меняет свои внутренние параметры. Она выполняет задачи, используя текущий файл навыков.
- Цикл обучения: Отдельная модель-оптимизатор анализирует результаты выполнения задач (траектории). Она выделяет успешные паттерны и ошибки.
- Контролируемые правки: Оптимизатор предлагает небольшие изменения в тексте навыков (добавление, удаление, замена). Каждое изменение проходит строгую проверку: новая версия принимается только если она показывает результат лучше предыдущей на тестовом наборе данных.
- Обратная связь: Отклоненные правки не удаляются, а сохраняются в буфере как негативный пример, чтобы система не повторяла ошибки в будущем.
Важный нюанс: Метод не просто улучшает промпты, а создает переносимый файл навыков, который содержит обобщенную логику работы, а не инструкции, привязанные к конкретной задаче.
Результаты тестирования и переносимость
Эффективность SkillOpt проверялась на шести бенчмарках, включая работу с таблицами (SpreadsheetBench), документами (OfficeQA) и математическими задачами (LiveMathematicianBench). Тесты проводились на семи моделях разного размера: от GPT-5.5 до открытой модели Qwen3.5-4B.
- Универсальность: Метод показал лучший или сопоставимый с лучшим результат во всех 52 ячейках оценки.
- Рост производительности: На примере GPT-5.5 средний балл вырос на 23,5 пункта. На сложных процедурных задачах прирост был еще выше:
- SpreadsheetBench: с 41,8 до 80,7.
- OfficeQA: с 33,1 до 72,1.
- LiveMathematicianBench: с 37,6 до 66,9.
- Перенос между средами: Навык, обученный в одной среде (например, Codex), успешно работал в другой (Claude Code) без дообучения. Перенос навыка по таблицам поднял результат с 22,1 до 81,8 баллов.
Стоит учесть: Оптимизированный навык позволяет маленькой модели GPT-5.4-mini (средний балл 64,3) превзойти более крупную модель GPT-5.4 без навыков (балл 59,7).
Практическая ценность для бизнеса
Финальный результат работы системы — компактный текстовый файл best_skill.md. В отличие от «черного ящика» весов нейросети, этот файл остается читаемым и понятным человеку.
- Компактность: Медианная длина итогового файла составляет около 920 токенов.
- Минимализм: Для достижения значительного прироста часто требуется всего 1–4 принятых правки. Например, рост на 39 баллов в задаче OfficeQA был достигнут одной единственной правкой.
- Аудит: Поскольку файл текстовый и правки ограничены, легко отследить, какое именно изменение улучшило работу агента.
На фоне этого: Компании могут адаптировать агентов под специфические задачи без дорогостоящего дообучения (fine-tuning) моделей, используя лишь автоматическую генерацию и проверку текстовых инструкций.
Операционные последствия и скрытые риски
- Зависимость от верификатора: Метод требует наличия автоматической системы оценки (верификатора), которая может проверить результат выполнения задачи. Без надежного способа проверить, правильно ли агент решил задачу, цикл обучения не сможет отфильтровать плохие правки.
- Сложность внедрения: Для работы системы необходим не только целевой агент, но и отдельная модель-оптимизатор, а также инфраструктура для сбора траекторий и проведения валидации. Это усложняет архитектуру по сравнению с простым использованием промптов.
- Границы применимости: Метод эффективен для процедурных задач, где есть четкий критерий успеха. В задачах, требующих творческого подхода или где результат сложно оценить автоматически, эффективность метода может быть ниже.
- Риск переобучения под тест: Если валидационный набор данных слишком мал или не репрезентативен, система может оптимизировать навыки под конкретные тестовые примеры, а не под реальные рабочие сценарии.
Важно: Технология предлагает альтернативу ручному написанию промптов экспертами, но требует перехода к процессу, где навыки становятся управляемым активом, который можно версионировать и обновлять.
Источник: microsoft.com