Агенты кода тратят 80 минут и $730 из-за устаревших знаний при развертывании ИИ
Агенты кода тратят 80 минут и сотни долларов на исправление ошибок при развертывании новых моделей из-за устаревших баз знаний. Внедрение внешних модулей навыков устраняет эти убытки, заставляя систему использовать актуальные инструкции вместо догадок.
Компания Hugging Face провела эксперимент, поручив популярному агенту Claude Code развернуть модели искусственного интеллекта на платформе Amazon SageMaker. Без дополнительных инструкций агент успешно запустил старую модель, но потратил 80 минут на исправление ошибок и создал нерабочую документацию. При попытке развернуть модель, вышедшую менее месяца назад, агент выдал уверенный, но технически неверный скрипт, выбрав неподходящий серверный контейнер. Проблема не в логике модели, а в том, что её база знаний устаревает быстрее, чем меняются технологии развертывания.
Важный нюанс: Чем новее модель или технология, тем выше риск ошибки агента, так как его обучение опирается на данные, которые могут не содержать актуальных инструкций по новым архитектурам.
Разрыв между обучением и реальностью
В ходе теста агент сталкивался с двумя типичными сценариями, демонстрирующими критическую зависимость от актуальности данных. В первом случае агент развернул модель Qwen/Qwen3-0.6B, которая находится в реестре с апреля 2025 года. Итоговый сервис заработал, но путь к успеху был извилистым. Агент изначально выбрал сервер TGI (Text Generation Inference), который на момент написания статьи уже архивирован и не поддерживает архитектуру Qwen3.
Процесс развертывания превратился в серию проб и ошибок:
- Агент пытался обновить версию TGI, но сервер продолжал проваливать проверки здоровья.
- Только после четырех неудачных попыток и 80 минут работы (с оплатой времени использования GPU) система переключилась на корректный контейнер vLLM.
- Документация, которую сгенерировал агент, содержала устаревшие рекомендации: указывалось использование TGI и Python 3.13, хотя в реальности проект работал на vLLM и требовал более старых версий интерпретатора.
Второй тест с моделью google/diffusiongemma-26B-A4B-it, выпущенной в июне 2026 года, показал еще более опасную ситуацию. Агент не допустил явной ошибки запуска, но создал скрипт, который использовал контейнер для текстовых моделей для задачи генерации изображений. Ошибка была скрытой: система не выдала критического сбоя сразу, но развертывание было бы невозможно без ручного вмешательства.
Стоит учесть: Агент не «не понимает» задачу, он действует на основе усредненных данных. Если в обучающей выборке преобладают старые туториалы, агент будет уверенно предлагать устаревшие решения, даже если они больше не работают.
Решение через модульные навыки (Skills)
Чтобы устранить проблему, авторы эксперимента внедрили систему Skills — набор внешних файлов с инструкциями, которые загружаются агентом по мере необходимости. Вместо того чтобы полагаться на «память» модели, агент получает актуальные правила из версионного контроля. Это позволило полностью изменить результат работы того же самого агента.
Второй запуск с подключенными навыками прошел без сбоев:
- Выбор контейнера: Агент сразу определил, что для Qwen3 требуется vLLM, и получил актуальный URI образа из каталога AWS, минуя устаревшие данные.
- Управление доступом: При ошибке доступа к реестру образов (ECR) из-за ограничений прав роли SSO, агент не остановился, а использовал заготовленный запасной вариант (fallback) из навыков.
- Производственные стандарты: Развернутый сервис сразу получил настройки автоскейлинга (от 1 до 2 инстансов), три аларма мониторинга (задержка, ошибки, нагрузка) и скрипт для полной очистки ресурсов после завершения работы.
- Контроль качества: Агент провел тестовый запрос, заметил, что ответ был обрезан из-за лимита токенов в режиме рассуждений, и предупредил об этом, вместо того чтобы просто зафиксировать успешный запуск.
Ключевые навыки, использованные в эксперименте:
sagemaker-deployment-planner: Выбор пути развертывания (реальное время, асинхронный, пакетный).aws-context-discovery: Автоматическое определение региона, аккаунта и профиля.serving-image-selection: Выбор правильного контейнера (vLLM, TEI, SGLang) и получение актуального URI.sagemaker-production-defaults: Настройка автоскейлинга, алармов и тегов по умолчанию.
Важный нюанс: Использование внешних файлов навыков позволяет обновлять правила развертывания в одном месте, не дожидаясь переобучения самой модели. Это превращает агент из «творца» в исполнителя актуальных процедур.
Операционные последствия, тренды и практические аспекты
- Снижение финансовых рисков: Без явных инструкций агент может создавать «вечные» инстансы без автоскейлинга. Например, инстанс
ml.g5.xlargeстоит около $730 в месяц при круглосуточной работе. Внедрение навыков с настройкой автоскейлинга и скриптов очистки предотвращает ненужные расходы на простаивающие ресурсы. - Техническая долговечность кода: Скрипты, сгенерированные без актуальных знаний, часто содержат ссылки на устаревшие версии библиотек (например, Python 3.13 для ML-стека) или архивированные серверы. Использование внешних навыков гарантирует, что код будет работать с текущими версиями зависимостей.
- Обработка исключений: Агенты, оснащенные навыками, способны корректно обрабатывать ошибки доступа (например, отказ в правах на чтение реестра образов), используя заранее определенные стратегии отката, вместо того чтобы прерывать выполнение.
- Адаптация к новым архитектурам: При появлении новых типов моделей (например, микс-экспертов или диффузионных моделей) навыки позволяют мгновенно обновить правила выбора контейнера, не требуя изменения логики самого агента.
На фоне этого: Переход от «умных» агентов к агентам с «актуальными знаниями» становится критическим фактором для промышленного внедрения ИИ, так как скорость устаревания инструкций опережает скорость обновления весов моделей.
Источник: huggingface.co