Сентябрь 2026   |   В фокусе

Скорость генерации уступает полезной работе при выборе ИИ-агентов

Скорость генерации текста у ИИ-агентов часто обманчива: медленная, но точная модель может проигрывать быстрой из-за того, что последняя быстрее исправляет ошибки на основе внешней обратной связи. Это меняет подход к выбору нейросетей — для задач с четкой проверкой (например, код) важнее итеративность, а не «сырой» интеллект.

В индустрии больших языковых моделей (LLM) доминирует гонка за двумя показателями: «умом» и скоростью ответа. Однако для автономных агентов, которые пишут код или управляют инструментами, эти метрики часто вводят в заблуждение. Как отмечает Сонни ДеСорбо (Sonny DeSorbo) в статье на Hacker News, ключевой вопрос не в том, какая модель умнее или быстрее, а в том, какая из них достигает верного результата за минимальное время. Это меняет подход к выбору архитектур и квантизации моделей: медленная, но точная модель может проигрывать быстрой, которая совершает много ошибок, но быстро их исправляет благодаря обратной связи от среды.

Интеллект против скорости: расчет времени на успех

Традиционные бенчмарки измеряют точность в изоляции или токены в секунду. Но для агента важнее метрика «ожидаемое время до успеха». Она рассчитывается как отношение времени на одну попытку к вероятности успеха.

Рассмотрим два сценария из статьи:

  • Модель А (быстрая, но менее точная): Тратит 20 секунд на попытку и решает задачу в 60% случаев. Ожидаемое время до успеха: $20 / 0.60 = 33.3$ секунды.
  • Модель Б (медленная, более точная): Тратит 60 секунд на попытку и решает задачу в 90% случаев. Ожидаемое время до успеха: $60 / 0.90 = 66.7$ секунды.

Несмотря на то что Модель Б «умнее», она вдвое медленнее достигает результата. Это происходит потому, что быстрая модель может совершить несколько итераций за время одной попытки медленной. Если среда дает четкую обратную связь (ошибки компилятора, упавшие тесты), агент учится на провалах. Первая неудача не обнуляет процесс: агент читает ошибку, меняет подход и продолжает работу.

Для автономных систем критична не разовая точность, а способность превращать ошибку в информацию. Если среда предоставляет дешевую объективную обратную связь, скорость итераций становится важнее «сырого» интеллекта модели.

Квантизация: когда снижение качества оправдано скоростью

Проблема выбора между качеством и скоростью особенно заметна при квантизации моделей (сжатии весов для ускорения работы). На примере семейства Qwen автор сравнивает Qwen3.8-27B (плотная модель, высокая точность) и Qwen3.5-35B-A3B (архитектура MoE, активирует только 3 млрд параметров на токен, очень быстрая).

Также сравниваются варианты квантизации одной модели:

  • Q4_K_M: Ниже точность, меньше потребление памяти, выше скорость генерации.
  • Q5_K_M: Выше точность, больше потребление памяти, ниже скорость.

Для задач, где ошибка легко обнаруживается (например, синтаксическая ошибка в коде), быстрая квантизация Q4 может быть выгоднее: агент быстро получает ошибку и быстро чинит код. Однако для сложных архитектурных решений или задач без автоматической проверки (математика, логика) высокая точность Q5 критична. Ошибка здесь не видна сразу и приводит к каскаду сбоев, требующих много времени на отладку.

В статье приводится правило «точки безубыточности»: если быстрая версия (Q4) работает в 1.25 раза быстрее медленной (Q5), она может позволить себе терять до 20% точности и все равно быть эффективнее по времени. Если же разница в скорости мала, лучше выбрать более точную версию.

Предложенный бенчмарк: Persistent Challenge Completion (PCC)

Автор предлагает новый стандарт оценки — Persistent Challenge Completion. В отличие от статичных тестов, где модель отвечает один раз, этот протокол требует от агента продолжать работу до тех пор, пока задача не будет решена или не закончится время.

Ключевые принципы PCC:

  • Объективная валидация: Успех определяется не мнением модели, а внешним проверяющим (прохождением тестов, компиляцией, сверкой данных).
  • Фиксированный тайм-бюджет: Модели дается ограниченное время. Быстрые модели могут позволить себе больше попыток, медленные — более глубокое размышление над каждой.
  • Метрика VWS (Validated Work per Second): Количество успешно завершенных задач, деленное на общее затраченное время.

Бенчмарк должен отслеживать не только финальный результат, но и динамику:

  1. Успех с первой попытки.
  2. Способность восстанавливаться после ошибок (Recovery Quality).
  3. Эффективность прогресса: уменьшается ли количество ошибок с каждой итерацией или агент зацикливается на одном и том же.

Практические выводы для выбора модели

Выбор конфигурации ИИ-агента должен базироваться на природе задач, а не на абстрактных рейтингах «умности».

  • Для интерактивных задач с четкой обратной связью (написание кода, отладка): Приоритет — скорость. Быстрая модель с умеренной точностью сможет совершить больше итераций и быстрее найти решение, используя ошибки как навигацию.
  • Для задач без внешней проверки (аналитика, стратегическое планирование, математика): Приоритет — точность. Здесь цена ошибки максимальна, так как агент не поймет, что ошибся, до конца процесса. Медленная, но надежная модель выигрывает.
  • Для длинных цепочек действий: Каскадные эффекты ошибок делают надежность важнее скорости. Небольшое снижение точности на каждом шаге ведет к экспоненциальному росту вероятности провала всей цепочки.

В экосистеме ИИ-агентов побеждает не самая умная или самая быстрая модель, а та конфигурация, которая максимизирует количество проверенных правильных действий в единицу времени. Скорость ценна, только если она позволяет эффективно использовать обратную связь; точность критична, когда ошибка невидима для системы контроля.

Когда фактов слишком много нужна система

Асектор превращает поток новостей в понятную картину: что произошло, на что это влияет и чем может обернуться. Без шума. С доказательной базой.

Коротко о главном

Почему в сравнении моделей А и Б более «умная» Модель Б оказалась вдвое медленнее?

Модель Б тратит 60 секунд на попытку с вероятностью успеха 90%, что дает ожидаемое время 66,7 секунды, тогда как быстрая Модель А (20 секунд, 60% успеха) достигает результата за 33,3 секунды. Разница возникает из-за способности быстрого агента быстро получать и обрабатывать ошибки компилятора или упавших тестов.

Как правило «точки безубыточности» влияет на выбор между квантизациями Q4_K_M и Q5_K_M?

Если быстрая версия (Q4) работает в 1,25 раза быстрее медленной (Q5), она может допускать потерю до 20% точности, оставаясь более эффективной по времени. Однако при малой разнице в скорости предпочтение отдается более точной версии, так как цена ошибки становится выше выигрыша во времени.

В каких случаях квантизация Q4_K_M оказывается выгоднее Q5_K_M?

Быстрая квантизация Q4 предпочтительна для задач с легко обнаруживаемыми ошибками, например, синтаксическими в коде, где агент быстро получает обратную связь и исправляет баги. Напротив, для сложных архитектурных решений или математики без автоматической проверки критична высокая точность Q5, поскольку невидимая ошибка приводит к каскаду сбоев.

Чем протокол Persistent Challenge Completion (PCC) отличается от статичных тестов?

В отличие от разовых ответов, PCC требует от агента продолжать работу до полного решения задачи или исчерпания тайм-бюджета. Успех валидируется внешними факторами (прохождение тестов, компиляция), а не субъективным мнением модели.

Что измеряет метрика VWS (Validated Work per Second) в рамках бенчмарка PCC?

Mетрика рассчитывается как количество успешно завершенных задач, деленное на общее затраченное время. Она позволяет оценить реальную продуктивность системы с учетом времени, потраченного на итерации и отладку, а не только финальный результат.

Почему для длинных цепочек действий надежность важнее скорости?

В многоступенчатых процессах небольшое снижение точности на каждом шаге приводит к экспоненциальному росту вероятности провала всей цепочки. Каскадные эффекты ошибок делают критичным минимизацию риска сбоя, даже если это требует замедления работы агента.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI)

Материалы по теме