Июль 2026   |   В фокусе

ИИ переходит к медленному мышлению: стоимость запроса теперь зависит от сложности задачи

Стоимость запроса к ИИ перестала быть фиксированной и теперь напрямую зависит от сложности задачи, что ломает привычные схемы бюджетирования. Бизнесу придется выбирать между скоростью и точностью, закладывая в расходы переменную нагрузку на вычислительные мощности вместо стандартной оплаты за токен.

Индустрия искусственного интеллекта меняет приоритеты: вместо мгновенной генерации ответов модели теперь тратят больше времени и вычислительных ресурсов на поиск решения. Этот подход, известный как test-time compute (вычислительные мощности во время тестирования), стал ответом на успех модели OpenAI o1, которая продемонстрировала, что «медленное» пошаговое рассуждение дает более точные результаты в сложных задачах. Исследователи и компании, включая DeepSeek, NVIDIA и Baidu, активно разрабатывают методы масштабирования этого процесса, чтобы сделать глубокое логическое мышление доступным не только для закрытых систем, но и для открытых моделей.

Важный нюанс: Переход на «медленное мышление» меняет экономику использования ИИ: стоимость запроса теперь напрямую зависит от сложности задачи, а не от размера модели.

Как работает принцип «медленного мышления»

Традиционные модели работают по принципу «системы 1»: они быстры, интуитивны и часто ошибаются в логически сложных вопросах. Новый стандарт, введенный OpenAI o1, опирается на «систему 2» — медленное, осознанное и логическое рассуждение. Модель не выдает ответ сразу, а разбивает задачу на шаги, проверяет гипотезы и только затем формирует финальный вывод.

Ключевые характеристики этого подхода:

  • Динамическое распределение ресурсов: Модель сама решает, сколько времени уделить задаче. Простые вопросы решаются быстро, сложные — требуют больше вычислений.
  • Цепочка рассуждений (Chain-of-Thought): Модель проговаривает каждый шаг решения, что позволяет ей «перепроверять» себя и исправлять ошибки до выдачи ответа.
  • Рост точности: За счет дополнительного времени на анализ модели достигают результатов, недоступных при мгновенной генерации.

Этот сдвиг заставляет разработчиков искать способы эффективно масштабировать вычислительные мощности именно на этапе использования модели (инференса), а не только на этапе обучения.

Методы масштабирования: от DeepSeek до мультимодальности

Разработчики открыли несколько путей для внедрения глубокого мышления в свои модели, часто превосходящих закрытые аналоги.

1. Подход DeepSeek-R1: Обучение через подкреплениеКомпания DeepSeek показала, как сделать мощное рассуждение доступным через открытые модели. Они использовали два основных метода:

  • DeepSeek-R1-Zero: Модель обучалась исключительно методом подкрепления (RL) без заранее размеченных данных. Это позволило ей самостоятельно «открыть» необходимость проверки своих шагов. Точность на математических тестах AIME выросла с 15,6% до 71%, а при использовании голосования нескольких ответов — до 86,7%.
  • Дистилляция: Навыки рассуждения большой модели переносились на маленькие модели (например, Qwen и Llama). Удивительно, но уменьшенные модели (7 млрд параметров) после такой обработки превосходили по точности значительно более крупные аналоги, обученные традиционными методами.

2. Мультимодальность: Когда ИИ смотрит и думаетИсследователи из BAAI, Baichuan AI и других институтов доказали, что способность к «медленному мышлению» можно перенести на модели, работающие с изображениями и текстом (MLLM).

  • Virgo: Система показала, что для обучения мультимодальных моделей достаточно использовать только текстовые примеры сложного рассуждения. Модель Virgo превзошла конкурента QVQ на сложных задачах, достигнув точности 54,7% против 48,6%.
  • CoMCTS (Collective Monte Carlo Tree Search): Метод от Baidu и университетов КНР, где несколько моделей работают вместе, проверяя друг друга. Это позволяет избегать тупиковых логических петель. Модель Mulberry, обученная этим методом, показала прирост точности на 5,7% на математическом бенчмарке MathVista.

Стоит учесть: Заставлять модель долго думать над простыми задачами неэффективно. Исследования показывают, что на легких вопросах «медленные» модели могут показывать худшие результаты, чем быстрые аналоги.

3. Генерация изображений с самопроверкойГруппа исследователей из Shanghai AI Lab и Peking University применила логику пошагового рассуждения к генерации картинок. Они создали модели PARM и PARM++, которые оценивают промежуточные этапы создания изображения.

  • Если картинка не соответствует запросу, система не просто выбрасывает результат, а получает обратную связь и дорабатывает изображение.
  • Это позволило превзойти Stable Diffusion 3 на 15% по качеству генерации.

Интеграция поиска и агентная работа

Фреймворк Search-o1 от Renmin University of China и Tsinghua University решает проблему нехватки знаний у модели. Вместо того чтобы гадать, модель останавливается, формулирует поисковый запрос, находит информацию и только затем продолжает рассуждение.

  • Модуль Reason-in-Documents: Фильтрует найденные данные, чтобы не перегружать модель лишней информацией.
  • Пакетная обработка: Для снижения затрат система объединяет несколько запросов в одну группу, обрабатывая их параллельно.

Это решение значительно повышает качество ответов на вопросы, требующие актуальных данных, но увеличивает вычислительную нагрузку из-за необходимости поиска и анализа внешних документов.

Ограничения и риски внедрения

Несмотря на впечатляющие результаты, масштабирование вычислений во время тестирования несет ряд практических проблем для бизнеса:

  • Непредсказуемая стоимость: Цена одного запроса может сильно варьироваться в зависимости от сложности задачи, что усложняет бюджетирование.
  • Нестабильность задержек: Простые запросы выполняются быстро, а сложные могут занимать много времени, что критично для приложений, требующих мгновенной реакции.
  • Потеря детерминизма: Один и тот же вопрос может получить разный уровень вычислительного внимания в зависимости от нагрузки на систему, что приводит к вариативности ответов.
  • Риск «недообдумывания»: Модель может слишком быстро переключаться между идеями, бросая перспективные пути решения ради других.

Важный нюанс: Внедрение «медленного мышления» требует пересмотра архитектуры систем: от простого API-вызова к сложному управлению бюджетом вычислений и очередей задач.

Практические выводы для бизнеса

Переход к моделям с расширенным временем размышления меняет подход к внедрению ИИ в компании.

  • Выбор модели под задачу: Для рутинных операций (классификация, простой чат) остаются быстрые модели. Для сложных аналитических задач, программирования и работы с данными требуются модели с поддержкой test-time compute.
  • Инфраструктурные требования: Компаниям придется закладывать в бюджет не фиксированную стоимость токена, а переменную нагрузку на GPU, зависящую от сложности запросов пользователей.
  • Оптимизация через дистилляцию: Использование малых моделей, «наученных» большим моделям (как в случае с DeepSeek), позволяет получить высокое качество рассуждений при меньших затратах на инфраструктуру.
  • Развитие агентов: Интеграция с внешними источниками данных (поиск, базы знаний) становится стандартом для сложных задач, требуя внедрения механизмов фильтрации информации.

Технология test-time compute не просто улучшает точность ответов, она меняет саму парадигму взаимодействия с ИИ: от получения мгновенного результата к получению гарантированно верного решения через процесс анализа.

Коротко о главном

На сколько процентов выросла точность модели DeepSeek-R1-Zero на тестах AIME?

Точность модели увеличилась с 15,6% до 71% благодаря обучению исключительно методом подкрепления без заранее размеченных данных. При использовании механизма голосования нескольких ответов результат достиг 86,7%, что позволило модели самостоятельно осознать необходимость проверки своих шагов.

Как метод дистилляции позволяет малым моделям превосходить крупные аналоги?

Навыки рассуждения больших моделей переносятся на малые версии (например, 7 млрд параметров) через процесс дистилляции, что позволяет им обгонять значительно более крупные системы, обученные традиционными методами. Это дает возможность получать высокое качество логического мышления при меньших затратах на инфраструктуру.

Какой прирост точности показала система Mulberry благодаря методу CoMCTS?

Модель Mulberry достигла роста точности на 5,7% на математическом бенчмарке MathVista, так как метод CoMCTS от Baidu позволяет нескольким моделям работать совместно и проверять друг друга. Это взаимодействие помогает избегать тупиковых логических петель, характерных для одиночных систем.

Почему модели PARM и PARM++ превзошли Stable Diffusion 3 на 15%?

Исследователи применили логику пошагового рассуждения к генерации изображений, внедрив механизм самопроверки промежуточных этапов создания картинки. Если результат не соответствует запросу, система получает обратную связь и дорабатывает изображение, вместо того чтобы просто выбрасывать неудачный вариант.

Как фреймворк Search-o1 решает проблему нехватки актуальных знаний у ИИ?

Вместо того чтобы полагаться на внутреннюю базу данных, модель останавливает генерацию, формулирует поисковый запрос и анализирует найденную информацию перед формированием ответа. Для снижения затрат система использует пакетную обработку запросов и фильтрует лишние данные через модуль Reason-in-Documents.

Почему внедрение «медленного мышления» создает проблемы с бюджетированием для бизнеса?

Стоимость одного запроса становится непредсказуемой, так как она напрямую зависит от сложности задачи и времени, затраченного моделью на размышления. Это требует от компаний перехода от фиксированной оплаты за токен к управлению переменной нагрузкой на GPU и сложным очередям задач.

В каких сценариях «медленные» модели могут показывать худшие результаты, чем быстрые аналоги?

На простых вопросах заставляя модель долго думать, можно получить менее качественный ответ, так как исследования показывают неэффективность избыточного анализа для рутинных задач. Поэтому для классификации и простого чата остаются актуальными быстрые модели, работающие по принципу «системы 1».

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Управление и стратегия; Передовые технологии

Материалы по теме