Июль 2026   |   В фокусе

Алгоритмы DAPO и GSPO решают проблему нестабильности обучения ИИ на длинных текстах

Современный алгоритм GRPO теряет эффективность при обучении на длинных текстах, вызывая нестабильность и рост вычислительных расходов. Новые методы DAPO и GSPO меняют подход к оптимизации, оценивая не отдельные слова, а целые последовательности, что стабилизирует работу сложных моделей и снижает затраты на инфраструктуру.

В статье от 9 августа 2025 года автор Ихуа Чжан (Yihua Zhang) описывает переход от алгоритма GRPO к новым методам DAPO и GSPO для обучения больших языковых моделей. Основная проблема, которую решают эти обновления, — нестабильность обучения и неэффективность использования вычислительных ресурсов при генерации длинных текстов. Новые подходы меняют принцип оптимизации с уровня отдельных слов на уровень целых последовательностей, что критически важно для архитектур с динамически активируемыми экспертами (MoE).

Важный нюанс: Переход к оптимизации целых последовательностей, а не отдельных токенов, позволяет избежать «шума» при обучении сложных моделей, где выбор экспертов меняется от шага к шагу.

Проблемы текущего стандарта GRPO

Алгоритм GRPO стал популярной альтернативой PPO, так как он отказался от использования отдельной модели оценки (value model), что упростило масштабирование. Однако при работе с длинными ответами и сложными задачами GRPO демонстрирует уязвимости.

  • Потеря сигнала: При генерации длинных ответов вклад каждого отдельного слова в общий градиент становится слишком малым. Ценные корректировки «размываются» среди множества нейтральных токенов.
  • Нестабильность в MoE: В архитектурах, где для каждого запроса активируется разный набор нейронных модулей (экспертов), оценка качества по отдельным токенам приводит к огромным скачкам в расчетах. Это вызывает «коллапс» обучения, когда модель перестает прогрессировать или начинает выдавать бессмыслицу.
  • Неэффективность выборки: Если модель генерирует несколько ответов, которые все либо идеальны, либо полностью ошибочны, алгоритм не получает полезного сигнала для обучения, так как разница в качестве (advantage) равна нулю.

Уточнения в алгоритме DAPO

Метод DAPO сохраняет базовую структуру GRPO, но вносит четыре точечных улучшения для повышения стабильности и скорости обучения.

  1. Clip-Higher (Повышение верхней границы): В классическом GRPO есть жесткое ограничение на то, насколько сильно модель может увеличить вероятность «хорошего» слова. Если старая модель оценивала слово как маловероятное, но оно оказалось полезным, GRPO мог отсечь этот прогресс. DAPO повышает верхнюю границу ограничения, позволяя модели увереннее закреплять удачные решения.
  2. Dynamic Sampling (Динамическая выборка): Алгоритм принудительно требует разнообразия в ответах. Если для одного запроса все сгенерированные варианты получили одинаковую оценку (все 0 или все 1), система генерирует дополнительные варианты, пока не появятся ответы с разной степенью качества. Это гарантирует наличие полезного сигнала для обучения.
  3. Token-Level Gradient Loss (Потери на уровне токенов): Вместо усреднения градиентов внутри каждого ответа отдельно, DAPO усредняет их по всем сгенерированным токенам в пакете. Это выравнивает влияние коротких и длинных ответов: длинный качественный текст теперь вносит вклад в обучение, пропорциональный своей длине, а не размытый до нуля.
  4. Overlong Reward Shaping (Штраф за длину): Вводится мягкое наказание за чрезмерно длинные ответы. Если текст превышает определенный порог, награда за него снижается линейно. Это предотвращает склонность модели к «воду» и повторениям ради получения высокой оценки.

Стоит учесть: Механизм динамической выборки в DAPO устраняет ситуацию, когда модель «застревает» в состоянии, где она либо всегда права, либо всегда ошибается, что делает обучение невозможным.

GSPO: Смена парадигмы для MoE-моделей

Алгоритм GSPO (Group Sequence Policy Optimization) делает фундаментальный шаг, меняя гранулярность оптимизации с токенов на последовательности. Это решение особенно актуально для моделей типа Qwen3, использующих архитектуру MoE.

Вместо того чтобы оценивать и корректировать вероятность каждого слова отдельно, GSPO вычисляет один коэффициент важности для всего сгенерированного ответа.

  • Снижение дисперсии: Поскольку оценка качества (reward) дается за весь ответ, логично и обучение вести на уровне всего ответа. Это устраняет рассинхронизацию между сигналом награды и целью оптимизации.
  • Отказ от Routing Replay: В MoE-моделях традиционные методы требуют фиксации маршрута активации экспертов (Routing Replay) во время обучения, чтобы избежать несоответствий. Это дорого и сложно в реализации. GSPO обходит эту проблему, так как последовательная оптимизация не требует жесткого совпадения активации экспертов на каждом шаге.
  • Стабильность: GSPO демонстрирует более плавное обучение и меньшее количество сбоев, даже если эффективное количество обучаемых токенов снижается из-за более агрессивного отсечения (clipping) целых последовательностей.

На фоне этого: Использование GSPO позволяет обучать сложные MoE-модели без необходимости внедрения дорогостоящих инженерных решений для синхронизации маршрутизации экспертов.

Операционные последствия и тренды

  • Снижение вычислительных затрат: Отказ от сложных механизмов синхронизации (как Routing Replay) в GSPO упрощает инфраструктуру обучения. Это может сократить время подготовки данных и стоимость вычислений для крупных моделей.
  • Улучшение качества длинных ответов: Методы DAPO и GSPO решают проблему «размывания» сигнала в длинных текстах. Для бизнеса это означает, что модели смогут стабильнее выполнять сложные задачи, требующие развернутых рассуждений, без потери качества на длинных отрезках текста.
  • Риск внедрения: Переход на новые алгоритмы требует пересмотра конвейеров обучения (training pipelines). Существующие настройки, оптимизированные под GRPO, могут потребовать значительной доработки, особенно в части настройки параметров клиппинга и штрафов за длину.
  • Тренд на упрощение: Эволюция от PPO к GSPO показывает движение от сложных, многоступенчатых схем к более прямым методам, где цель обучения максимально совпадает с формой оценки результата.

Эти изменения сигнализируют о зрелости методов обучения с подкреплением для ИИ: фокус смещается с поиска «хитрых» трюков на устранение фундаментальных нестыковок между математической моделью и реальными задачами.

Коротко о главном

Как метод DAPO решает проблему отсутствия обучающего сигнала при генерации однотипных ответов?

Алгоритм внедряет механизм динамической выборки, который принудительно генерирует дополнительные варианты ответов, пока не появится различие в их качестве, чтобы обеспечить наличие полезного градиента для обучения.

Почему в алгоритме DAPO изменен способ усреднения градиентов по токенам?

Вместо усреднения внутри каждого ответа отдельно, DAPO усредняет градиенты по всем токенам в пакете, что позволяет длинным качественным текстам вносить вклад в обучение, пропорциональный их длине, вместо размывания сигнала.

Какое фундаментальное изменение вносит алгоритм GSPO в процесс оптимизации?

GSPO меняет уровень оптимизации с отдельных токенов на целые последовательности, вычисляя один коэффициент важности для всего ответа, что устраняет рассинхронизацию между сигналом награды и целью обучения.

Почему переход к GSPO позволяет отказаться от механизма Routing Replay в MoE-моделях?

Последовательная оптимизация в GSPO не требует жесткого совпадения активации экспертов на каждом шаге, что избавляет от необходимости внедрять дорогостоящие инженерные решения для фиксации маршрутов активации.

Как метод DAPO предотвращает генерацию чрезмерно длинных и бессмысленных текстов?

Алгоритм вводит линейное снижение награды за ответы, превышающие определенный порог длины, что создает штраф за «воду» и повторения, побуждая модель к более сжатым и осмысленным ответам.

Какой эффект дает повышение верхней границы ограничения в методе DAPO по сравнению с GRPO?

Увеличение порога клиппинга позволяет модели увереннее закреплять удачные решения, которые в классическом GRPO могли быть отсечены, если старая модель оценивала их как маловероятные.

Какие операционные последствия несет внедрение GSPO для инфраструктуры обучения?

Отказ от сложных механизмов синхронизации упрощает конвейеры обучения и снижает вычислительные затраты, однако требует значительной доработки существующих настроек, оптимизированных под GRPO.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Передовые технологии

Материалы по теме