Июль 2026   |   В фокусе

Intel ускорил Qwen3.6 на Core Ultra Series 3: локальный ИИ генерирует код в 2,2 раза быстрее

Технология DFlash от Intel ускорила генерацию кода сложной моделью Qwen3.6 на ноутбуках в 2,2 раза, достигнув 90 токенов в секунду. Это позволяет запускать мощные искусственные интеллекты локально, устраняя зависимость бизнеса от облачных серверов и снижая операционные расходы.

Компания Intel представила результаты тестов по ускорению работы модели Qwen3.6-35B-A3B на портативных компьютерах с процессорами серии Core Ultra Series 3 (архитектура Panther Lake). Для этого была применена технология спекулятивного декодирования DFlash в связке с фреймворком OpenVINO. В ходе экспериментов скорость генерации кода выросла в 2,2 раза, достигнув 90 токенов в секунду. Это позволяет запускать сложные модели с архитектурой «смесь экспертов» (MoE) непосредственно на ноутбуках, снижая зависимость от облачных серверов.

Ключевой момент: Архитектура MoE, которая обычно экономит ресурсы, парадоксальным образом затрудняет ускорение стандартными методами, так как проверка нескольких токенов сразу требует загрузки большего количества специализированных подсетей. Технология DFlash решает эту проблему, предлагая блоки токенов параллельно, что критически важно для сохранения эффективности на устройствах с ограниченной памятью.

Технические детали и результаты тестирования

Модель Qwen3.6-35B-A3B относится к типу MoE (Mixture-of-Experts). В ней каждый слой содержит несколько специализированных подсетей, и для каждого слова выбирается только нужная часть. Это снижает затраты памяти, но создает сложности при ускорении: если система пытается проверить сразу несколько предсказанных слов, ей приходится активировать множество разных «экспертов», что резко увеличивает нагрузку.

Технология DFlash меняет подход к генерации. Вместо того чтобы предлагать токены по одному, она формирует короткий блок предсказаний параллельно, опираясь на внутренние состояния основной модели. Это позволяет обойти ограничение по загрузке экспертов. Тесты проводились на ноутбуке с процессором Intel Core Ultra X7 368H и встроенной графикой Intel Arc B390.

Результаты ускорения на трех стандартных бенчмарках:

  • HumanEval (кодирование): Скорость выросла с 41 до 89,8 токенов/с (ускорение 2,2x). Средний размер принятого блока составил 6,4 токена.
  • GSM8K (математика): Скорость достигла 68,5 токенов/с (ускорение 1,6x). Принято в среднем 5,0 токенов.
  • MT-Bench (чат): Скорость составила 54,7 токенов/с (ускорение 1,3x). Принято в среднем 4,0 токена.

Высокий прирост в задачах с четкой структурой (код и математика) объясняется тем, что алгоритм легче предсказывает последовательности с предсказуемыми паттернами. В свободном диалоге предсказать длинную цепочку слов сложнее, поэтому ускорение ниже.

Сравнение с другими моделями семейства Qwen

Технология DFlash работает не только с моделью 35B-A3B, но и с плотными (dense) моделями семейства Qwen, где эффект ускорения оказывается еще выше, так как там нет проблемы переключения между экспертами.

МодельТестСкорость (токенов/с)Ускорение
Qwen3.6-27BHumanEval38,35,5x
Qwen3.6-27BGSM8K28,44,0x
Qwen3.5-9BHumanEval76,03,3x
Qwen3.5-9BGSM8K70,63,4x

Разработчики получили возможность выбирать баланс между качеством, скоростью и потреблением памяти:

  • Qwen3.5-9B занимает мало памяти и генерирует текст быстро, но уступает в качестве ответов.
  • Qwen3.6-27B требует больше ресурсов и работает медленнее, но обеспечивает качество, сопоставимое с гораздо более крупными моделями.

Важный нюанс: Текущая версия пайплайна DFlash поддерживает только текстовые запросы, обработку одного запроса за раз и жадное выборочное сэмплирование. Поддержка кэширования префиксов и мультимодальных данных запланирована в будущих обновлениях OpenVINO.GenAI.

Операционные последствия и практические аспекты

  • Расширение возможностей локального ИИ: Внедрение DFlash делает запуск тяжелых моделей MoE на ноутбуках технически осуществимым без потери производительности. Это открывает путь к созданию автономных ИИ-агентов, работающих без постоянного подключения к интернету.
  • Зависимость от аппаратного обеспечения: Высокая производительность достигнута на конкретном железе (Intel Panther Lake с графикой Arc). Для достижения аналогичных результатов на других устройствах потребуются специализированные драйверы и поддержка фреймворка OpenVINO.
  • Ограничения текущего ПО: Отсутствие поддержки мультимодальности (изображения, аудио) и параллельной обработки нескольких запросов ограничивает сценарии использования в текущем виде. Бизнесу придется ждать обновлений для развертывания полноценных мультимодальных сервисов на клиентских устройствах.
  • Выбор модели под задачу: Разработчикам теперь нужно взвешенно подходить к выбору модели. Для задач, где критична скорость и низкое потребление памяти (например, мобильные приложения), подойдет Qwen3.5-9B. Для сложных аналитических задач, где важна точность, лучше выбрать Qwen3.6-27B или 35B-A3B, приняв компромисс в скорости.

Код реализации и поддержка DFlash будут доступны в ближайших релизах библиотеки OpenVINO.GenAI.

Коротко о главном

Почему стандартные методы ускорения неэффективны для моделей архитектуры «смесь экспертов» (MoE)?

При проверке нескольких токенов сразу система вынуждена загружать множество специализированных подсетей, что резко увеличивает нагрузку на память и процессор. Технология DFlash решает эту проблему, предлагая блоки токенов параллельно, вместо последовательной активации экспертов.

На каком конкретном оборудовании были получены результаты тестирования?

Эксперименты проводились на ноутбуке с процессором Intel Core Ultra X7 368H и встроенной графикой Intel Arc B390, входящими в архитектуру Panther Lake.

Почему ускорение в задачах по генерации кода и математике выше, чем в свободном диалоге?

Алгоритм DFlash эффективнее предсказывает последовательности с четкими паттернами, что привело к ускорению в 2,2 раза на бенчмарке HumanEval и в 1,6 раза на GSM8K, тогда как в менее структурированном чате (MT-Bench) прирост составил лишь 1,3 раза.

Какое максимальное ускорение показала технология DFlash на плотных моделях семейства Qwen?

На модели Qwen3.6-27B в тесте HumanEval было достигнуто ускорение в 5,5 раза, так как отсутствие переключения между экспертами упрощает процесс параллельной генерации блоков.

Какие ограничения накладываются на текущую версию пайплайна DFlash?

Программа поддерживает только текстовые запросы и обработку одного запроса за раз, что исключает возможность использования мультимодальных данных и параллельных вычислений до выхода будущих обновлений.

Какую модель следует выбрать для задач с критичным потреблением памяти?

Для сценариев, где важна скорость и низкое потребление ресурсов, разработчикам рекомендуется использовать модель Qwen3.5-9B, которая работает быстрее, но уступает более крупным аналогам в качестве ответов.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Устройства и гаджеты

Материалы по теме