Июль 2026   |   В фокусе

Diffusers и Nunchaku Lite: запуск тяжелых моделей на потребительских GPU с ускорением до 1.8 раза

Запуск тяжелых диффузионных моделей на обычных видеокартах стал реальностью: новая технология сжимает данные до 4 бит, сокращая потребление видеопамяти на 50%. Это позволяет бизнесу генерировать изображения в 1,8 раза быстрее без затрат на дорогое серверное оборудование.

Библиотека Diffusers получила нативную поддержку движка Nunchaku Lite, что позволяет запускать тяжелые диффузионные модели на потребительских видеокартах с минимальными затратами памяти. Технология SVDQuant сжимает не только веса, но и активации модели до 4 бит, сокращая пиковое потребление видеопамяти (VRAM) до 50% и ускоряя генерацию изображений. Теперь загрузка квантованных чекпоинтов происходит стандартной командой from_pretrained(), без необходимости компилировать ядра или использовать сторонние движки.

Важный нюанс: В отличие от предыдущих методов квантования, которые лишь экономили память, Nunchaku Lite ускоряет сам процесс генерации, так как работает с данными низкой точности на протяжении всего цикла шумоподавления.

Как работает ускорение и экономия памяти

Традиционные методы квантования часто сохраняют веса в низком разрешении, но при вычислениях возвращают их к высокой точности. Это экономит место на видеокарте, но не всегда ускоряет работу. Подход SVDQuant, лежащий в основе Nunchaku, решает проблему иначе: он переносит «выбросы» данных из активаций в веса, оставляя основную часть матрицы в формате 4 бита. Это позволяет выполнять вычисления быстрее и с меньшим потреблением ресурсов.

Интеграция Nunchaku Lite в Diffusers упростила процесс:

  • Отсутствие компиляции: Ядра скачиваются автоматически при первом запуске через пакет kernels.
  • Универсальность: Работает с различными архитектурами без написания кастомных пайплайнов.
  • Гибкость: Поддерживает разные форматы точности в зависимости от поколения видеокарты.

Для видеокарт серии Blackwell (RTX 50, RTX PRO 6000, B200) используется формат NVFP4, обеспечивающий максимальную скорость. Для более старых карт (Turing, Ampere, Ada — серии RTX 30 и 40, A100, L40S) доступны варианты INT4. Видеокарты серий Volta и Hopper пока не поддерживаются ядрами 4-битной точности.

Стоит учесть: Без специфических оптимизаций под конкретную архитектуру (фьюзинг слоев), которые есть в полном движке Nunchaku, версия Lite обеспечивает прирост скорости около 30%, сохраняя при этом тот же уровень экономии памяти.

Результаты тестирования и совместимость

Бенчмарки на видеокарте NVIDIA RTX PRO 6000 (архитектура Blackwell) демонстрируют значительный выигрыш при генерации изображений размером 1024x1024. Сравнение показывает, что использование Nunchaku Lite снижает пиковое потребление VRAM с 31.1 ГБ до 20.6 ГБ (в базовом режиме) и до 16.0 ГБ при дополнительном сжатии текстового энкодера.

КонфигурацияВремя полного пайплайнаВремя цикла шумоподавленияПиковая VRAMУскорение
Базовая (BF16)3.00 с2.86 с31.1 ГБ1.0x
Nunchaku Lite (NVFP4)2.27 с2.13 с20.6 ГБ1.35x
Nunchaku Lite + torch.compile1.68 с1.53 с20.6 ГБ1.8x
Nunchaku Lite + NF4 текстовый энкодер2.29 с2.13 с16.0 ГБ1.35x

Комбинация Nunchaku Lite с инструментом компиляции torch.compile позволяет достичь ускорения в 1.8 раза по сравнению с исходной моделью. Дополнительное квантование текстового энкодера (например, T5 или Qwen3) методом bitsandbytes NF4 снижает потребление памяти еще на 22%.

Создание и квантование собственных моделей

Разработчики могут самостоятельно квантовать новые архитектуры с помощью набора инструментов diffuse-compressor. Процесс включает калибровку, квантование трансформера, упаковку в пайплайн Diffusers и публикацию на Hub.

Основные этапы работы с инструментом:

  1. Анализ: Сканер определяет, какие линейные слои подходят для метода SVDQ (внимание и MLP), а какие требуют AWQ (нормализация и модуляция).
  2. Квантование: Запуск скрипта с указанием точности (int4 или nvfp4) и ранга матрицы.
  3. Упаковка: Объединение квантованного трансформера с остальными компонентами пайплайна и создание конфигурационного файла.
  4. Публикация: Проверка качества генерации и загрузка модели в репозиторий.

Важный нюанс: Для достижения максимальной скорости в оригинальном движке Nunchaku используются структурные переписывания кода (например, объединение слоев Q, K и V в один модуль). Стандартный путь в Diffusers не делает этого автоматически, что требует использования специальных конфигураций для сложных архитектур.

Операционные последствия и практические аспекты

  • Зависимость от железа: Использование формата NVFP4 требует видеокарт архитектуры Blackwell. Пользователи с картами предыдущих поколений вынуждены использовать формат INT4, который может быть чуть медленнее, но обеспечивает широкую совместимость.
  • Сложность настройки: Хотя базовая загрузка упрощена, квантование собственных моделей с сохранением структурных оптимизаций (фьюзинг слоев) требует глубокого понимания архитектуры и использования специфических конфигов.
  • Экономия ресурсов: Снижение требований к VRAM позволяет запускать крупные модели (например, FLUX.2 Klein 4B) на потребительском оборудовании, ранее не способном их обработать в режиме реального времени.
  • Качество вывода: Тесты показывают, что визуальное качество изображений при квантовании 4 бит практически не отличается от исходного формата BF16 при использовании одинаковых параметров генерации.

В настоящее время доступны готовые чекпоинты для моделей ERNIE-Image-Turbo и Krea 2 Turbo, а также коллекция от сообщества lite-infer, что позволяет начать работу без необходимости самостоятельного квантования.

Коротко о главном

Почему Nunchaku Lite ускоряет генерацию изображений в отличие от традиционного квантования?

В отличие от методов, возвращающих данные к высокой точности при вычислениях, Nunchaku Lite переносит «выбросы» данных в веса и выполняет весь цикл шумоподавления в формате 4 бит, что обеспечивает прирост скорости около 30%.

Какое максимальное ускорение достигается при комбинации Nunchaku Lite с torch.compile?

На видеокарте архитектуры Blackwell использование инструмента компиляции вместе с движком снижает время полного пайплайна с 3.00 до 1.68 секунды, обеспечивая ускорение в 1.8 раза по сравнению с базовой моделью BF16.

Какие видеокарты поддерживают формат NVFP4 для максимальной скорости?

Формат NVFP4 доступен только для видеокарт серии Blackwell (RTX 50, RTX PRO 6000, B200), тогда как более старые архитектуры (Turing, Ampere, Ada) вынуждены использовать формат INT4, который работает чуть медленнее.

Как дополнительное квантование текстового энкодера влияет на потребление памяти?

Применение метода bitsandbytes NF4 к текстовым энкодерам (например, T5 или Qwen3) снижает пиковое потребление VRAM еще на 22%, уменьшая его с 20.6 до 16.0 ГБ на примере карты RTX PRO 6000.

Какие этапы включает процесс самостоятельного квантования моделей с помощью diffuse-compressor?

Инструмент автоматически анализирует слои, определяя применение SVDQ для внимания и MLP, а AWQ для нормализации, после чего упаковывает квантованный трансформер в пайплайн Diffusers для публикации.

Какие готовые модели уже доступны для работы с Nunchaku Lite без самостоятельного квантования?

Пользователи могут сразу использовать чекпоинты моделей ERNIE-Image-Turbo и Krea 2 Turbo, а также коллекцию от сообщества lite-infer, что исключает необходимость запуска скриптов квантования.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Устройства и гаджеты

Материалы по теме