Июнь 2026   |   В фокусе

Google DeepMind и NVIDIA ускорили генерацию текста в 4 раза на локальных ПК

Скорость генерации текста выросла в четыре раза за счет перехода от последовательного подбора слов к параллельной выработке блоков, что меняет профиль нагрузки с памяти на вычислительную мощность. Локальное развертывание тяжелых моделей теперь требует оборудования последнего поколения, иначе бизнес столкнется с необходимостью пересмотра архитектуры инфраструктуры и роста капитальных затрат.

Google DeepMind представила экспериментальную модель DiffusionGemma, которая меняет подход к созданию текста: вместо последовательного подбора слов она формирует целые блоки сразу. NVIDIA оптимизировала алгоритм для работы на своих видеокартах, что позволяет ускорить генерацию в 4 раза по сравнению с традиционными методами. Это решение ориентировано на локальное использование: модель работает на персональных компьютерах и рабочих станциях без отправки данных в облако, устраняя задержки и плату за токены.

Важный нюанс: Смена архитектуры с последовательной на параллельную генерацию превращает задачу из ограниченной пропускной способностью памяти в вычислительно интенсивную, что идеально совпадает с сильными сторонами современных видеокарт.

Принципы работы и технические характеристики

Традиционные большие языковые модели (LLM) работают по автогрессивному принципу: каждое следующее слово зависит от предыдущего, что создает эффект «печатающей машинки» и ограничивает скорость. DiffusionGemma использует диффузионный подход, аналогичный генерации изображений: система начинает с шума и за один шаг уточняет сразу 256 токенов.

Модель построена на базе архитектуры Gemma 4 с 26 миллиардами параметров, но в каждом шаге активирует лишь 3,8 миллиарда. Это обеспечивает баланс между качеством и скоростью. Лицензия Apache 2.0 делает веса модели открытыми, позволяя разработчикам использовать их без ограничений.

Ключевые технические показатели:

  • Параллельная генерация: Обработка до 256 токенов за один шаг вместо одного.
  • Скорость на H100: До 1000 токенов в секунду на одной видеокарте.
  • Скорость на DGX Station: До 2000 токенов в секунду.
  • Скорость на DGX Spark: 150 токенов в секунду.
  • Поддержка: Работает в библиотеках Hugging Face Transformers, vLLM и Unsloth с первого дня выпуска.

Стоит учесть: Ускорение достигается за счет того, что видеокарты загружаются вычислениями на полную мощность, вместо того чтобы простаивать в ожидании данных из памяти, как это происходит при классической генерации.

Аппаратная совместимость и локальное развертывание

Оптимизация NVIDIA позволяет запускать модель на широком спектре оборудования, от персональных ПК до профессиональных станций. Это открывает возможности для создания автономных агентов и интерактивных чатов с минимальной задержкой.

Поддерживаемые платформы:

  • NVIDIA DGX Spark: Персональный ИИ-суперкомпьютер на чипе GB10 Grace Blackwell с 128 ГБ объединенной памяти. Предназначен для прототипирования и локальных агентов.
  • NVIDIA RTX PRO 6000: Рабочая станция для профессионалов, обеспечивающая низкую задержку в рабочих процессах.
  • NVIDIA DGX Station: Система с 748 ГБ когерентной памяти для высокопроизводительного инференса.
  • NVIDIA GeForce RTX: Поддержка через llama.cpp ожидается в ближайшее время.

Для быстрого старта разработчикам доступны готовые сценарии (playbooks) для настройки окружения на DGX Spark, RTX PRO и DGX Station. Тестирование доступно бесплатно через API на платформе build.nvidia.com или напрямую через Hugging Face.

На фоне этого: Локальное выполнение тяжелых моделей становится реальностью для индивидуальных разработчиков, что снижает зависимость от облачных провайдеров и сокращает операционные расходы на обработку данных.

Дополнительные обновления экосистемы RTX AI Garage

Помимо DiffusionGemma, NVIDIA анонсировала ряд инструментов для расширения возможностей локальных ИИ-агентов и генерации видео.

  • SANA-WM: Открытая модель мира, превращающая одно изображение и траекторию камеры в видео длительностью 1 минуту в разрешении 720p. Упрощенная версия с 2,6 миллиарда параметров генерирует 60-секундный ролик за 34 секунды на одной видеокарте GeForce RTX 5090, обеспечивая прирост производительности в 36 раз по сравнению с аналогами.
  • Агенты для Windows: Совместно с Microsoft внедрена среда изоляции (sandboxing) на базе Microsoft eXecution Containers и рантайма NVIDIA OpenShell. Это упрощает создание агентов, работающих нативно в Windows, и ускоряет их выполнение в 2 раза.
  • NemoClaw: Упрощенная установка для DGX Spark, позволяющая запускать локального агента с моделью Qwen3.6-35B в 2,6 раза быстрее.
  • Кластеризация: Новый ассистент в NVIDIA Sync объединяет до четырех устройств DGX Spark в единый пул памяти объемом 512 ГБ, достаточный для моделей с параметрами до 400 миллиардов.

Операционные последствия и скрытые риски

  • Смена профиля нагрузки: Переход на диффузионные модели требует пересмотра критериев выбора оборудования. Приоритет смещается с объема памяти и пропускной способности шины к вычислительной мощности ядер (Tensor Cores), так как задача становится вычислительно ограниченной.
  • Зависимость от специфического ПО: Максимальная производительность достигается только при использовании стека CUDA и специализированных фреймворков (vLLM, Unsloth). Развертывание на альтернативном железе без оптимизации может не дать заявленного ускорения.
  • Экспериментальный статус: Модель позиционируется как экспериментальная. Это может означать необходимость дополнительной доработки (fine-tuning) для решения узкоспециализированных бизнес-задач перед внедрением в продакшн.
  • Требования к оборудованию: Для работы с полной скоростью на локальных машинах потребуются видеокарты последнего поколения (серии 5090, RTX PRO 6000 или системы на базе Blackwell), что может создать барьер входа для пользователей с устаревшим парком техники.

Коротко о главном

В чем заключается архитектурное преимущество диффузионного подхода перед автогрессивным?

Смена стратегии с генерации по одному слову на одновременное уточнение 256 токенов переводит задачу из разряда ограниченных памятью в вычислительно интенсивные, позволяя использовать полную мощность современных видеокарт.

Почему модель DiffusionGemma активирует только 3,8 миллиарда параметров из 26 миллиардов?

Это решение обеспечивает баланс между качеством генерации и скоростью работы, позволяя модели функционировать на локальных устройствах без необходимости отправки данных в облако.

Какой прирост производительности демонстрирует модель SANA-WM при генерации видео?

Упрощенная версия модели создает 60-секундный ролик за 34 секунды на видеокарте GeForce RTX 5090, обеспечивая ускорение в 36 раз по сравнению с аналогичными решениями.

Какое оборудование позволяет объединить до четырех устройств в единый пул памяти?

Новый ассистент в NVIDIA Sync объединяет системы DGX Spark, создавая общий объем памяти 512 ГБ, что достаточно для запуска моделей с параметрами до 400 миллиардов.

В чем заключается влияние совместной работы NVIDIA и Microsoft на запуск агентов в Windows?

Внедрение среды изоляции на базе Microsoft eXecution Containers и рантайма NVIDIA OpenShell упрощает создание нативных агентов и ускоряет их выполнение в 2 раза.

Какие требования к аппаратному обеспечению возникают из-за смены профиля нагрузки?

Переход на диффузионные модели смещает приоритет с объема памяти на вычислительную мощность ядер, делая необходимым использование видеокарт последнего поколения, таких как серии 5090 или Blackwell.

Какие программные ограничения существуют для достижения максимальной производительности?

Заявленное ускорение возможно только при использовании стека CUDA и специализированных фреймворков, таких как vLLM и Unsloth, что ограничивает эффективность на альтернативном железе без оптимизации.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Устройства и гаджеты; Передовые технологии

Материалы по теме