Google DeepMind и NVIDIA ускорили генерацию текста в 4 раза на локальных ПК
Скорость генерации текста выросла в четыре раза за счет перехода от последовательного подбора слов к параллельной выработке блоков, что меняет профиль нагрузки с памяти на вычислительную мощность. Локальное развертывание тяжелых моделей теперь требует оборудования последнего поколения, иначе бизнес столкнется с необходимостью пересмотра архитектуры инфраструктуры и роста капитальных затрат.
Google DeepMind представила экспериментальную модель DiffusionGemma, которая меняет подход к созданию текста: вместо последовательного подбора слов она формирует целые блоки сразу. NVIDIA оптимизировала алгоритм для работы на своих видеокартах, что позволяет ускорить генерацию в 4 раза по сравнению с традиционными методами. Это решение ориентировано на локальное использование: модель работает на персональных компьютерах и рабочих станциях без отправки данных в облако, устраняя задержки и плату за токены.
Важный нюанс: Смена архитектуры с последовательной на параллельную генерацию превращает задачу из ограниченной пропускной способностью памяти в вычислительно интенсивную, что идеально совпадает с сильными сторонами современных видеокарт.
Принципы работы и технические характеристики
Традиционные большие языковые модели (LLM) работают по автогрессивному принципу: каждое следующее слово зависит от предыдущего, что создает эффект «печатающей машинки» и ограничивает скорость. DiffusionGemma использует диффузионный подход, аналогичный генерации изображений: система начинает с шума и за один шаг уточняет сразу 256 токенов.
Модель построена на базе архитектуры Gemma 4 с 26 миллиардами параметров, но в каждом шаге активирует лишь 3,8 миллиарда. Это обеспечивает баланс между качеством и скоростью. Лицензия Apache 2.0 делает веса модели открытыми, позволяя разработчикам использовать их без ограничений.
Ключевые технические показатели:
- Параллельная генерация: Обработка до 256 токенов за один шаг вместо одного.
- Скорость на H100: До 1000 токенов в секунду на одной видеокарте.
- Скорость на DGX Station: До 2000 токенов в секунду.
- Скорость на DGX Spark: 150 токенов в секунду.
- Поддержка: Работает в библиотеках Hugging Face Transformers, vLLM и Unsloth с первого дня выпуска.
Стоит учесть: Ускорение достигается за счет того, что видеокарты загружаются вычислениями на полную мощность, вместо того чтобы простаивать в ожидании данных из памяти, как это происходит при классической генерации.
Аппаратная совместимость и локальное развертывание
Оптимизация NVIDIA позволяет запускать модель на широком спектре оборудования, от персональных ПК до профессиональных станций. Это открывает возможности для создания автономных агентов и интерактивных чатов с минимальной задержкой.
Поддерживаемые платформы:
- NVIDIA DGX Spark: Персональный ИИ-суперкомпьютер на чипе GB10 Grace Blackwell с 128 ГБ объединенной памяти. Предназначен для прототипирования и локальных агентов.
- NVIDIA RTX PRO 6000: Рабочая станция для профессионалов, обеспечивающая низкую задержку в рабочих процессах.
- NVIDIA DGX Station: Система с 748 ГБ когерентной памяти для высокопроизводительного инференса.
- NVIDIA GeForce RTX: Поддержка через llama.cpp ожидается в ближайшее время.
Для быстрого старта разработчикам доступны готовые сценарии (playbooks) для настройки окружения на DGX Spark, RTX PRO и DGX Station. Тестирование доступно бесплатно через API на платформе build.nvidia.com или напрямую через Hugging Face.
На фоне этого: Локальное выполнение тяжелых моделей становится реальностью для индивидуальных разработчиков, что снижает зависимость от облачных провайдеров и сокращает операционные расходы на обработку данных.
Дополнительные обновления экосистемы RTX AI Garage
Помимо DiffusionGemma, NVIDIA анонсировала ряд инструментов для расширения возможностей локальных ИИ-агентов и генерации видео.
- SANA-WM: Открытая модель мира, превращающая одно изображение и траекторию камеры в видео длительностью 1 минуту в разрешении 720p. Упрощенная версия с 2,6 миллиарда параметров генерирует 60-секундный ролик за 34 секунды на одной видеокарте GeForce RTX 5090, обеспечивая прирост производительности в 36 раз по сравнению с аналогами.
- Агенты для Windows: Совместно с Microsoft внедрена среда изоляции (sandboxing) на базе Microsoft eXecution Containers и рантайма NVIDIA OpenShell. Это упрощает создание агентов, работающих нативно в Windows, и ускоряет их выполнение в 2 раза.
- NemoClaw: Упрощенная установка для DGX Spark, позволяющая запускать локального агента с моделью Qwen3.6-35B в 2,6 раза быстрее.
- Кластеризация: Новый ассистент в NVIDIA Sync объединяет до четырех устройств DGX Spark в единый пул памяти объемом 512 ГБ, достаточный для моделей с параметрами до 400 миллиардов.
Операционные последствия и скрытые риски
- Смена профиля нагрузки: Переход на диффузионные модели требует пересмотра критериев выбора оборудования. Приоритет смещается с объема памяти и пропускной способности шины к вычислительной мощности ядер (Tensor Cores), так как задача становится вычислительно ограниченной.
- Зависимость от специфического ПО: Максимальная производительность достигается только при использовании стека CUDA и специализированных фреймворков (vLLM, Unsloth). Развертывание на альтернативном железе без оптимизации может не дать заявленного ускорения.
- Экспериментальный статус: Модель позиционируется как экспериментальная. Это может означать необходимость дополнительной доработки (fine-tuning) для решения узкоспециализированных бизнес-задач перед внедрением в продакшн.
- Требования к оборудованию: Для работы с полной скоростью на локальных машинах потребуются видеокарты последнего поколения (серии 5090, RTX PRO 6000 или системы на базе Blackwell), что может создать барьер входа для пользователей с устаревшим парком техники.
Источник: blogs.nvidia.com