Июль 2026   |   В фокусе

NVIDIA GB300 NVL72: в 25 раз больше токенов на ватт при росте затрат на инфраструктуру

В современных дата-центрах только 60% электроэнергии превращается в полезную работу, а остальное уходит на охлаждение и потери. Новые системы NVIDIA позволяют увеличить производительность на ватт в 25 раз, делая масштабное внедрение ИИ экономически выгодным даже при дефиците энергии.

Компания NVIDIA утверждает, что в условиях дефицита электроэнергии ключевым показателем для дата-центров становится производительность на ватт. Количество токенов, которое система генерирует в рамках жесткого лимита мощности, напрямую определяет доходность бизнеса. Переход от архитектуры с 8 графическими процессорами к доменам из 72 чипов позволяет увеличить эффективность в разы. Это не маркетинговое заявление, а техническая необходимость для масштабирования агентного ИИ, где спрос на вычисления растет быстрее, чем доступные энергоресурсы.

Важный нюанс: В современных ИИ-заводах только около 60% электроэнергии из сети превращается в полезную работу, остальное теряется на охлаждение и неэффективность оборудования.

Скачок эффективности: от Hopper к Blackwell и Vera Rubin

Новое поколение платформ NVIDIA Blackwell, в частности система GB300 NVL72, демонстрирует значительный прирост эффективности по сравнению с предыдущим поколением Hopper. Тесты на реальных моделях показывают многократное улучшение показателей, что делает их экономически выгодными для развертывания в промышленных масштабах.

  • На модели DeepSeek V4 Pro система GB300 NVL72 показывает до 25-кратного роста производительности на ватт.
  • Для модели GLM5.1 прирост достигает 20 раз.
  • На модели Kimi K2.6, созданной для сложных агентных задач, эффективность выросла в 10 раз.

Эти цифры отражают текущий уровень технологий, который продолжает расти благодаря обновлениям программного обеспечения. Например, за один месяц производительность на ватт для модели DeepSeek V4 увеличилась еще в 5 раз без замены «железа». Следующая платформа NVIDIA Vera Rubin строится на этом фундаменте, чтобы еще больше повысить энергоэффективность на уровне стойки.

Стоит учесть: Производительность зависит от типа задачи. Разные модели требуют разных настроек: одни оптимизируют скорость ответа (латентность), другие — объем обработки данных (пропускную способность).

Архитектура и программное обеспечение как единая система

Высокие показатели достигаются не за счет одного компонента, а благодаря глубокой интеграции всех слоев системы: от чипов до софта. Ключевым элементом является коммутатор NVIDIA NVLink Switch шестого поколения, созданный специально для задач ИИ, а не адаптированный из обычных сетей. Он позволяет выполнять вычисления непосредственно внутри коммутатора (технология SHARP), разгружая графические процессоры.

Программный стек, включающий NVIDIA Dynamo, TensorRT LLM, SGLang и vLLM, реализует ряд оптимизаций:

  • Квантование NVFP4 для ускорения вычислений.
  • Раздельное обслуживание запросов (disaggregated serving).
  • Параллелизм экспертов для работы с моделями типа MoE (Mixture-of-Experts).
  • Умная маршрутизация и выгрузка кэша.

Для управления энергопотреблением используется программное обеспечение DSX MaxLPS. Оно перераспределяет мощность между стойками в реальном времени и поддерживает жидкостное охлаждение теплой водой. Это позволяет операторам разместить на 40% больше графических процессоров в рамках того же бюджета электроэнергии.

Реальное применение в промышленности

Надежность систем в масштабах ИИ-завода проверяется только в боевых условиях. Платформа NVIDIA Blackwell NVL72 уже используется ведущими лабораториями и сервисами для ежедневной работы с высокими нагрузками.

  • Anthropic, OpenAI и SpaceXAI используют системы Blackwell NVL72 для инференса.
  • CoreWeave развернула модель Kimi K2.6 на GB300 NVL72, применяя квантование и спекулятивное декодирование для максимизации скорости.
  • Perplexity обслуживает миллионы запросов ежедневно на моделях Qwen3 235B и Qwen3.5-397B-A17B, используя платформу GB200 NVL72.
  • Fireworks AI внедряет модель GLM 5.2 для клиентов, включая Cursor и Factory AI.

Этот опыт работы с реальным трафиком создает базу для дальнейших разработок, таких как платформа Vera Rubin, которая получает преимущество благодаря накопленным данным о надежности и экономике эксплуатации.

На фоне этого: Операторам дата-центров придется пересматривать подходы к охлаждению и распределению энергии, так как традиционные методы могут стать узким местом для новых высокопроизводительных систем.

Операционные последствия и практические аспекты

  • Рост капитальных затрат на инфраструктуру: Переход на системы с жидкостным охлаждением и специализированными коммутаторами потребует модернизации существующих дата-центров, что увеличит первоначальные инвестиции.
  • Зависимость от программного стека: Максимальная эффективность достигается только при использовании полного набора инструментов от производителя (софт + железо). Использование стороннего ПО может нивелировать преимущество в производительности.
  • Сложность масштабирования: Работа с доменами из 72 GPU требует высокой квалификации инженеров для управления отказами и балансировкой нагрузки, так как вероятность сбоя в такой системе выше, чем в одиночных узлах.
  • Экономическая целесообразность: Снижение стоимости токена делает экономически выгодным развертывание более сложных моделей (MoE), которые ранее были недоступны из-за высоких энергозатрат.

Коротко о главном

Какой прирост эффективности демонстрирует система GB300 NVL72 на модели DeepSeek V4 Pro?

Новая платформа показывает до 25-кратного роста производительности на ватт по сравнению с предыдущим поколением Hopper, что делает развертывание таких систем экономически выгодным для промышленных задач.

Как удалось увеличить производительность модели DeepSeek V4 еще в 5 раз без замены оборудования?

Достигнутый рост стал возможен благодаря обновлениям программного обеспечения, которые позволили оптимизировать работу существующего «железа» в течение одного месяца.

Какую роль играет коммутатор NVIDIA NVLink Switch шестого поколения в архитектуре системы?

Специализированный коммутатор позволяет выполнять вычисления непосредственно внутри себя с помощью технологии SHARP, что разгружает графические процессоры и повышает общую эффективность системы.

На сколько процентов можно увеличить количество графических процессоров в рамках того же энергетического бюджета?

Использование программного обеспечения DSX MaxLPS для перераспределения мощности и поддержки жидкостного охлаждения позволяет разместить на 40% больше GPU, не увеличивая затраты на электроэнергию.

Какие компании уже используют платформу Blackwell NVL72 для ежедневной работы с высокими нагрузками?

Ведущие игроки, включая Anthropic, OpenAI и SpaceXAI, внедрили эти системы для задач инференса, подтвердив их надежность в реальных промышленных условиях.

Почему переход на домены из 72 чипов усложняет масштабирование инфраструктуры?

Работа с такими крупными кластерами требует высокой квалификации инженеров для управления отказами и балансировки нагрузки, так как вероятность сбоя в объединенной системе выше, чем в одиночных узлах.

Как снижение стоимости токена влияет на выбор моделей для развертывания?

Повышение энергоэффективности делает экономически целесообразным использование сложных моделей типа MoE, которые ранее были недоступны из-за чрезмерных энергозатрат.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Передовые технологии

Материалы по теме