Сентябрь 2026   |   В фокусе

Nvidia Vera Rubin NVL72 ускоряет инференс в разы и снижает стоимость ИИ-инфраструктуры

Nvidia представила платформу Vera Rubin NVL72, которая генерирует ответы в 3,7 раза быстрее предшественника. Это снижает стоимость обработки запросов и позволяет бизнесу обслуживать больший поток пользователей без покупки нового оборудования.

Nvidia представила результаты первых тестов новой платформы Vera Rubin NVL72 в стандарте MLPerf Inference v6.1. Система демонстрирует пропускную способность до 3,7 раза выше, чем у предшественника GB300 NVL72, при работе с моделью Qwen3-VL. На базе DeepSeek-R1 прирост составил 2,5 раза. Для бизнеса это означает снижение стоимости генерации одного токена и возможность обслуживать больший поток пользователей на том же количестве оборудования.

Технические детали и архитектура

Прирост производительности обеспечен комплексным подходом: сочетанием нового «железа» и оптимизированного программного обеспечения. Ключевые факторы включают:

  • Ускорение вычислений: Улучшенные Tensor Cores и Transformer Engine ускоряют этапы подготовки данных (prefill) и генерации ответа (decode).
  • Экономия памяти: Использование точности NVFP4 снижает потребление оперативной памяти для весов модели, механизма внимания и кэша KV. Это позволяет обрабатывать больше запросов без потери качества вывода.
  • Раздельное обслуживание (Disaggregated Serving): Архитектура разделяет этапы обработки запроса, что повышает эффективность работы с моделями типа Mixture-of-Experts (MoE), такими как DeepSeek-R1 и Qwen3-VL.
  • Быстрая связь внутри стоек: Шестое поколение NVLink обеспечивает скорость передачи пакетов в 10 раз выше и задержку в 3 раза ниже по сравнению со стандартным Ethernet. Это критично для работы 72 GPU в одной стойке как единой системы.

Масштабируемость и эффективность инфраструктуры

Важным показателем для дата-центров является то, насколько линейно растет производительность при добавлении новых узлов. Nvidia показала высокую эффективность масштабирования на текущей платформе GB300 NVL72:

  • При увеличении количества GPU с 72 (одна стойка) до 288 (четыре стойки) пропускная способность выросла почти пропорционально.
  • Эффективность масштабирования достигла 99%. Это значит, что дополнительные мощности не «съедаются» накладными расходами на коммуникацию между узлами.

Высокая эффективность масштабирования снижает риски при расширении ИИ-инфраструктуры: компании могут добавлять вычислительные узлы с предсказуемым ростом производительности, а не сталкиваться с эффектом убывающей отдачи.

Роль программного обеспечения и экосистемы

Аппаратная мощность раскрывается только в связке с оптимизированным софтом. В версии MLPerf v6.1 Nvidia добилась прироста производительности до 1,6 раза по сравнению с предыдущей версией (v6.0) за счет:

  • Снижения точности кэша KV.
  • Слияния ядер (kernel fusion) и улучшения самих алгоритмов вычислений.
  • Использования фреймворков vLLM и NVIDIA Dynamo.

Оптимизация не останавливается после публикации результатов: компания продолжает дорабатывать ПО, что приводит к дополнительному росту производительности даже на уже выпущенном оборудовании. Партнеры Nvidia (Nebius, ASUS, Azure, Cisco и другие 19 компаний) также подтвердили работоспособность платформ в своих конфигурациях, включая многоузловые системы Blackwell NVL72.

Операционные последствия для бизнеса

  • Снижение операционных расходов: Рост пропускной способности на единицу оборудования напрямую снижает стоимость инференса (генерации ответов). Это критично для компаний, чьи расходы на ИИ-инференс растут экспоненциально.
  • Гибкость инфраструктуры: Платформа поддерживает различные типы задач — от языковых моделей до видеогенерации и агентных сценариев (AI agents). Это позволяет использовать одни и те же серверы для разных бизнес-процессов, повышая их утилизацию.
  • Требования к сети: Эффективность новых архитектур зависит от высокоскоростной внутренней связи (NVLink). При проектировании дата-центров под новые поколения GPU необходимо закладывать бюджет на специализированные коммутаторы и кабели, стандартный Ethernet здесь не справится с нагрузкой.
  • Вектор развития ИИ-агентов: Тесты показывают, что новые платформы значительно эффективнее работают со сложными многошаговыми задачами (агентные сценарии). Это сигнал для разработчиков: следующие поколения LLM будут ориентированы не только на скорость ответа, но и на способность выполнять длинные цепочки действий.

Когда фактов слишком много нужна система

Асектор превращает поток новостей в понятную картину: что произошло, на что это влияет и чем может обернуться. Без шума. С доказательной базой.

Коротко о главном

Какое влияние оказывает использование точности NVFP4 на работу системы?

Применение этой точности снижает потребление оперативной памяти для весов модели, механизма внимания и кэша KV. В результате система может обрабатывать больше запросов без потери качества вывода, что повышает общую эффективность использования ресурсов.

Почему архитектура с раздельным обслуживанием (Disaggregated Serving) важна для новых моделей?

Она разделяет этапы обработки запроса, что повышает эффективность работы с моделями типа Mixture-of-Experts (MoE), такими как DeepSeek-R1 и Qwen3-VL. Это позволяет оптимизировать вычислительные процессы под специфику сложных архитектур нейросетей.

Какое преимущество дает шестое поколение NVLink по сравнению со стандартным Ethernet?

Оно обеспечивает скорость передачи пакетов в 10 раз выше и задержку в 3 раза ниже. Это критически важно для того, чтобы 72 GPU в одной стойке функционировали как единая система без потерь производительности из-за узких мест в коммуникации.

Какова эффективность масштабирования платформы GB300 NVL72 при увеличении числа узлов?

При расширении с 72 до 288 GPU пропускная способность растет почти пропорционально, достигая эффективности в 99%. Это означает, что дополнительные мощности не теряются на накладных расходах за связь между узлами, что снижает риски при расширении инфраструктуры.

Какие методы оптимизации программного обеспечения позволили достичь прироста производительности в 1,6 раза в MLPerf v6.1?

Компания снизила точность кэша KV, применила слияние ядер (kernel fusion) и улучшила алгоритмы вычислений. Также были использованы фреймворки vLLM и NVIDIA Dynamo для более эффективного управления процессами.

Почему проектирование дата-центров под новые поколения GPU требует специализированной сети?

Эффективность новых архитектур напрямую зависит от высокоскоростной внутренней связи NVLink, которой не может заменить стандартный Ethernet. Компании должны закладывать бюджет на специализированные коммутаторы и кабели, чтобы избежать снижения производительности из-за сетевых ограничений.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI)

Материалы по теме