Nvidia Vera Rubin NVL72 ускоряет инференс в разы и снижает стоимость ИИ-инфраструктуры
Nvidia представила платформу Vera Rubin NVL72, которая генерирует ответы в 3,7 раза быстрее предшественника. Это снижает стоимость обработки запросов и позволяет бизнесу обслуживать больший поток пользователей без покупки нового оборудования.
Nvidia представила результаты первых тестов новой платформы Vera Rubin NVL72 в стандарте MLPerf Inference v6.1. Система демонстрирует пропускную способность до 3,7 раза выше, чем у предшественника GB300 NVL72, при работе с моделью Qwen3-VL. На базе DeepSeek-R1 прирост составил 2,5 раза. Для бизнеса это означает снижение стоимости генерации одного токена и возможность обслуживать больший поток пользователей на том же количестве оборудования.
Технические детали и архитектура
Прирост производительности обеспечен комплексным подходом: сочетанием нового «железа» и оптимизированного программного обеспечения. Ключевые факторы включают:
- Ускорение вычислений: Улучшенные Tensor Cores и Transformer Engine ускоряют этапы подготовки данных (prefill) и генерации ответа (decode).
- Экономия памяти: Использование точности NVFP4 снижает потребление оперативной памяти для весов модели, механизма внимания и кэша KV. Это позволяет обрабатывать больше запросов без потери качества вывода.
- Раздельное обслуживание (Disaggregated Serving): Архитектура разделяет этапы обработки запроса, что повышает эффективность работы с моделями типа Mixture-of-Experts (MoE), такими как DeepSeek-R1 и Qwen3-VL.
- Быстрая связь внутри стоек: Шестое поколение NVLink обеспечивает скорость передачи пакетов в 10 раз выше и задержку в 3 раза ниже по сравнению со стандартным Ethernet. Это критично для работы 72 GPU в одной стойке как единой системы.
Масштабируемость и эффективность инфраструктуры
Важным показателем для дата-центров является то, насколько линейно растет производительность при добавлении новых узлов. Nvidia показала высокую эффективность масштабирования на текущей платформе GB300 NVL72:
- При увеличении количества GPU с 72 (одна стойка) до 288 (четыре стойки) пропускная способность выросла почти пропорционально.
- Эффективность масштабирования достигла 99%. Это значит, что дополнительные мощности не «съедаются» накладными расходами на коммуникацию между узлами.
Высокая эффективность масштабирования снижает риски при расширении ИИ-инфраструктуры: компании могут добавлять вычислительные узлы с предсказуемым ростом производительности, а не сталкиваться с эффектом убывающей отдачи.
Роль программного обеспечения и экосистемы
Аппаратная мощность раскрывается только в связке с оптимизированным софтом. В версии MLPerf v6.1 Nvidia добилась прироста производительности до 1,6 раза по сравнению с предыдущей версией (v6.0) за счет:
- Снижения точности кэша KV.
- Слияния ядер (kernel fusion) и улучшения самих алгоритмов вычислений.
- Использования фреймворков vLLM и NVIDIA Dynamo.
Оптимизация не останавливается после публикации результатов: компания продолжает дорабатывать ПО, что приводит к дополнительному росту производительности даже на уже выпущенном оборудовании. Партнеры Nvidia (Nebius, ASUS, Azure, Cisco и другие 19 компаний) также подтвердили работоспособность платформ в своих конфигурациях, включая многоузловые системы Blackwell NVL72.
Операционные последствия для бизнеса
- Снижение операционных расходов: Рост пропускной способности на единицу оборудования напрямую снижает стоимость инференса (генерации ответов). Это критично для компаний, чьи расходы на ИИ-инференс растут экспоненциально.
- Гибкость инфраструктуры: Платформа поддерживает различные типы задач — от языковых моделей до видеогенерации и агентных сценариев (AI agents). Это позволяет использовать одни и те же серверы для разных бизнес-процессов, повышая их утилизацию.
- Требования к сети: Эффективность новых архитектур зависит от высокоскоростной внутренней связи (NVLink). При проектировании дата-центров под новые поколения GPU необходимо закладывать бюджет на специализированные коммутаторы и кабели, стандартный Ethernet здесь не справится с нагрузкой.
- Вектор развития ИИ-агентов: Тесты показывают, что новые платформы значительно эффективнее работают со сложными многошаговыми задачами (агентные сценарии). Это сигнал для разработчиков: следующие поколения LLM будут ориентированы не только на скорость ответа, но и на способность выполнять длинные цепочки действий.
Подтверждение: blogs.nvidia.com