Ускорение ИИ-инференса


Ускорение ИИ-инференса в новостной повестке, календарь упоминаний и aналитика в реальном времени.

Календарь упоминаний:

2026
17 сентября

Ускорение ИИ-инференса достигает прироста производительности в 3,7 раза на новой платформе Nvidia Vera Rubin NVL72

Nvidia опубликовала результаты тестирования платформы Vera Rubin NVL72 в стандарте MLPerf Inference v6.1, зафиксировав рост пропускной способности до 3,7 раз по сравнению с предшественником GB300 NVL72 при работе с моделью Qwen3-VL. Для модели DeepSeek-R1 показатель составил 2,5 раза. Ускорение ИИ-инференса обеспечивается комплексным подходом: улучшенными Tensor Cores, снижением точности данных до NVFP4 для экономии памяти и архитектурой раздельного обслуживания запросов. Шестое поколение NVLink обеспечивает скорость передачи пакетов в 10 раз выше стандартного Ethernet, что критично для синхронной работы 72 GPU в одной стойке.

Событие: Платформа Vera Rubin NVL72 показала пропускную способность на 3,7 раза выше, чем у GB300 NVL72, при тестировании с моделью Qwen3-VL в стандарте MLPerf Inference v6.1.

Фактор: Использование точности NVFP4 и архитектуры Disaggregated Serving снижает потребление оперативной памяти для весов модели и KV-кэша, позволяя обрабатывать больший объем запросов без потери качества вывода.

Эффект: Увеличение количества GPU с 72 до 288 узлов демонстрирует эффективность масштабирования на уровне 99%, что обеспечивает предсказуемый рост производительности при расширении инфраструктуры дата-центров.

Позитив: Снижение стоимости генерации одного токена и возможность обслуживать больший поток пользователей на том же количестве оборудования напрямую уменьшают операционные расходы компаний на поддержание ИИ-сервисов.

Подробнее →


В нашей базе собрано 1 событие по теме «Ускорение ИИ-инференса». Мы показываем все из них.