MLPerf Inference


MLPerf Inference в новостной повестке, календарь упоминаний и aналитика в реальном времени.

Календарь упоминаний:

2026
17 сентября

MLPerf Inference v6.1 фиксирует 3,7-кратный прирост производительности платформы Vera Rubin NVL72

Новая платформа Nvidia продемонстрировала в стандарте MLPerf Inference v6.1 пропускную способность, превышающую показатели предшественника GB300 NVL72 в 3,7 раза на модели Qwen3-VL и в 2,5 раза на DeepSeek-R1. Результаты достигнуты благодаря сочетанию аппаратных улучшений Tensor Cores с оптимизацией программного обеспечения, включая снижение точности кэша KV и использование фреймворков vLLM. Стандарт позволил верифицировать эффективность архитектуры Disaggregated Serving для моделей типа Mixture-of-Experts.

Событие: Nvidia опубликовала результаты тестов платформы Vera Rubin NVL72 в стандарте MLPerf Inference v6.1, зафиксировав максимальный прирост производительности в 3,7 раза по сравнению с GB300 NVL72.

Эффект: Рост пропускной способности на единицу оборудования напрямую снижает стоимость генерации одного токена и позволяет обслуживать больший поток пользователей без увеличения количества серверов.

Фактор: Оптимизация программного обеспечения в версии MLPerf v6.1 (снижение точности кэша KV, слияние ядер) обеспечила дополнительный прирост производительности до 1,6 раза по сравнению с предыдущей версией стандарта.

Подробнее →


В нашей базе собрано 1 событие по теме «MLPerf Inference». Мы показываем все из них.