MLPerf Inference
MLPerf Inference в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
MLPerf Inference v6.1 фиксирует 3,7-кратный прирост производительности платформы Vera Rubin NVL72
Новая платформа Nvidia продемонстрировала в стандарте MLPerf Inference v6.1 пропускную способность, превышающую показатели предшественника GB300 NVL72 в 3,7 раза на модели Qwen3-VL и в 2,5 раза на DeepSeek-R1. Результаты достигнуты благодаря сочетанию аппаратных улучшений Tensor Cores с оптимизацией программного обеспечения, включая снижение точности кэша KV и использование фреймворков vLLM. Стандарт позволил верифицировать эффективность архитектуры Disaggregated Serving для моделей типа Mixture-of-Experts.
Событие: Nvidia опубликовала результаты тестов платформы Vera Rubin NVL72 в стандарте MLPerf Inference v6.1, зафиксировав максимальный прирост производительности в 3,7 раза по сравнению с GB300 NVL72.
Эффект: Рост пропускной способности на единицу оборудования напрямую снижает стоимость генерации одного токена и позволяет обслуживать больший поток пользователей без увеличения количества серверов.
Фактор: Оптимизация программного обеспечения в версии MLPerf v6.1 (снижение точности кэша KV, слияние ядер) обеспечила дополнительный прирост производительности до 1,6 раза по сравнению с предыдущей версией стандарта.
В нашей базе собрано 1 событие по теме «MLPerf Inference». Мы показываем все из них.