NVIDIA Vera ускоряет ИИ-агенты в 1.8 раза и устраняет простой GPU
Традиционные серверные процессоры с множеством ядер превращаются в «узкое горлышко», заставляя дорогие видеокарты простаивать в ожидании выполнения задач. Новая архитектура NVIDIA Vera устраняет этот дисбаланс, ускоряя работу ИИ-агентов в 1,8 раза и повышая доходность дата-центров за счет минимизации простоев оборудования.
NVIDIA представила процессор Vera, созданный специально для работы агентов искусственного интеллекта. Традиционные серверные процессоры, оптимизированные под количество ядер и стоимость, становятся «узким горлышком» для современных ИИ-систем, заставляя дорогие видеокарты простаивать в ожидании выполнения задач. Новая архитектура фокусируется на максимальной скорости выполнения одной операции, что критично для непрерывных циклов работы ИИ-агентов. Это решение позволяет ускорить выполнение задач и повысить общую эффективность дата-центра.
Важный нюанс: В эпоху агентного ИИ скорость выполнения одной операции важнее общего количества ядер, так как каждый шаг агента зависит от завершения предыдущего.
Проблема текущих серверных процессоров
Современные дата-центры сталкиваются с дисбалансом ресурсов. Видеокарты (GPU) являются самым дорогим активом, но их производительность ограничивается скоростью процессоров (CPU), которые управляют ими. Агенты ИИ работают в цикле: модель принимает решение, процессор выполняет действие (запуск кода, обработка данных), результат возвращается модели. Если процессор медленный, видеокарта простаивает.
Традиционный подход к созданию серверных процессоров в последние годы был направлен на увеличение количества ядер для снижения стоимости за ядро. Это привело к следующим проблемам:
- Снижение быстродействия ядра: Уменьшение площади кремния на одно ядро привело к потере производительности в задачах, требующих высокой скорости.
- Архитектура чиплетов: Разделение процессора на модули (чиплеты) удешевило производство, но создало задержки при доступе к памяти, так как не все ядра имеют прямой доступ ко всему объему памяти.
- Конкуренция за ресурсы: При высокой загрузке множество ядер начинают мешать друг другу, снижая скорость выполнения критически важных последовательных задач.
Для ИИ-агентов, которые работают непрерывными потоками, важна не общая пропускная способность, а скорость прохождения каждого отдельного шага.
Стоит учесть: Увеличение количества ядер в процессоре не ускоряет выполнение одного шага в цикле агента, а при некорректной архитектуре может даже замедлить его из-за конкуренции за память.
Технические особенности NVIDIA Vera
Процессор Vera спроектирован с нуля для устранения описанных выше ограничений. В его основе лежит собственное ядро Olympus, которое обеспечивает на 50% больше инструкций за такт по сравнению с предыдущим процессором NVIDIA Grace.
Ключевые характеристики архитектуры:
- Монолитный кристалл: Вместо разделения на чиплеты используется единый вычислительный блок, что обеспечивает предсказуемую задержку и высокую скорость обмена данными между ядрами (3.4 ТБ/с). Это в 3 раза выше, чем у других серверных процессоров.
- Память: Поддержка памяти LPDDR5X с пропускной способностью до 1.2 ТБ/с при энергопотреблении менее 40 Вт.
- Масштабируемость: Все 88 ядер имеют полный доступ к памяти без узких мест, что позволяет сохранять высокую производительность каждого ядра даже при полной загрузке системы.
В реальных сценариях работы ИИ-агентов процессор Vera демонстрирует в 1.8 раза более высокую устойчивую производительность на ядро по сравнению с процессорами архитектуры x86.
Практические результаты тестирования
Компания Perplexity протестировала процессор Vera на реальных рабочих задачах, включая клонирование репозиториев и запуск тестовых наборов в песочницах. Результаты показали значительное ускорение по сравнению с традиционными решениями:
- Завершение задач заняло в 1.5 раза меньше времени.
- Запуск параллельных песочниц ускорился в 1.9 раза.
Другие партнеры зафиксировали рост производительности в задачах обработки данных:
- Аналитика больших объемов данных (SQL) с использованием Starburst ускорилась в 3 раза.
- Задержка в потоковой передаче данных с Redpanda снизилась в 6 раз.
Важный нюанс: Единая архитектура позволяет использовать один тип процессора для всех задач ИИ-фабрики — от обработки данных до обучения моделей, что упрощает инфраструктуру и снижает затраты на поддержку.
Операционные последствия и тренды
Внедрение специализированных процессоров меняет экономику работы ИИ-фабрик. Основная цель — минимизировать время простоя дорогостоящих видеокарт.
- Экономия ресурсов GPU: Ускорение работы процессора позволяет видеокартам проводить больше времени на генерации контента и меньше — в ожидании. Это напрямую влияет на доходность дата-центра.
- Унификация стека: Процессор Vera совместим с видеокартами NVIDIA Rubin и системами хранения данных BlueField-4 STX. Это позволяет строить инфраструктуру на единой платформе, используя один набор инструментов разработки.
- Планы развития: NVIDIA анонсировала следующее поколение процессоров под названием Rosa с ядром Rigel. Оно сохранит те же физические размеры, но предложит еще более высокую производительность за счет улучшенной доставки инструкций и увеличенного кэша L2.
На фоне этого: Рынок переходит от гонки за количеством ядер к гонке за скоростью выполнения одной операции, так как именно это определяет эффективность агентных систем.
Источник: blogs.nvidia.com