Сентябрь 2026   |   В фокусе

Исследователи зафиксировали разрыв между скоростью GPU и пропускной способностью памяти

Бутылочное горлышко ИИ-систем сместилось от процессоров к скорости передачи данных: память не успевает за растущей вычислительной мощностью, из-за чего дорогое оборудование простаивает. Рынок переходит от продажи отдельных чипов к проектированию целостных архитектур, где эффективность доставки информации становится главным фактором производительности.

Скорость вычислений на графических ускорителях (GPU) давно перестала быть единственным фактором производительности систем искусственного интеллекта. Исследования показывают, что узким местом становится пропускная способность памяти и скорость передачи данных между компонентами. Если данные не успевают поступать к процессору, дорогое железо простаивает, снижая общую эффективность системы.

Разрыв между вычислениями и передачей данных

Исследование ученых из UC Berkeley, ICSI и LBNL под названием «AI and Memory Wall» зафиксировало критическое отставание инфраструктуры передачи данных от роста вычислительной мощности. За последние 20 лет пиковая производительность серверного оборудования (в FLOPS) увеличилась примерно в три раза каждые два года. При этом пропускная способность оперативной памяти DRAM выросла лишь в 1,6 раза, а каналов связи между компонентами — в 1,4 раза.

Это означает, что процессоры становятся быстрее значительно быстрее, чем системы, которые подают им информацию. В результате возникают «узкие места» (bottlenecks): ускоритель готов к работе, но вынужден ждать данные из памяти или сети.

Почему скорость ответа зависит от архитектуры данных

В реальных сценариях использования ИИ (чат-боты, поисковые системы) данные постоянно перемещаются. Когда пользователь задает вопрос, система собирает контекст прошлых диалогов, результаты поиска и документы из хранилищ. Эти данные проходят путь: накопитель → системная память → память, ближайшая к ускорителю.

Масштаб нагрузки растет стремительно:

  • По данным OpenAI, на июль 2025 года через ChatGPT проходило 18 млрд сообщений в неделю.
  • Приложение Gemini (Google) превысило отметку в 1 млрд ежемесячных активных пользователей после августа 2026 года.

Скорость ответа пользователю определяется не только скоростью модели, но и тем, насколько быстро инфраструктура сможет собрать и передать необходимые данные к процессору. Даже при использовании одинаковых GPU разные системы показывают разную производительность из-за различий в архитектуре доставки данных.

Риски для хранения и сети

Проблемы возникают не только в памяти, но и в других слоях инфраструктуры:

  • Хранение: При обучении моделей требуется регулярное сохранение промежуточных результатов (чекпоинтов). Если накопители не успевают записывать эти большие объемы данных, замедляется работа всего кластера обучения. Именно поэтому консорциум MLCommons выделил отдельный бенчмарк MLPerf Storage для оценки производительности хранилищ в ИИ-задачах.
  • Сеть: В крупных системах серверы обмениваются данными одновременно. Задержки в сети или недостаточная пропускная способность приводят к тому, что задержка на одном участке снижает скорость всей системы.

Переход от продажи чипов к проектированию систем

Конкуренция в сфере ИИ-инфраструктуры смещается с уровня отдельных компонентов на уровень целостной архитектуры. Компании больше не могут просто продавать быстрые GPU или память по отдельности. Ключевым фактором становится способность выстроить «дорогу» для данных так, чтобы ускорители были загружены работой максимально возможное время.

Это требует глубокой интеграции решений от производителей полупроводников, серверов, сетевого оборудования и облачных провайдеров. Роль поставщиков памяти расширяется: теперь они должны участвовать в проектировании потоков данных внутри систем клиентов, а не только поставлять модули DRAM или HBM.

Эффективность использования дорогих GPU напрямую зависит от того, насколько коротким будет путь данных до процессора. Перемещение информации потребляет энергию и время, но не создает вычислительной ценности, поэтому оптимизация маршрутов данных становится таким же важным фактором, как и сама скорость чипа.

Практические выводы для бизнеса

  • Оценка производительности: При выборе ИИ-инфраструктуры недостаточно смотреть на характеристики GPU. Необходимо анализировать пропускную способность памяти (HBM/DRAM) и сетевых интерфейсов.
  • Рост затрат на поддержку: Сложность архитектуры требует более тщательного проектирования размещения данных. Ошибки в логике распределения нагрузки или кэширования могут привести к недоиспользованию закупленного оборудования.
  • Зависимость от экосистемы: Успешная работа системы зависит от слаженности действий всех поставщиков (чипы, серверы, сеть, хранилища). Изолированная оптимизация одного компонента не даст прироста общей производительности.

Сигнал для рынка: фокус инвестиций и R&D смещается с чистой вычислительной мощности на эффективность передачи данных. Для российских компаний, внедряющих ИИ-решения, это означает необходимость учитывать локальные особенности цепочек поставок компонентов памяти и сетевое оборудование, чтобы избежать «узких мест» в архитектуре собственных кластеров.

Когда фактов слишком много нужна система

Асектор превращает поток новостей в понятную картину: что произошло, на что это влияет и чем может обернуться. Без шума. С доказательной базой.

Коротко о главном

Какие объемы трафика демонстрируют системы ChatGPT и Gemini?

К июлю 2025 года через ChatGPT проходило 18 млрд сообщений в неделю, а приложение Google Gemini превысило отметку в 1 млрд ежемесячных активных пользователей после августа 2026 года. Такой масштаб нагрузки требует высокой скорости сборки контекста из различных хранилищ для обеспечения быстрой реакции на запросы пользователей.

Зачем консорциум MLCommons выделил отдельный бенчмарк MLPerf Storage?

При обучении моделей необходимо регулярно сохранять промежуточные результаты (чекпоинты), и если накопители не успевают записывать эти большие объемы данных, замедляется работа всего кластера. Выделение отдельного стандарта оценки позволяет измерять именно производительность хранилищ в контексте ИИ-задач.

Как задержки в сети влияют на работу крупных ИИ-систем?

В системах с множеством серверов одновременный обмен данными означает, что задержка или недостаточная пропускная способность на одном участке снижает скорость всей инфраструктуры. Это создает эффект «узкого места», при котором производительность ограничивается самым медленным звеном сетевой передачи.

Почему конкуренция сместилась с продажи отдельных чипов на проектирование целостных систем?

Компании больше не могут гарантировать эффективность, просто продавая быстрые GPU или память по отдельности, так как итоговая скорость зависит от архитектуры доставки данных. Теперь требуется глубокая интеграция решений от производителей полупроводников, серверов и облачных провайдеров для минимизации пути информации до процессора.

Какую новую роль выполняют поставщики памяти в ИИ-инфраструктуре?

Поставщики DRAM или HBM теперь должны участвовать в проектировании потоков данных внутри систем клиентов, а не только поставлять физические модули. Это необходимо для того, чтобы ускорители были загружены работой максимально возможное время, что напрямую влияет на эффективность использования дорогого оборудования.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Цифровизация и технологии

Материалы по теме