Сентябрь 2026   |   В фокусе

SK hynix: память стала главным тормозом ИИ, а не GPU

SK hynix утверждает, что главной помехой для скорости ИИ стала не мощность графических процессоров, а медленная передача данных из памяти. Это меняет приоритеты в закупках железа: теперь важнее пропускная способность чипов памяти, чем количество вычислительных ядер.

SK hynix (корейский производитель чипов) утверждает, что главным ограничителем скорости работы современных ИИ-систем стала архитектура передачи данных, а не мощность графических процессоров (GPU). По мере того как фокус смещается от обучения моделей к их реальному использованию (инференсу) и агентным системам, критичным фактором становится то, насколько быстро данные доставляются к вычислительному ядру.

В эпоху инференса более половины времени GPU может тратиться не на математические операции, а на ожидание данных из памяти. Это структурное ограничение, которое нельзя решить простым добавлением новых видеокарт.

Иллюзия мощности: почему больше GPU — не значит быстрее

Десятилетие назад формула успеха была простой: чем больше GPU и длиннее обучение, тем умнее модель. Этот подход работал в эпоху масштабного предварительного обучения (pretraining), где данные обрабатывались большими пачками (батчами). Однако реальная эксплуатация ИИ работает иначе.

Современные модели генерируют ответы последовательно, токен за токеном, постоянно обращаясь к предыдущим словам для сохранения контекста. В таких сценариях:

  • Низкая задержка критична: Система должна отвечать мгновенно, не дожидаясь формирования большого пакета данных.
  • Долгий контекст: Модели удерживают в памяти огромные объемы информации (историю диалога, промежуточные результаты рассуждений).
  • Частые обращения: Процессор вынужден постоянно «сходить» за новыми данными в память.

Если данные находятся далеко от чипа или каналы передачи узкие, мощные GPU простаивают, ожидая поступления информации. Этот феномен называют «стеной памяти» (memory wall).

Стена памяти: проблема, о которой знали 30 лет назад

В 1994 году ученые Уильям Вулф и Салли Макки предупреждали о разрыве между скоростью процессоров (рост ~60% в год) и скоростью доступа к оперативной памяти DRAM (рост ~7%). Три десятилетия спустя это предсказание сбылось в полной мере в сфере ИИ.

Современные ускорители достигают производительности в петафлопсы (квадриллион операций в секунду), но скорость извлечения весов модели и активаций из памяти не успевает за этим ростом. В результате вычислительные блоки простаивают.

Особую роль играет кэш KV (Key-Value cache) — техника, позволяющая модели «помнить» предыдущие токены без повторного пересчета. При генерации длинных текстов объем данных в этом кэше может превышать размер самой модели. Например, для модели с 70 млрд параметров вес занимают около 140 ГБ, но кэш KV при длинном контексте может потребовать еще больше места и пропускной способности.

Программные костыли достигают предела

Индустрия пыталась решить проблему на уровне программного обеспечения, оптимизируя алгоритмы:

  • FlashAttention: Разбивает операции внимания на мелкие блоки, обрабатывая их во встроенной быстрой памяти GPU (SRAM), чтобы реже обращаться к внешней памяти.
  • Квантизация: Сокращает разрядность данных (например, с 16 бит до 4 или 8), уменьшая объем передаваемой информации.
  • TurboQuant: Новая техника от Google, представленная на конференции ICLR 2026. Она использует математическое преобразование (вращение) для стандартизации распределения данных перед сжатием. Это позволяет снизить объем кэша KV в 5 раз (с 16 бит до 3–4 бит), практически не теряя качества ответа.

TurboQuant приближает эффективность сжатия данных к теоретическому пределу. Дальнейшее улучшение качества сжатия без потери информации становится крайне сложным, что означает исчерпание потенциала чисто программных решений.

Новый вектор: физическое сближение памяти и процессора

Поскольку оптимизация кода упирается в физические ограничения, индустрия переходит к изменению самой архитектуры чипов и систем. Цель — сократить расстояние, которое проходит каждый бит данных.

Ключевые технологические направления:

  • HBM (High Bandwidth Memory): Многослойная память, физически размещенная рядом с GPU. Она обеспечивает высокую пропускную способность за счет вертикального соединения чипов.
  • CXL (Compute Express Link): Стандарт, позволяющий использовать память как общий ресурс для всей системы (CPU, GPU, ускорители), а не только для конкретного процессора.
  • PIM (Processing-in-Memory): Технология, добавляющая вычислительные функции непосредственно в чипы памяти. Часть обработки происходит там, где хранятся данные, что радикально сокращает время ожидания.

Эти подходы указывают на то, что будущее ИИ-инфраструктуры зависит не от отдельного «суперчипа», а от системной интеграции: как память упакована, как она соединена с процессором и как организованы потоки данных в дата-центре.

Практические выводы для бизнеса

  • Смена критериев выбора железа: При закупке ИИ-инфраструктуры важными метриками становятся не только количество TFLOPS (триллионов операций в секунду) у GPU, но и пропускная способность памяти (HBM) и архитектура системы.
  • Рост значимости производителей памяти: Конкуренция в сфере ИИ смещается от поставщиков графических чипов к компаниям, разрабатывающим высокопроизводительную память (SK hynix, Samsung, Micron). Контроль над технологиями HBM и CXL становится стратегическим активом.
  • Ограничения масштабирования: Попытки ускорить ИИ исключительно путем увеличения числа GPU в кластере могут столкнуться с эффектом убывающей отдачи из-за «узких мест» в передаче данных. Инвестиции должны учитывать системную архитектуру, а не только вычислительную мощность.

Когда фактов слишком много нужна система

Асектор превращает поток новостей в понятную картину: что произошло, на что это влияет и чем может обернуться. Без шума. С доказательной базой.

Коротко о главном

Какое предсказание 1994 года о «стене памяти» подтвердилось в сфере ИИ?

Уильям Вулф и Салли Макки указали на разрыв между ростом производительности процессоров (~60% в год) и скоростью доступа к DRAM (~7%). Сегодня ускорители достигают петафлопсов, но извлечение весов модели не успевает за этим темпом, что приводит к простоям вычислительных блоков.

Почему программные методы оптимизации, такие как FlashAttention и TurboQuant, достигают предела?

Эти техники позволяют снизить объем передаваемых данных (например, TurboQuant сокращает кэш KV в 5 раз до 3–4 бит), но дальнейшее сжатие без потери качества становится крайне сложным. Это свидетельствует об исчерпании потенциала чисто алгоритмических решений перед лицом физических ограничений.

Какую роль играет кэш KV в контексте длинной генерации текстов?

Кэш позволяет модели сохранять предыдущие токены без повторного пересчета, однако при работе с длинным контекстом объем этих данных может превышать размер самой модели. Например, для модели на 70 млрд параметров (вес ~140 ГБ) кэш требует еще больших ресурсов пропускной способности и памяти.

Почему индустрия переходит от программного обеспечения к физическому сближению памяти и процессора?

Поскольку оптимизация кода упирается в физические барьеры, фокус смещается на сокращение расстояния прохождения каждого бита данных. Это реализуется через технологии HBM (вертикальное соединение), CXL (общий пул памяти) и PIM (вычисления внутри чипов памяти).

Почему контроль над технологиями HBM и CXL становится стратегическим активом?

Конкуренция в ИИ смещается от поставщиков графических чипов к производителям высокопроизводительной памяти, таким как SK hynix, Samsung и Micron. Это происходит потому, что эффективность системы теперь зависит не только от мощности GPU, но и от того, как организована передача данных между компонентами.

Почему увеличение числа GPU в кластере может привести к эффекту убывающей отдачи?

Попытки ускорить ИИ исключительно за счет добавления вычислительных мощностей сталкиваются с «узкими местами» в передаче данных. Инвестиции должны учитывать системную архитектуру и пропускную способность памяти, а не только количество триллионов операций (TFLOPS) у графических процессоров.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Передовые технологии

Материалы по теме