SK hynix: память стала главным тормозом ИИ, а не GPU
SK hynix утверждает, что главной помехой для скорости ИИ стала не мощность графических процессоров, а медленная передача данных из памяти. Это меняет приоритеты в закупках железа: теперь важнее пропускная способность чипов памяти, чем количество вычислительных ядер.
SK hynix (корейский производитель чипов) утверждает, что главным ограничителем скорости работы современных ИИ-систем стала архитектура передачи данных, а не мощность графических процессоров (GPU). По мере того как фокус смещается от обучения моделей к их реальному использованию (инференсу) и агентным системам, критичным фактором становится то, насколько быстро данные доставляются к вычислительному ядру.
В эпоху инференса более половины времени GPU может тратиться не на математические операции, а на ожидание данных из памяти. Это структурное ограничение, которое нельзя решить простым добавлением новых видеокарт.
Иллюзия мощности: почему больше GPU — не значит быстрее
Десятилетие назад формула успеха была простой: чем больше GPU и длиннее обучение, тем умнее модель. Этот подход работал в эпоху масштабного предварительного обучения (pretraining), где данные обрабатывались большими пачками (батчами). Однако реальная эксплуатация ИИ работает иначе.
Современные модели генерируют ответы последовательно, токен за токеном, постоянно обращаясь к предыдущим словам для сохранения контекста. В таких сценариях:
- Низкая задержка критична: Система должна отвечать мгновенно, не дожидаясь формирования большого пакета данных.
- Долгий контекст: Модели удерживают в памяти огромные объемы информации (историю диалога, промежуточные результаты рассуждений).
- Частые обращения: Процессор вынужден постоянно «сходить» за новыми данными в память.
Если данные находятся далеко от чипа или каналы передачи узкие, мощные GPU простаивают, ожидая поступления информации. Этот феномен называют «стеной памяти» (memory wall).
Стена памяти: проблема, о которой знали 30 лет назад
В 1994 году ученые Уильям Вулф и Салли Макки предупреждали о разрыве между скоростью процессоров (рост ~60% в год) и скоростью доступа к оперативной памяти DRAM (рост ~7%). Три десятилетия спустя это предсказание сбылось в полной мере в сфере ИИ.
Современные ускорители достигают производительности в петафлопсы (квадриллион операций в секунду), но скорость извлечения весов модели и активаций из памяти не успевает за этим ростом. В результате вычислительные блоки простаивают.
Особую роль играет кэш KV (Key-Value cache) — техника, позволяющая модели «помнить» предыдущие токены без повторного пересчета. При генерации длинных текстов объем данных в этом кэше может превышать размер самой модели. Например, для модели с 70 млрд параметров вес занимают около 140 ГБ, но кэш KV при длинном контексте может потребовать еще больше места и пропускной способности.
Программные костыли достигают предела
Индустрия пыталась решить проблему на уровне программного обеспечения, оптимизируя алгоритмы:
- FlashAttention: Разбивает операции внимания на мелкие блоки, обрабатывая их во встроенной быстрой памяти GPU (SRAM), чтобы реже обращаться к внешней памяти.
- Квантизация: Сокращает разрядность данных (например, с 16 бит до 4 или 8), уменьшая объем передаваемой информации.
- TurboQuant: Новая техника от Google, представленная на конференции ICLR 2026. Она использует математическое преобразование (вращение) для стандартизации распределения данных перед сжатием. Это позволяет снизить объем кэша KV в 5 раз (с 16 бит до 3–4 бит), практически не теряя качества ответа.
TurboQuant приближает эффективность сжатия данных к теоретическому пределу. Дальнейшее улучшение качества сжатия без потери информации становится крайне сложным, что означает исчерпание потенциала чисто программных решений.
Новый вектор: физическое сближение памяти и процессора
Поскольку оптимизация кода упирается в физические ограничения, индустрия переходит к изменению самой архитектуры чипов и систем. Цель — сократить расстояние, которое проходит каждый бит данных.
Ключевые технологические направления:
- HBM (High Bandwidth Memory): Многослойная память, физически размещенная рядом с GPU. Она обеспечивает высокую пропускную способность за счет вертикального соединения чипов.
- CXL (Compute Express Link): Стандарт, позволяющий использовать память как общий ресурс для всей системы (CPU, GPU, ускорители), а не только для конкретного процессора.
- PIM (Processing-in-Memory): Технология, добавляющая вычислительные функции непосредственно в чипы памяти. Часть обработки происходит там, где хранятся данные, что радикально сокращает время ожидания.
Эти подходы указывают на то, что будущее ИИ-инфраструктуры зависит не от отдельного «суперчипа», а от системной интеграции: как память упакована, как она соединена с процессором и как организованы потоки данных в дата-центре.
Практические выводы для бизнеса
- Смена критериев выбора железа: При закупке ИИ-инфраструктуры важными метриками становятся не только количество TFLOPS (триллионов операций в секунду) у GPU, но и пропускная способность памяти (HBM) и архитектура системы.
- Рост значимости производителей памяти: Конкуренция в сфере ИИ смещается от поставщиков графических чипов к компаниям, разрабатывающим высокопроизводительную память (SK hynix, Samsung, Micron). Контроль над технологиями HBM и CXL становится стратегическим активом.
- Ограничения масштабирования: Попытки ускорить ИИ исключительно путем увеличения числа GPU в кластере могут столкнуться с эффектом убывающей отдачи из-за «узких мест» в передаче данных. Инвестиции должны учитывать системную архитектуру, а не только вычислительную мощность.
Подтверждение: news.skhynix.com