Июль 2026   |   В фокусе

VIDRAFT Aether-7B-5Attn: полный код обучения меняет правила суверенитета ИИ

Южнокорейский стартап VIDRAFT опубликовал полный рецепт создания ИИ-модели, включая код и данные, что позволяет бизнесу стать настоящим владельцем технологии, а не её арендатором. Это доказывает, что суверенный искусственный интеллект можно построить силами одной компании, но высокие требования к вычислительным мощностям пока ограничивают его массовое внедрение.

Южнокорейский стартап VIDRAFT выпустил модель Aether-7B-5Attn, ставшую первым в мире полностью открытым фундаментом, созданным частной компанией, а не государственным институтом или университетом. Под лицензией Apache-2.0 разработчики отдали не только веса модели, но и исходный код обучения, полные логи, промежуточные контрольные точки и точный рецепт данных. Это решение переводит понятие «суверенный ИИ» из плоскости простого доступа к файлам в плоскость реальной возможности воспроизвести и пересобрать модель с нуля.

Ключевой момент: Настоящий технологический суверенитет достигается не скачиванием готового решения, а наличием полного набора инструкций для его повторного создания. Без доступа к данным и коду обучения организация остается арендатором, а не владельцем технологии.

Архитектура: эксперимент с разнородным вниманием

В основе модели лежит нестандартный подход к построению нейросети. Вместо использования одного и того же механизма внимания на всех 49 слоях, как это принято в индустрии, инженеры разместили 5 различных типов внимания в строгом порядке. Слои организованы по схеме латинского квадрата 7×7, что гарантирует равномерное распределение разных алгоритмов по глубине сети.

Такая структура позволяет каждому слою использовать наиболее подходящий для его задачи механизм:

  • Полное внимание (full): Точный расчет для всех пар токенов, но с высокой вычислительной стоимостью.
  • Скользящее окно (sliding): Дешевый вариант для локального контекста, игнорирующий дальние связи.
  • Дифференциальное внимание (differential): Вычитание карт внимания для снижения шума.
  • Сparse-внимание (nsa): Комбинация сжатых и выбранных ветвей для дальних связей.
  • Гибридный режим: Сочетание механизмов для баланса скорости и точности.

Модель относится к типу Mixture-of-Experts (MoE). Из 6,59 млрд параметров на каждый токен активируется лишь 2,98 млрд, что обеспечивает высокую емкость при меньших вычислительных затратах.

Прозрачность данных и процесс обучения

Обучение модели проводилось на 144,2 млрд токенов в течение 46 дней. Для этого использовался кластер из 16 видеокарт NVIDIA B200. Особое внимание уделено составу данных: 37,8% занимают математические задачи, 21,6% — корейский текст, еще 21,6% — английский контент, 13,5% — код.

Все источники данных являются публичными, а веса смешивания и токенизатор опубликованы. Это позволяет любому исследователю запустить обучение и получить идентичный результат бит в бит. Разработчики также предоставили промежуточные контрольные точки (чекпоинты) на разных этапах обучения, что дает возможность изучать динамику развития способностей модели в реальном времени.

Важный нюанс: Выбор контрольной точки для финальной версии модели производился не по минимальной функции потерь (loss), а по точности на тестовом наборе. Это предотвращает ситуацию, когда модель учится «подгонять формат» ответов, теряя реальную способность к рассуждению.

Операционные последствия, тренды и практические аспекты

  • Отсутствие кэширования: Текущая версия модели не поддерживает быстрое кэширование контекста (KV cache) из-за специфики разнородных механизмов внимания. Это означает, что генерация текста будет работать медленнее по сравнению с оптимизированными коммерческими аналогами, что ограничивает применение в задачах с жесткими требованиями к скорости отклика.
  • Требования к инфраструктуре: Воспроизведение обучения или тонкой настройки потребует доступа к мощным вычислительным ресурсам уровня NVIDIA B200 и глубоких знаний в области распределенных вычислений (FSDP). Для малого бизнеса это создает высокий порог входа для полной независимости.
  • Ограничения пакетной обработки: Из-за особенностей реализации некоторых механизмов внимания (семейство NSA) модель не поддерживает пакетную обработку (batching) последовательностей с разной длиной, заполненных масками. Это снижает пропускную способность при одновременной обработке множества запросов.
  • Смена парадигмы разработки: Появление полностью открытого проекта от частного стартапа сигнализирует о том, что создание фундаментальных моделей больше не является монополией государств. Это может стимулировать появление новых независимых игроков на рынке, способных адаптировать модели под специфические нужды без риска зависимости от проприетарных решений.

Контекст и последствия

Модель Aether-7B-5Attn занимает уникальную нишу среди полностью открытых проектов. В отличие от OLMo (США), Apertus (Швейцария) или LLM-jp (Япония), которые созданы консорциумами или национальными лабораториями, Aether — результат работы одной компании. Это доказывает, что для создания суверенного ИИ-фундамента не обязательно обладать бюджетом государства.

Проект задает высокую планку прозрачности: открыты не только результаты, но и процесс. Для российской аудитории это сигнал о том, что технологический суверенитет возможен при наличии доступа к исходным данным и коду, даже если вычислительные мощности ограничены. Однако текущие технические ограничения (отсутствие кэша, низкая эффективность пакетной обработки) указывают на то, что модель пока служит скорее исследовательским полигоном и эталоном открытости, чем готовым инструментом для массового промышленного внедрения.

Коротко о главном

Как архитектура из 5 типов внимания на 49 слоях влияет на работу нейросети?

Инженеры разместили различные механизмы внимания по схеме латинского квадрата 7×7, чтобы каждый слой использовал наиболее подходящий алгоритм, что обеспечивает баланс между точностью вычислений и скоростью обработки.

Какие данные и ресурсы потребовались для обучения модели за 46 дней?

Обучение на 144,2 млрд токенов проводилось на кластере из 16 видеокарт NVIDIA B200, при этом 37,8% данных составляли математические задачи, а 21,6% — корейский и английский тексты соответственно.

Почему выбор финальной версии модели основывался не на минимальной функции потерь?

Разработчики ориентировались на точность на тестовом наборе, чтобы избежать ситуации, когда модель учится подгонять формат ответов, теряя реальную способность к рассуждению.

Какие технические ограничения возникают из-за разнородных механизмов внимания?

Специфика архитектуры не позволяет использовать кэширование контекста и пакетную обработку последовательностей разной длины, что снижает скорость генерации и пропускную способность по сравнению с коммерческими аналогами.

Какие требования к инфраструктуре необходимы для воспроизведения обучения модели?

Полная независимость требует доступа к мощным ресурсам уровня NVIDIA B200 и глубоких знаний в области распределенных вычислений FSDP, что создает высокий порог входа для малого бизнеса.

В чем заключается уникальность проекта Aether по сравнению с OLMo или Apertus?

В отличие от иностранных аналогов, созданных консорциумами или национальными лабораториями, эта модель разрабатывалась одной частной компанией, доказывая возможность создания суверенного ИИ без государственного бюджета.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Стартапы и инновации; Передовые технологии

Материалы по теме