Июль 2026   |   В фокусе

NeuML представила AstroBERT Small: 22,7 млн параметров против 8 млрд с ускорением в 95 раз

Компактная модель в 22,7 млн параметров выигрывает у гигантов в 8 млрд по скорости поиска в 95 раз, теряя менее 5% точности. Стратегия сужения области применения ИИ превращает гонку за размером в экономический проигрыш, делая мощные вычисления доступными на обычном оборудовании.

Компания NeuML представила серию узкоспециализированных языковых моделей AstroBERT Small объемом всего 22,7 млн параметров, обученных на астрономических данных. Эти компактные решения демонстрируют производительность, сопоставимую с моделями, в 10–100 раз больше, что подтверждает эффективность сужения области применения ИИ. Вместо использования универсальных гигантских сетей для узких задач, разработчики предлагают использовать специализированные модели, которые работают быстрее и требуют меньше ресурсов.

Архитектура и обучение

В основе подхода лежит создание базовой модели-энкодера, обученной исключительно на рефератах с платформы ArXiv по разделу astro-ph и статьях Википедии, помеченных как связанные с астрономией. Для обучения использовалась методика скрытого языкового моделирования (masked language modeling).

  • Базовая модель: AstroBERT Small Base (22,7 млн параметров). Предназначена для дальнейшего дообучения под конкретные задачи, такие как классификация текста или извлечение сущностей.
  • Модель эмбеддингов: AstroBERT Small Embeddings. Специализированный инструмент для генерации векторных представлений текста (sentence transformers).

Второй этап работы включал создание модели для векторизации. Для этого использовалась технология дистилляции (передачи знаний), когда компактная модель обучалась на примерах, сгенерированных более крупной моделью Qwen3-Embedding-8B. Это позволило сохранить качество векторов при значительном сокращении размера модели.

Важный нюанс: Качество компактной модели напрямую зависит от того, насколько релевантным и объемным был корпус данных для предобучения. Без качественной базы знаний дистилляция от большой модели не даст ожидаемого результата.

Сравнительная эффективность

Тестирование проводилось на наборе данных, совместимом с BEIR, с использованием метрики NDCG (нормализованный дисконтированный накопленный выигрыш). Результаты показывают, что специализация позволяет малым моделям обгонять крупные универсальные аналоги в своей предметной области.

МодельПараметрыNDCGВремя индексаВремя поискаЗанятое место
AstroBERT Small Embeddings22,7 млн69,099,9 с0,42 с16 МБ
all-MiniLM-L6-v222,7 млн40,4512,50 с0,38 с16 МБ
DenseOn149 млн61,4667,35 с0,77 с31 МБ
EmbeddingGemma300 млн57,4486,17 с1,43 с31 МБ
Qwen3-Embedding-0.6B600 млн65,73114,17 с2,20 с41 МБ
Qwen3-Embedding-4B4000 млн71,14545,28 с9,89 с103 МБ
Qwen3-Embedding-8B8000 млн73,84941,82 с17,24 с164 МБ

Модель AstroBERT Small Embeddings значительно превосходит аналогичную по размеру модель all-MiniLM-L6-v2 и опережает модель Qwen3-Embedding-0.6B, которая в 25 раз больше по количеству параметров. Единственный показатель, где она уступает, — это результат модели-учителя Qwen3-Embedding-8B, от которой она получила знания.

Стоит учесть: Разница в точности между компактной моделью и гигантом в 8 млрд параметров составляет менее 5 пунктов по метрике NDCG, при этом время индексируемого поиска у малой модели в 95 раз быстрее.

Операционные последствия и практическое применение

  • Работа на CPU: Модель оптимизирована для развертывания на системах без мощных видеокарт. При размере всего 16 МБ она позволяет запускать сложные задачи поиска и классификации на стандартном оборудовании, что снижает затраты на инфраструктуру.
  • Экономия ресурсов: Использование узкоспециализированных моделей вместо универсальных снижает нагрузку на вычислительные мощности и дисковое пространство. Это критично для проектов с ограниченным бюджетом или работающих в автономных средах.
  • Специализация как тренд: Данные подтверждают гипотезу, что для решения задач в узкой предметной области (астрономия, медицина, спорт) не требуются модели общего назначения. Фокус на качестве данных в конкретной нише дает больший прирост эффективности, чем простое увеличение количества параметров.

На фоне этого: Стратегия «меньше, но точнее» становится экономически обоснованной альтернативой гонке за увеличением параметров, особенно для корпоративных задач с четкой тематикой.

Все представленные модели распространяются под лицензией Apache 2.0, что позволяет свободно использовать их в коммерческих и некоммерческих проектах.

Коротко о главном

На каких данных обучалась базовая версия AstroBERT Small?

Обучение проводилось исключительно на рефератах с платформы ArXiv по разделу astro-ph и астрономических статьях Википедии, что обеспечило высокую релевантность для узкой предметной области.

Как была получена модель векторизации AstroBERT Small Embeddings?

Она создана методом дистилляции знаний от более крупной модели Qwen3-Embedding-8B, что позволило сохранить качество векторов при значительном сокращении размера.

Насколько быстро работает AstroBERT Small по сравнению с гигантскими аналогами?

Время индексируемого поиска у компактной модели в 95 раз быстрее, чем у модели-учителя с 8 млрд параметров, несмотря на минимальную разницу в точности.

Какие результаты показала AstroBERT Small по метрике NDCG в тестах?

Модель достигла показателя 69,09, что позволило ей превзойти модель Qwen3-Embedding-0.6B, которая в 25 раз больше по количеству параметров.

Сколько дискового пространства занимает AstroBERT Small Embeddings?

Размер модели составляет всего 16 МБ, что делает её идеальной для развертывания в автономных средах с ограниченным бюджетом и ресурсами.

Какой лицензией распространяются представленные модели?

Все модели доступны под лицензией Apache 2.0, что дает право свободно использовать их как в коммерческих, так и в некоммерческих проектах.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Промышленность; Космическая промышленность; Передовые технологии

Материалы по теме