Июль 2026   |   В фокусе

Рейтинг ИИ исказили узкоспециализированные алгоритмы — лидеры не умеют понимать контекст

Миниатюрные ИИ-модели взломали рейтинги, показав заоблачные результаты в арифметике и обойдя полноценные аналоги, превосходящие их в 50 раз. Теперь высокая позиция в топе больше не гарантирует универсальность, а выбор инструмента для бизнеса требует проверки реальных навыков, а не только общего балла.

На платформе Open SLM Leaderboard, где соревнуются модели искусственного интеллекта размером менее 150 млн параметров, произошла массовая фальсификация результатов. Несколько лабораторий выпустили модели, способные решать только арифметические задачи из теста Arithmark 2, но лишенные других навыков. Благодаря уязвимости в системе подсчета среднего балла, эти узкоспециализированные решения заняли верхние строчки рейтинга, обойдя полноценные модели, превосходящие их по размеру в 50 раз.

Важный нюанс: Высокая позиция в рейтинге больше не гарантирует универсальность модели. Текущий топ заполнен алгоритмами, которые отлично считают, но не способны понимать контекст или выполнять другие задачи.

Как взломали систему рейтинга

Ситуация началась с релиза модели Atom 2.7M. Она содержит всего 2,7 млн параметров и набрала 69,40% в тесте Arithmark 2. Поскольку рейтинг по умолчанию сортирует участников по среднему арифметическому значению, этот высокий балл по одному параметру искусственно завысил общую оценку. Модель заняла 6-е место в общем зачете, несмотря на крошечный размер.

Другие лаборатории быстро подхватили эту тактику. Они начали выпускать модели, обученные исключительно на синтетических арифметических данных. Эти алгоритмы не обладают реальными когнитивными способностями, но показывают заоблачные средние результаты.

Команда AxiomicLabs попыталась исправить ситуацию, принудительно опустив все выявленные узкоспециализированные модели на дно списка. Это сработало временно. Лаборатория Ideoa Labs нашла новый обходной путь: они увеличили количество параметров в своих моделях, сохранив при этом обучение только на арифметике.

В результате:

  • Модель Nexus-Erebus-50M заняла 1-е место в категории моделей меньше 100 млн параметров.
  • Модель Nexus-Erebus-135M стала лидером в общем рейтинге.

Сейчас именно Nexus-Erebus-135M держит позицию лидера, хотя по сути это тот же узкоспециализированный инструмент, что и Atom 2.7M, но с большим объемом данных.

Попытка исправить алгоритм классификации

Разработчики платформы Open SLM Leaderboard признали, что сравнивать такие модели с универсальными некорректно. Они начали работу над исправлением уязвимости через систему предложений по коду (PR).

Первый шаг — предложение PR 56. Оно меняет логику классификатора «специалист». Теперь модель будет автоматически помечаться как узкоспециализированная, если её результат в Arithmark 2 превышает результат в тесте Hellaswag (оценка понимания контекста) более чем на 30 процентных пунктов.

Стоит учесть: Новый алгоритм уже классифицирует лидера Nexus-Erebus-135M как узкоспециализированную модель, но пока не затрагивает Nexus-Erebus-50M. Это временное решение, требующее доработки.

Разработчики планируют отправлять новые исправления, чтобы охватить и оставшиеся модели-исключения. Важно отметить, что создатели не называют эти модели плохими. Проблема заключается в том, что их нельзя сравнивать с обычными ИИ в одном рейтинге, так как они оптимизированы только под одну задачу.

Операционные последствия и тренды

  • Необходимость проверки метрик: При выборе модели для внедрения в бизнес-процессы нельзя опираться только на общую позицию в рейтинге. Необходимо анализировать результаты по отдельным тестам, чтобы убедиться в универсальности алгоритма.
  • Риск ложных лидеров: В сегменте малых моделей (SLM) высока вероятность встретить решения, которые демонстрируют выдающиеся результаты в узкой нише, но бесполезны в реальных сценариях, требующих гибкости.
  • Эволюция стандартов оценки: Инцидент показывает, что статические рейтинги уязвимы для «гейминга» (намеренного манипулирования результатами). Платформам придется постоянно обновлять алгоритмы фильтрации, чтобы отделить универсальные модели от узкоспециализированных.

Коротко о главном

Почему модель Nexus-Erebus-135M стала лидером общего рейтинга?

Лаборатория Ideoa Labs увеличила количество параметров в алгоритме, обученном только на арифметике, что позволило обойти временные ограничения, введенные командой AxiomicLabs, и занять первое место.

Какой критерий в PR 56 определяет модель как узкоспециализированную?

Разработчики ввели правило, согласно которому модель помечается как «специалист», если её результат в тесте Arithmark 2 превышает показатель в тесте Hellaswag более чем на 30 процентных пунктов.

Почему текущий топ рейтинга не гарантирует универсальность ИИ?

Верхние строчки заняли алгоритмы, способные решать только арифметические задачи, но лишенные навыков понимания контекста, что делает их бесполезными для широкого круга задач.

Какую тактику использовали лаборатории после блокировки малых моделей?

Разработчики начали выпускать решения с увеличенным объемом параметров, сохраняя обучение исключительно на синтетических арифметических данных, чтобы сохранить высокие средние результаты.

Почему модель Nexus-Erebus-50M пока не попала под действие нового фильтра?

Несмотря на то, что лидер рейтинга Nexus-Erebus-135M уже классифицирован как узкоспециализированный, текущая версия алгоритма еще не охватывает модель с 50 млн параметров, требующую доработки.

Какой риск возникает при выборе ИИ-модели только по общей позиции в списке?

Существует вероятность внедрения в бизнес-процессы алгоритмов, демонстрирующих выдающиеся результаты в узкой нише, но не способных работать в реальных сценариях, требующих гибкости.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Аналитика и исследования; Тренды и кейсы

Материалы по теме