Рейтинг ИИ исказили узкоспециализированные алгоритмы — лидеры не умеют понимать контекст
Миниатюрные ИИ-модели взломали рейтинги, показав заоблачные результаты в арифметике и обойдя полноценные аналоги, превосходящие их в 50 раз. Теперь высокая позиция в топе больше не гарантирует универсальность, а выбор инструмента для бизнеса требует проверки реальных навыков, а не только общего балла.
На платформе Open SLM Leaderboard, где соревнуются модели искусственного интеллекта размером менее 150 млн параметров, произошла массовая фальсификация результатов. Несколько лабораторий выпустили модели, способные решать только арифметические задачи из теста Arithmark 2, но лишенные других навыков. Благодаря уязвимости в системе подсчета среднего балла, эти узкоспециализированные решения заняли верхние строчки рейтинга, обойдя полноценные модели, превосходящие их по размеру в 50 раз.
Важный нюанс: Высокая позиция в рейтинге больше не гарантирует универсальность модели. Текущий топ заполнен алгоритмами, которые отлично считают, но не способны понимать контекст или выполнять другие задачи.
Как взломали систему рейтинга
Ситуация началась с релиза модели Atom 2.7M. Она содержит всего 2,7 млн параметров и набрала 69,40% в тесте Arithmark 2. Поскольку рейтинг по умолчанию сортирует участников по среднему арифметическому значению, этот высокий балл по одному параметру искусственно завысил общую оценку. Модель заняла 6-е место в общем зачете, несмотря на крошечный размер.
Другие лаборатории быстро подхватили эту тактику. Они начали выпускать модели, обученные исключительно на синтетических арифметических данных. Эти алгоритмы не обладают реальными когнитивными способностями, но показывают заоблачные средние результаты.
Команда AxiomicLabs попыталась исправить ситуацию, принудительно опустив все выявленные узкоспециализированные модели на дно списка. Это сработало временно. Лаборатория Ideoa Labs нашла новый обходной путь: они увеличили количество параметров в своих моделях, сохранив при этом обучение только на арифметике.
В результате:
- Модель Nexus-Erebus-50M заняла 1-е место в категории моделей меньше 100 млн параметров.
- Модель Nexus-Erebus-135M стала лидером в общем рейтинге.
Сейчас именно Nexus-Erebus-135M держит позицию лидера, хотя по сути это тот же узкоспециализированный инструмент, что и Atom 2.7M, но с большим объемом данных.
Попытка исправить алгоритм классификации
Разработчики платформы Open SLM Leaderboard признали, что сравнивать такие модели с универсальными некорректно. Они начали работу над исправлением уязвимости через систему предложений по коду (PR).
Первый шаг — предложение PR 56. Оно меняет логику классификатора «специалист». Теперь модель будет автоматически помечаться как узкоспециализированная, если её результат в Arithmark 2 превышает результат в тесте Hellaswag (оценка понимания контекста) более чем на 30 процентных пунктов.
Стоит учесть: Новый алгоритм уже классифицирует лидера Nexus-Erebus-135M как узкоспециализированную модель, но пока не затрагивает Nexus-Erebus-50M. Это временное решение, требующее доработки.
Разработчики планируют отправлять новые исправления, чтобы охватить и оставшиеся модели-исключения. Важно отметить, что создатели не называют эти модели плохими. Проблема заключается в том, что их нельзя сравнивать с обычными ИИ в одном рейтинге, так как они оптимизированы только под одну задачу.
Операционные последствия и тренды
- Необходимость проверки метрик: При выборе модели для внедрения в бизнес-процессы нельзя опираться только на общую позицию в рейтинге. Необходимо анализировать результаты по отдельным тестам, чтобы убедиться в универсальности алгоритма.
- Риск ложных лидеров: В сегменте малых моделей (SLM) высока вероятность встретить решения, которые демонстрируют выдающиеся результаты в узкой нише, но бесполезны в реальных сценариях, требующих гибкости.
- Эволюция стандартов оценки: Инцидент показывает, что статические рейтинги уязвимы для «гейминга» (намеренного манипулирования результатами). Платформам придется постоянно обновлять алгоритмы фильтрации, чтобы отделить универсальные модели от узкоспециализированных.
Источник: huggingface.co