OpenRouter опубликовал рейтинг 425 ИИ-моделей: качество корейского языка не связано со скоростью
GiniGEN AI провела стресс-тест 425 ИИ-моделей на OpenRouter, выявив критический разрыв между скоростью ответа и качеством понимания корейского языка. Лишь 8,5% алгоритмов корректно используют уважительные формы, что делает «универсальный» выбор ИИ невозможным для бизнеса.
Команда GiniGEN AI представила детальный рейтинг, охватывающий все 425 моделей, доступных на платформе OpenRouter. В отличие от стандартных таблиц, этот лидерборд объединяет три ключевых фактора: стоимость за миллион токенов, измеренную скорость ответа и качество генерации текста на корейском языке. Данные обновляются ежедневно, а API для доступа к ним открыт.
Главный вывод исследования: модель, которая выигрывает по цене или скорости, почти никогда не лидирует по качеству перевода или понимания языка. Для бизнеса это означает, что выбор «универсального» ИИ невозможен — инструмент нужно подбирать под конкретную задачу.
Качество корейского языка: где модели проваливаются
Корейский язык требует соблюдения строгих правил вежливости и знания локальных реалий. Исследователи разбили оценку на семь осей, чтобы увидеть, где именно алгоритмы ошибаются. Оказалось, что две категории дают максимальное количество ошибок.
- Уважительные формы (Honorifics): Лишь 8,5% моделей получают высший балл «A». Большинство некорректно применяют уровни вежливости, что критично для деловой переписки в Корее.
- Знание институтов и законов: Только 9,4% моделей правильно отражают факты о корейском трудовом праве, налогах и процедурах государственных органов.
Модели часто пишут грамматически правильный, но фактически неверный текст. Например, они могут выдумывать нормы корейского законодательства в идеальной языковой оболочке. Такой контент опаснее явно «битого» перевода, так как ошибки трудно заметить при визуальном контроле.
Распределение общего качества среди всех моделей выглядит следующим образом:
- A+ и выше: менее 8% моделей.
- B (средний уровень): около 34%.
- F (неудовлетворительно): 33,6% моделей полностью проваливают тест.
Интересный нюанс: свежесть модели не гарантирует качество. Среди лидеров с идеальным баллом 3.00 есть gpt-3.5-turbo-16k, выпущенная в 2023 году. Это подтверждает, что корейский язык нужно тестировать отдельно для каждой версии, опираясь на бенчмарки английского языка здесь бесполезно.
Скорость и цена: разные лидеры
В исследовании скорость измерялась не теоретически, а фактически: авторы отправили идентичный запрос 329 моделям через платный API и зафиксировали время до первого токена (first-token latency).
Лидеры в разных категориях:
- Скорость:
NVIDIA Nemotron 3 Nano Omni(бесплатная) показала результат 128 мс. Однако ее качество корейского языка оценено как «F». - Цена/Качество:
Mistral Nemoстоит $0,049 за миллион токенов при оценке качества «C». - Чистое качество:
Google Nano Banana 2(Gemini 3.1 Flash Image) получила максимальный балл «A+++», но не лидирует по цене или скорости.
Отсутствие единого победителя в таблице означает, что бизнесу приходится выбирать компромисс: либо платить больше за точность, либо жертвовать скоростью ради экономии, либо мириться с ошибками в локализации.
Инфраструктура и данные
Среди 107 провайдеров, обслуживающих эти модели, география распределена неравномерно:
- США: 55 компаний.
- Сингапур: 6.
- Китай: 6.
- Южная Корея: 0 (среди тех, кто указал штаб-квартиру).
Для корпоративных закупок в Корее важным фактором является физическое расположение данных. В рейтинге эта информация вынесена на первый план, так как регуляторные требования к хранению данных часто диктуют выбор хостинга, а не только качество модели.
Данные доступны через открытый API без необходимости регистрации:
GET /api/korean— оценки качества по 7 осям.GET /api/speed— измеренная задержка и скорость генерации.GET /api/models— цены, контекст и модальности.
Обновление данных происходит ежедневно в 08:00 по корейскому времени (KST).
Подтверждение: huggingface.co