Сентябрь 2026   |   В фокусе

OpenRouter опубликовал рейтинг 425 ИИ-моделей: качество корейского языка не связано со скоростью

GiniGEN AI провела стресс-тест 425 ИИ-моделей на OpenRouter, выявив критический разрыв между скоростью ответа и качеством понимания корейского языка. Лишь 8,5% алгоритмов корректно используют уважительные формы, что делает «универсальный» выбор ИИ невозможным для бизнеса.

Команда GiniGEN AI представила детальный рейтинг, охватывающий все 425 моделей, доступных на платформе OpenRouter. В отличие от стандартных таблиц, этот лидерборд объединяет три ключевых фактора: стоимость за миллион токенов, измеренную скорость ответа и качество генерации текста на корейском языке. Данные обновляются ежедневно, а API для доступа к ним открыт.

Главный вывод исследования: модель, которая выигрывает по цене или скорости, почти никогда не лидирует по качеству перевода или понимания языка. Для бизнеса это означает, что выбор «универсального» ИИ невозможен — инструмент нужно подбирать под конкретную задачу.

Качество корейского языка: где модели проваливаются

Корейский язык требует соблюдения строгих правил вежливости и знания локальных реалий. Исследователи разбили оценку на семь осей, чтобы увидеть, где именно алгоритмы ошибаются. Оказалось, что две категории дают максимальное количество ошибок.

  • Уважительные формы (Honorifics): Лишь 8,5% моделей получают высший балл «A». Большинство некорректно применяют уровни вежливости, что критично для деловой переписки в Корее.
  • Знание институтов и законов: Только 9,4% моделей правильно отражают факты о корейском трудовом праве, налогах и процедурах государственных органов.

Модели часто пишут грамматически правильный, но фактически неверный текст. Например, они могут выдумывать нормы корейского законодательства в идеальной языковой оболочке. Такой контент опаснее явно «битого» перевода, так как ошибки трудно заметить при визуальном контроле.

Распределение общего качества среди всех моделей выглядит следующим образом:

  • A+ и выше: менее 8% моделей.
  • B (средний уровень): около 34%.
  • F (неудовлетворительно): 33,6% моделей полностью проваливают тест.

Интересный нюанс: свежесть модели не гарантирует качество. Среди лидеров с идеальным баллом 3.00 есть gpt-3.5-turbo-16k, выпущенная в 2023 году. Это подтверждает, что корейский язык нужно тестировать отдельно для каждой версии, опираясь на бенчмарки английского языка здесь бесполезно.

Скорость и цена: разные лидеры

В исследовании скорость измерялась не теоретически, а фактически: авторы отправили идентичный запрос 329 моделям через платный API и зафиксировали время до первого токена (first-token latency).

Лидеры в разных категориях:

  • Скорость: NVIDIA Nemotron 3 Nano Omni (бесплатная) показала результат 128 мс. Однако ее качество корейского языка оценено как «F».
  • Цена/Качество: Mistral Nemo стоит $0,049 за миллион токенов при оценке качества «C».
  • Чистое качество: Google Nano Banana 2 (Gemini 3.1 Flash Image) получила максимальный балл «A+++», но не лидирует по цене или скорости.

Отсутствие единого победителя в таблице означает, что бизнесу приходится выбирать компромисс: либо платить больше за точность, либо жертвовать скоростью ради экономии, либо мириться с ошибками в локализации.

Инфраструктура и данные

Среди 107 провайдеров, обслуживающих эти модели, география распределена неравномерно:

  • США: 55 компаний.
  • Сингапур: 6.
  • Китай: 6.
  • Южная Корея: 0 (среди тех, кто указал штаб-квартиру).

Для корпоративных закупок в Корее важным фактором является физическое расположение данных. В рейтинге эта информация вынесена на первый план, так как регуляторные требования к хранению данных часто диктуют выбор хостинга, а не только качество модели.

Данные доступны через открытый API без необходимости регистрации:

  • GET /api/korean — оценки качества по 7 осям.
  • GET /api/speed — измеренная задержка и скорость генерации.
  • GET /api/models — цены, контекст и модальности.

Обновление данных происходит ежедневно в 08:00 по корейскому времени (KST).

Когда фактов слишком много нужна система

Асектор превращает поток новостей в понятную картину: что произошло, на что это влияет и чем может обернуться. Без шума. С доказательной базой.

Коротко о главном

Какие две категории ошибок наиболее критичны для моделей при работе с корейским языком?

Наибольшее количество провалов фиксируется в применении уважительных форм (Honorifics), где высший балл получают лишь 8,5% моделей, и в знании институтов и законов, где корректность демонстрируют только 9,4%. Эти ошибки опасны тем, что текст может быть грамматически безупречным, но фактически неверным, что затрудняет их обнаружение при визуальном контроле.

Какова статистика общего качества 425 протестированных ИИ-моделей?

Менее 8% моделей достигли высшего уровня качества (A+ и выше), около 34% показали средний результат (B), а 33,6% полностью провалили тесты, получив оценку F.

Почему свежесть модели не гарантирует высокое качество на корейском языке?

Среди лидеров с идеальным баллом 3.00 присутствует gpt-3.5-turbo-16k, выпущенная в 2023 году, что доказывает необходимость отдельного тестирования каждой версии. Опора на бенчмарки английского языка оказывается бесполезной при оценке навыков работы с корейским языком.

Какие модели лидируют по скорости и цене/качеству, и каковы их ограничения?

Бесплатная модель NVIDIA Nemotron 3 Nano Omni показала лучшую скорость в 128 мс, но получила наихудшую оценку качества «F». Модель Mistral Nemo предлагает лучшее соотношение цены ($0,049 за миллион токенов) и качества (оценка C), оставаясь не лидером ни в одной из категорий.

Почему отсутствие южнокорейских провайдеров среди 107 компаний является значимым фактором?

Среди поставщиков нет ни одной компании со штаб-квартирой в Южной Корее, при доминировании США (55 компаний). Для корпоративных закупок в Корее это критично, так как регуляторные требования к физическому расположению данных часто определяют выбор хостинга сильнее, чем качество самой модели.

Как организован доступ к данным рейтинга и какова периодичность их обновления?

Данные доступны через открытый API без регистрации по эндпоинтам для качества, скорости и характеристик моделей. Обновление информации происходит ежедневно в 08:00 по корейскому времени (KST).

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Аналитика и исследования

Материалы по теме