Июль 2026   |   В фокусе

Cohere Transcribe Arabic: точность распознавания диалектов выше, чем у Whisper v3

Точность распознавания арабской речи с диалектами и смешением языков выросла на 11 пунктов, обходя лидеров рынка. Открытые веса модели позволяют интегрировать решение в бизнес-системы без лицензионных отчислений, но требуют внедрения дополнительных модулей для фильтрации шумов.

Компания Cohere выпустила модель Cohere Transcribe Arabic с открытым исходным кодом. Решение создано для работы в реальных бизнес-условиях, где пользователи смешивают арабский и английский языки, а также используют различные диалекты. Модель показала лучший результат среди открытых аналогов, снизив количество ошибок распознавания по сравнению с лидерами рынка Whisper v3 Large и OmniASR LLM 7B. Доступ к весам модели открыт под лицензией Apache 2.0, что позволяет интегрировать её в собственные системы без лицензионных ограничений.

Важный нюанс: Модель не просто переводит речь в текст, а сохраняет диалектные особенности и смешение языков, что критично для понимания смысла в деловой переписке и аналитике.

Технические характеристики и точность

Разработчики опирались на архитектуру с 2 миллиардами параметров, используя кодировщик FastConformer для акустического моделирования и декодер Transformer для генерации текста. Обучение велось на сбалансированном наборе данных, включающем арабский язык, английский с арабским акцентом и чистый английский. Особое внимание уделено трем аспектам:

  • Разнообразие диалектов: Данные перераспределены так, чтобы ни один диалект не доминировал, что позволяет модели работать с египетским, левантийским, магребийским и другими вариантами речи.
  • Смешение языков (Code-switching): В набор включены примеры естественного переключения между арабским и английским, характерного для профессиональной среды.
  • Акустическое разнообразие: Записи собраны с разных устройств в шумных условиях, дополненные синтетическими данными для редких сценариев.

На публичной лидерборде Hugging Face Arabic ASR модель заняла первое место с показателем средней ошибки распознавания слов (WER) на уровне 25,87%. Это улучшение на 2,45 пункта по сравнению с предыдущим лидером OmniASR-LLM-7B и на 11 пунктов лучше, чем у Whisper v3 Large.

МодельСредний WERSADACommon VoiceMASC (чистый)MASC (шум)MGB-2Casablanca
Cohere Transcribe Arabic25,8737,475,8215,5427,0715,5449,71
OmniASR-LLM-7B28,3241,619,7519,6929,2914,1356,46
Cohere Transcribe30,6760,118,178,6619,0125,3362,71
Whisper v3 Large36,8655,9617,8324,6634,6316,2671,81

Данные таблицы отражают результаты на рынке открытых моделей по состоянию на 23.06.26. Тесты проводились на шести наборах данных, охватывающих современный стандартный арабский и региональные диалекты.

Внутренние тесты подтвердили преимущество в распознавании конкретных диалектов и смешанной речи. Например, на наборе данных Casablanca, оценивающем разговорную речь восьми диалектов, модель обогнала OmniASR почти на шесть пунктов. В тестах с участием носителей языка Cohere Transcribe Arabic была предпочтительнее Whisper в 95,8% случаев благодаря лучшей сохранности диалекта и корректной передаче английских терминов в латинице.

Стоит учесть: Существующие решения часто «выравнивают» диалектную речь до стандартного арабского, теряя нюансы. Новая модель сохраняет оригинальную речь, что повышает точность семантического анализа.

Производительность и ограничения

Система оптимизирована для работы в продакшене с высокой нагрузкой. Использование фреймворка vLLM позволило увеличить пропускную способность в 2 раза. Показатель RTFx (коэффициент множественности реального времени) достиг 525, что значительно выше показателей 146 у Whisper v3 Large и 66 у OmniASR LLM-7B. Это означает, что модель обрабатывает аудио быстрее, чем оно воспроизводится, что критично для систем реального времени.

Однако у решения есть технические ограничения, которые необходимо учитывать при внедрении:

  • Тегирование языка: Модель требует указания тега языка (арабский или английский) на входе. Оптимизация смешанной речи работает лучше, если основной язык указан как матричный.
  • Отсутствие фильтрации шума: Как и многие модели этого класса, система склонна транскрибировать фоновые шумы. Для корректной работы требуется предварительная обработка через детектор активности голоса (VAD) или шумоподавление.
  • Отсутствие дополнительных функций: Модель не генерирует временные метки для слов и не выполняет разделение спикеров (диаризацию).

На фоне этого: Высокая скорость обработки компенсируется необходимостью внедрения дополнительных модулей для очистки звука, что увеличивает сложность архитектуры решения.

Операционные последствия, тренды и практические аспекты

  • Требования к инфраструктуре: Для корректной работы системы необходимо внедрить модуль обнаружения голоса (VAD) на этапе предобработки, иначе фоновый шум будет восприниматься как речь, что снизит качество итоговой транскрипции.
  • Зависимость от настройки ввода: Производительность при смешении языков напрямую зависит от правильного указания основного языка в запросе, что требует четкой настройки логики вызова API со стороны разработчика.
  • Расширение функционала: Отсутствие встроенной диаризации (разделения спикеров) означает, что для анализа многопользовательских разговоров потребуется интеграция сторонних решений, что может увеличить задержки и стоимость обработки.
  • Экономический эффект: Доступность модели под лицензией Apache 2.0 позволяет компаниям избежать лицензионных платежей за использование, но требует затрат на адаптацию под специфические диалекты и настройку конвейера обработки данных.

Модель доступна для скачивания на платформе Hugging Face и через API Cohere с бесплатным доступом (с ограничениями по частоте запросов). Для промышленного использования без лимитов предусмотрен сервис Model Vault с оплатой за час работы экземпляра.

Коротко о главном

Какой показатель средней ошибки распознавания слов (WER) достигла новая модель?

На лидерборде Hugging Face Arabic ASR модель заняла первое место с результатом 25,87%, что на 2,45 пункта лучше, чем у предыдущего лидера OmniASR-LLM-7B. Такое снижение ошибок стало возможным благодаря обучению на сбалансированных данных, включающих различные диалекты и смешанную речь.

Какую архитектуру и количество параметров использует модель?

Разработчики применили архитектуру с 2 миллиардами параметров, объединив кодировщик FastConformer для акустического моделирования и декодер Transformer для генерации текста. Этот выбор позволил эффективно обрабатывать сложные сценарии, такие как переключение между арабским и английским языками в профессиональной среде.

Какой коэффициент множественности реального времени (RTFx) демонстрирует система?

Модель достигла показателя RTFx 525, что в 3,6 раза выше, чем у Whisper v3 Large, и в 8 раз выше, чем у OmniASR LLM-7B. Высокая скорость обработки, обеспеченная фреймворком vLLM, делает систему пригодной для задач реального времени, где критична мгновенная транскрипция.

Какие технические ограничения требуют внедрения дополнительных модулей?

Система не выполняет фильтрацию фонового шума и не проводит разделение спикеров, что требует подключения внешних детекторов активности голоса (VAD) и решений для диаризации. Без предварительной очистки звука модель склонна транскрибировать фоновые шумы как речь, что снижает качество итогового текста.

Как зависит точность работы модели от настроек ввода?

Для корректного распознавания смешанной речи необходимо явно указывать тег основного языка (арабский или английский) на входе. Производительность системы напрямую зависит от этой настройки, так как алгоритм оптимизирован для работы с матричным языком, указанным в запросе.

Какие условия доступа предусмотрены для промышленного использования модели?

Веса модели доступны бесплатно на Hugging Face и через API Cohere с ограничениями по частоте запросов, тогда как для работы без лимитов требуется сервис Model Vault с оплатой за час. Это позволяет компаниям начать тестирование без затрат, но требует бюджета на масштабирование инфраструктуры для больших нагрузок.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); ПО и разработка; Передовые технологии

Материалы по теме