Cohere Transcribe Arabic: точность распознавания диалектов выше, чем у Whisper v3
Точность распознавания арабской речи с диалектами и смешением языков выросла на 11 пунктов, обходя лидеров рынка. Открытые веса модели позволяют интегрировать решение в бизнес-системы без лицензионных отчислений, но требуют внедрения дополнительных модулей для фильтрации шумов.
Компания Cohere выпустила модель Cohere Transcribe Arabic с открытым исходным кодом. Решение создано для работы в реальных бизнес-условиях, где пользователи смешивают арабский и английский языки, а также используют различные диалекты. Модель показала лучший результат среди открытых аналогов, снизив количество ошибок распознавания по сравнению с лидерами рынка Whisper v3 Large и OmniASR LLM 7B. Доступ к весам модели открыт под лицензией Apache 2.0, что позволяет интегрировать её в собственные системы без лицензионных ограничений.
Важный нюанс: Модель не просто переводит речь в текст, а сохраняет диалектные особенности и смешение языков, что критично для понимания смысла в деловой переписке и аналитике.
Технические характеристики и точность
Разработчики опирались на архитектуру с 2 миллиардами параметров, используя кодировщик FastConformer для акустического моделирования и декодер Transformer для генерации текста. Обучение велось на сбалансированном наборе данных, включающем арабский язык, английский с арабским акцентом и чистый английский. Особое внимание уделено трем аспектам:
- Разнообразие диалектов: Данные перераспределены так, чтобы ни один диалект не доминировал, что позволяет модели работать с египетским, левантийским, магребийским и другими вариантами речи.
- Смешение языков (Code-switching): В набор включены примеры естественного переключения между арабским и английским, характерного для профессиональной среды.
- Акустическое разнообразие: Записи собраны с разных устройств в шумных условиях, дополненные синтетическими данными для редких сценариев.
На публичной лидерборде Hugging Face Arabic ASR модель заняла первое место с показателем средней ошибки распознавания слов (WER) на уровне 25,87%. Это улучшение на 2,45 пункта по сравнению с предыдущим лидером OmniASR-LLM-7B и на 11 пунктов лучше, чем у Whisper v3 Large.
| Модель | Средний WER | SADA | Common Voice | MASC (чистый) | MASC (шум) | MGB-2 | Casablanca |
|---|---|---|---|---|---|---|---|
| Cohere Transcribe Arabic | 25,87 | 37,47 | 5,82 | 15,54 | 27,07 | 15,54 | 49,71 |
| OmniASR-LLM-7B | 28,32 | 41,61 | 9,75 | 19,69 | 29,29 | 14,13 | 56,46 |
| Cohere Transcribe | 30,67 | 60,11 | 8,17 | 8,66 | 19,01 | 25,33 | 62,71 |
| Whisper v3 Large | 36,86 | 55,96 | 17,83 | 24,66 | 34,63 | 16,26 | 71,81 |
Данные таблицы отражают результаты на рынке открытых моделей по состоянию на 23.06.26. Тесты проводились на шести наборах данных, охватывающих современный стандартный арабский и региональные диалекты.
Внутренние тесты подтвердили преимущество в распознавании конкретных диалектов и смешанной речи. Например, на наборе данных Casablanca, оценивающем разговорную речь восьми диалектов, модель обогнала OmniASR почти на шесть пунктов. В тестах с участием носителей языка Cohere Transcribe Arabic была предпочтительнее Whisper в 95,8% случаев благодаря лучшей сохранности диалекта и корректной передаче английских терминов в латинице.
Стоит учесть: Существующие решения часто «выравнивают» диалектную речь до стандартного арабского, теряя нюансы. Новая модель сохраняет оригинальную речь, что повышает точность семантического анализа.
Производительность и ограничения
Система оптимизирована для работы в продакшене с высокой нагрузкой. Использование фреймворка vLLM позволило увеличить пропускную способность в 2 раза. Показатель RTFx (коэффициент множественности реального времени) достиг 525, что значительно выше показателей 146 у Whisper v3 Large и 66 у OmniASR LLM-7B. Это означает, что модель обрабатывает аудио быстрее, чем оно воспроизводится, что критично для систем реального времени.
Однако у решения есть технические ограничения, которые необходимо учитывать при внедрении:
- Тегирование языка: Модель требует указания тега языка (арабский или английский) на входе. Оптимизация смешанной речи работает лучше, если основной язык указан как матричный.
- Отсутствие фильтрации шума: Как и многие модели этого класса, система склонна транскрибировать фоновые шумы. Для корректной работы требуется предварительная обработка через детектор активности голоса (VAD) или шумоподавление.
- Отсутствие дополнительных функций: Модель не генерирует временные метки для слов и не выполняет разделение спикеров (диаризацию).
На фоне этого: Высокая скорость обработки компенсируется необходимостью внедрения дополнительных модулей для очистки звука, что увеличивает сложность архитектуры решения.
Операционные последствия, тренды и практические аспекты
- Требования к инфраструктуре: Для корректной работы системы необходимо внедрить модуль обнаружения голоса (VAD) на этапе предобработки, иначе фоновый шум будет восприниматься как речь, что снизит качество итоговой транскрипции.
- Зависимость от настройки ввода: Производительность при смешении языков напрямую зависит от правильного указания основного языка в запросе, что требует четкой настройки логики вызова API со стороны разработчика.
- Расширение функционала: Отсутствие встроенной диаризации (разделения спикеров) означает, что для анализа многопользовательских разговоров потребуется интеграция сторонних решений, что может увеличить задержки и стоимость обработки.
- Экономический эффект: Доступность модели под лицензией Apache 2.0 позволяет компаниям избежать лицензионных платежей за использование, но требует затрат на адаптацию под специфические диалекты и настройку конвейера обработки данных.
Модель доступна для скачивания на платформе Hugging Face и через API Cohere с бесплатным доступом (с ограничениями по частоте запросов). Для промышленного использования без лимитов предусмотрен сервис Model Vault с оплатой за час работы экземпляра.
Источник: huggingface.co