LIVE
Новость

Почему современные голосовые AI-модели проигрывают в распознавании живой речи

Humyn Labs опубликовала вторую редакцию бенчмарка BRIDGE для голосовых AI-моделей. По данным отчёта, разрыв между человеческой речью и распознаванием остаётся системным и зависит от выбора провайдера в разы.

Савелий Попов·обновлено 19 сентября 2026 г.

Почему современные голосовые AI-модели проигрывают в распознавании живой речи

В мире 5,5 млрд человек говорят на языках, отличных от английского, и эта аудитория становится основным полигоном для тестов реальной пригодности моделей.

Методология и охват

BRIDGE v2 покрывает 23 модели на 23 языках: индийская группа, латиноамериканский испанский, бразильский португальский, вьетнамский. Семь ключевых метрик — перекрытие речи, плотность диалога, код-свитчинг и другие условия, имитирующие живую среду. Под тестом более 200 часов верифицированного аудио, собранного в 2–3 районах на язык. В списке — Sarvam v3, Gemini 3 Pro, ElevenLabs и другие. Бенчмарк отделяет ошибку транскрипции от выбора скрипта — разделение, которое стандартные скоринги упускают.

Где модели ломаются

Перекрытие речи поднимает среднюю ошибку с 41,2% до 45,2%. Диалекты дают больший разрыв: бенгальский в стандартной форме — 42,4%, региональный диалект за пределами Калькутты — 51,0%, около 9 пунктов из-за одного диалекта. Тот же паттерн в испанском: аргентинский — 7,85% WER, венесуэльский — 16,04% WER, более чем двукратный рост внутри одного языка. Подтверждается: эффект не специфичен для Индии. Длинные паузы в бразильском португальском дают 18,8% ошибки при паузах свыше 150 секунд против 12,4% при паузах около 35 секунд. Модели теряют нить на затянувшемся молчании.

Рычаги точности и параллельные релизы

На пяти неиндийских языках ElevenLabs показывает 5,8% ошибки против 24,6% у GPT-4o-mini-transcribe на идентичном аудио. Разрыв — более 4×. Выбор провайдера перевешивает любые настройки пайплайна. Параллельно, по данным источника, Synthio Labs запустила бенчмарк DOSE на произношении названий лекарственных препаратов: согласно заголовку релиза, ведущие голосовые модели неправильно произносят до одного из трёх названий недавно одобренных препаратов. Методика и состав моделей в открытом доступе не раскрыты. Для практиков: замерять WER на собственных доменных аудио с перекрытием, код-свитчингом и длинными паузами до выбора провайдера. Универсальные бенчмарки систематически занижают реальную ошибку в продакшене.