LIVE
Новость

Почему синтетическая речь Qwen-Audio-3.0-TTS обходит человека в тестах на разборчивость

По данным публикации на Хабре, 27 июля 2026 года Alibaba выпустила TTS-модель Qwen-Audio-3.0-TTS. В таблице результатов на бенчмарке SEED-TTS-Eval зафиксирован показатель: WER на синтетике — 0,84, WER на живой речи — 1,26.

Савелий Попов·обновлено 15 сентября 2026 г.

Почему синтетическая речь Qwen-Audio-3.0-TTS обходит человека в тестах на разборчивость

Модель формально обходит человека по метрике разборчивости. Повод разобрать, что стоит за цифрой и какие компромиссы заложены в архитектуре.

Архитектура и компромиссы

Qwen-Audio-3.0-TTS наследует гибридную ветку TTS. Стек: авторегрессия по дискретным семантическим токенам плюс отдельный непрерывный блок для акустики. Прямой потомок CosyVoice. Авторы пытались закрыть главное узкое место гибрида — дискретный стык между семантикой и акустикой.

Четыре актуальных подхода в индустрии на 2026 год:

  • Авторегрессия на дискретных токенах: VALL-E, Spark-TTS, Qwen3-TTS. Низкая задержка, стриминг. Квантование режет акустику.
  • Неавторегрессия на непрерывных представлениях: Voicebox, E2 TTS, F5-TTS. Диффузия, flow matching. Высокая точность, стриминг на уровне высказывания проседает.
  • Гибриды: Seed-TTS, CosyVoice. Дискретный стык остаётся узким местом.
  • Непрерывно-авторегрессионные: DiTAR, Dots.TTS, VoxCPM. Авторегрессия по непрерывным латентам патч за патчем. Квантователя нет, дискретного стыка нет. Высокая размерность латентов бьёт по устойчивости на длинных фрагментах.

Qwen3-TTS — соседняя ветка Alibaba, чистая авторегрессия. В таблицах Qwen-Audio-3.0-TTS фигурирует на правах бейзлайна. Частота токенов у обеих моделей — около 12 Гц. Прямого родства в материале не заявлено.

Режимы инференса

Два варианта поставки:

  • Flash. Real-time. Первый пакет — порядка 300 мс.
  • Plus. Целевой сценарий — качество. Задержка выше.

Токенизатор работает на ~12 Гц. Один пакет акустики на каждые ~83 мс речи. Совместимо с диалоговыми пайплайнами, где TTFT критичен. Для офлайн-озвучки и дубляжа логичнее Plus.

Метрика и её границы

WER — автоматическая метрика. Считается через ASR-движок, прогоняемый по выходному аудио. Движок распознаёт текст обратно; качество речи для него — побочный сигнал. Сравнение «синтетика против живого человека» через единый WER методологически хрупкое: человеческая речь в бенчмарке несёт спонтанные шумы и просодию, бенчмарковый ASR-движок обучен на конкретном распределении, состав SEED-TTS-Eval в публикации не раскрыт. Число 0,84 против 1,26 — повод проверить методологию, а не повод объявлять превосходство.

Практический вывод для интеграторов: метрика разборчивости ниже у синтетики, чем у живого диктора, не означает превосходства модели над человеком. Для production-валидации собирайте собственный WER на целевом домене, прогоняйте MOS-тест и A/B с реальными слушателями. SEED-TTS-Eval — отправная точка для сравнения, не критерий истины.