Почему синтетическая речь Qwen-Audio-3.0-TTS обходит человека в тестах на разборчивость
По данным публикации на Хабре, 27 июля 2026 года Alibaba выпустила TTS-модель Qwen-Audio-3.0-TTS. В таблице результатов на бенчмарке SEED-TTS-Eval зафиксирован показатель: WER на синтетике — 0,84, WER на живой речи — 1,26.
Савелий Попов·обновлено 15 сентября 2026 г.

Модель формально обходит человека по метрике разборчивости. Повод разобрать, что стоит за цифрой и какие компромиссы заложены в архитектуре.
Архитектура и компромиссы
Qwen-Audio-3.0-TTS наследует гибридную ветку TTS. Стек: авторегрессия по дискретным семантическим токенам плюс отдельный непрерывный блок для акустики. Прямой потомок CosyVoice. Авторы пытались закрыть главное узкое место гибрида — дискретный стык между семантикой и акустикой.
Четыре актуальных подхода в индустрии на 2026 год:
- Авторегрессия на дискретных токенах: VALL-E, Spark-TTS, Qwen3-TTS. Низкая задержка, стриминг. Квантование режет акустику.
- Неавторегрессия на непрерывных представлениях: Voicebox, E2 TTS, F5-TTS. Диффузия, flow matching. Высокая точность, стриминг на уровне высказывания проседает.
- Гибриды: Seed-TTS, CosyVoice. Дискретный стык остаётся узким местом.
- Непрерывно-авторегрессионные: DiTAR, Dots.TTS, VoxCPM. Авторегрессия по непрерывным латентам патч за патчем. Квантователя нет, дискретного стыка нет. Высокая размерность латентов бьёт по устойчивости на длинных фрагментах.
Qwen3-TTS — соседняя ветка Alibaba, чистая авторегрессия. В таблицах Qwen-Audio-3.0-TTS фигурирует на правах бейзлайна. Частота токенов у обеих моделей — около 12 Гц. Прямого родства в материале не заявлено.
Режимы инференса
Два варианта поставки:
- Flash. Real-time. Первый пакет — порядка 300 мс.
- Plus. Целевой сценарий — качество. Задержка выше.
Токенизатор работает на ~12 Гц. Один пакет акустики на каждые ~83 мс речи. Совместимо с диалоговыми пайплайнами, где TTFT критичен. Для офлайн-озвучки и дубляжа логичнее Plus.
Метрика и её границы
WER — автоматическая метрика. Считается через ASR-движок, прогоняемый по выходному аудио. Движок распознаёт текст обратно; качество речи для него — побочный сигнал. Сравнение «синтетика против живого человека» через единый WER методологически хрупкое: человеческая речь в бенчмарке несёт спонтанные шумы и просодию, бенчмарковый ASR-движок обучен на конкретном распределении, состав SEED-TTS-Eval в публикации не раскрыт. Число 0,84 против 1,26 — повод проверить методологию, а не повод объявлять превосходство.
Практический вывод для интеграторов: метрика разборчивости ниже у синтетики, чем у живого диктора, не означает превосходства модели над человеком. Для production-валидации собирайте собственный WER на целевом домене, прогоняйте MOS-тест и A/B с реальными слушателями. SEED-TTS-Eval — отправная точка для сравнения, не критерий истины.