LIVE

Озвучка с помощью нейросети: метод оценки естественности речи

Озвучка с помощью нейросети генерирует аудио со скоростью, недоступной живому актёру. Но скорость инференса сама по себе почти ничего не говорит о качестве.

Обновлено07 августа 2026 г.
Чтение15 мин
Озвучка с помощью нейросети: метод оценки естественности речи

Озвучка с помощью нейросети: метод оценки естественности речи

Конкретная задержка зависит от модели, длины контекста, настроек генерации, формата входных данных и аппаратной конфигурации. Один и тот же TTS-пайплайн на рабочей станции с GPU и на сервере общего назначения даст разные цифры.

Синтезированный голос, который воспринимается «пластиковым», убивает локализацию аудиокниги так же надёжно, как битый битрейт. При этом проблема не всегда сводится к очевидному артефакту. Голос может быть чистым, без щелчков и хрипов, правильно произносить слова — и всё равно звучать неестественно из-за плоской интонации, неправильных пауз или эмоционально неуместного ударения.

Проблема одна: как зафиксировать разницу между «нормально» и «хорошо» — объективно, воспроизводимо и без полной зависимости от настроения ассессора.

Ниже — систематика методов оценки. Субъективные стандарты, объективные метрики, безреференсные подходы и автоматизированные модели предсказания. У каждого инструмента есть своя задача, шкала и зона слепоты. Ошибка начинается там, где одной цифрой пытаются описать весь голос.

Субъективные стандарты: от шкалы MOS до слепого тестирования MUSHRA

MOS (Mean Opinion Score) — стандарт де-факто для общей оценки воспринимаемого качества. ITU-T P.800 задаёт пятибалльную шкалу: от 1, соответствующей неудовлетворительному качеству, до 5, соответствующей отличному. Респонденты слушают фрагменты синтеза и выставляют оценку. Никаких обязательных объяснений: голос в ухо, число на шкале.

В этом и сила, и слабость метода. MOS быстро превращает впечатление группы слушателей в сопоставимое среднее значение. Но среднее скрывает распределение ответов. Два синтеза могут получить одинаковые 4 балла: один — потому что почти всем показался хорошим, другой — потому что часть слушателей поставила 5, а часть услышала раздражающую машинность и выбрала 3.

Для коммерческих голосовых ассистентов и коротких навигационных реплик часто используют внутренние пороги приемлемости около 3,5–4,0, но это не универсальный норматив. Такие ориентиры нужно калибровать на собственном жанре и языке. На короткой команде «поверните направо» артефакты могут оставаться незаметными, тогда как в аудиокниге они накопятся и начнут раздражать через несколько минут.

MOS выше 3,5 — не «красивый голос», а лишь ориентир приемлемости. Он не сообщает, выдержит ли синтез длинное прослушивание и справится ли с эмоцией.

При организации MOS важно не только количество респондентов, но и сама процедура. На оценку влияют громкость, качество наушников, порядок предъявления фрагментов, длина реплик и формулировка инструкции. Если сначала проигрывать образцы с выраженными дефектами, следующий относительно чистый вариант получит завышенную оценку. Если слушатель знает название модели, язык или предполагаемое качество записи, появляется эффект ожидания.

Поэтому в рабочем тесте полезно заранее зафиксировать:

  • одинаковую громкость и формат файлов;
  • набор фрагментов разной длины и сложности;
  • случайный порядок предъявления;
  • контрольные образцы, позволяющие обнаружить невнимательное заполнение;
  • отдельную разметку для ошибок произношения, просодии и аудиоартефактов.

Почему MUSHRA лучше различает близкие варианты

MUSHRA — метод субъективного сравнения с более высокой разрешающей способностью. Его нормативная база — ITU-R BS.1534; при ссылке на стандарт важно указывать конкретную редакцию, применимую к проекту. Редакция 2003 года не является актуальной формулировкой стандарта: в документации обычно ориентируются на BS.1534-3 (2015), если не установлены более новые требования конкретной лаборатории или заказчика.

Шкала MUSHRA простирается от 0 до 100. Слушателю предъявляется скрытый эталон — оригинальная запись, а также один или несколько якорей, то есть заранее деградированных вариантов. После этого респондент оценивает несколько тестовых образцов относительно эталона.

В отличие от MOS, MUSHRA рассчитана не столько на общий вопрос «насколько хорошо?», сколько на сравнительное различение вариантов. Метод чувствителен к микропаузам, щелчкам на стыках фонем, металлическому «привкусу» вокодера, неестественным окончаниям фраз и нестабильности тембра. Но его чувствительность не означает, что между MOS и MUSHRA существует фиксированная формула пересчёта. Разница в 0,2 балла MOS не обязана превращаться в определённое количество пунктов MUSHRA: результат зависит от материала, эталона, якорей и состава аудитории.

Правильнее говорить так: MUSHRA может выявить различия, которые усреднённая пятибалльная шкала сглаживает, особенно когда варианты близки по общей разборчивости и чистоте. Но величину расхождения необходимо получать конкретным измерением, а не подставлять из универсального правила.

ПараметрMOSMUSHRA
Шкала1–50–100
ЭталонНе обязателенОбычно предъявляется скрытый эталон
ЯкоряНетДа, деградированные версии
Основная задачаОбщая оценка качестваСравнение близких вариантов
Чувствительность к мелким различиямНижеВыше при корректной процедуре
Типичное применениеОбщая оценка TTS и ассистентовВыбор модели или пайплайна дубляжа

MUSHRA не становится автоматически объективной только потому, что использует сто пунктов. Это по-прежнему человеческая оценка. Если якорь слишком плохой, эталон не соответствует жанру, а фрагменты не покрывают реальные проблемы локализации, шкала даст аккуратное, но мало полезное число.

ABX и границы бинарного сравнения

ABX-тестирование предназначено для другого вопроса. Респонденту предъявляются два варианта — A и B — и образец X. Нужно определить, какой из вариантов ближе к X или соответствует заданному условию. Формат бинарного выбора убирает размытость MOS: участник не рассуждает, насколько именно хорош голос, а принимает локальное решение.

ABX полезен при выборе между двумя вокодерами, двумя версиями постобработки или двумя кандидатами на финальном этапе. Он хорошо отвечает на вопрос «слышна ли разница?» и хуже — на вопрос «насколько результат хорош сам по себе?». Если вариантов больше двух, серия ABX быстро разрастается, а интерпретация становится менее удобной.

Затраты субъективного тестирования тоже нельзя описывать одной универсальной суммой. Сроки и бюджет зависят от рекрутинга, оплаты респондентов, количества языков, платформы, подготовки фрагментов, модерации и требований к статистической мощности. Сессия с несколькими десятками слушателей может занимать от нескольких дней до существенно большего срока, если нужны носители разных языков или профессиональные ассессоры. Поэтому субъективное тестирование обычно применяют не ко всему массиву, а к репрезентативной выборке и контрольным точкам релиза.

Объективные метрики: как измерить спектральные искажения через MCD и PESQ

Объективные метрики нужны инженеру для быстрых итераций. Они позволяют сравнивать чекпоинты, отслеживать деградацию после изменения вокодера и находить выбросы до ручного прослушивания. Но объективность здесь означает воспроизводимость вычисления, а не полное совпадение с человеческим восприятием.

MCD: спектральная близость без обещания естественности

MCD (Mel-Cepstral Distortion) измеряет расхождение между мел-кепстральными признаками эталонной и синтезированной речи. На практике из сигналов извлекают мел-кепстральные коэффициенты, выравнивают последовательности по времени и считают расстояние между соответствующими векторами по фреймам. Результат обычно выражается в децибелах: чем ниже значение, тем ближе спектральный профиль к референсу.

Важно не смешивать мел-кепстральные коэффициенты с MFCC без оговорок. В разных реализациях используются разные признаки, число коэффициентов, параметры оконного анализа и способ временного выравнивания. Поэтому MCD, посчитанные двумя скриптами на одном наборе, не всегда сопоставимы напрямую.

Для отдельных датасетов и публикаций можно встретить значения вроде 6,652 dB или ориентиры в диапазоне 5,5–6,0 dB, однако переносить их между корпусами нельзя. На итог влияют диктор, микрофон, длительность фрагментов, фоновые шумы, предобработка и расхождение текста с аудио. Порог «ниже X — хорошо» имеет смысл только внутри зафиксированного протокола.

MCD отвечает на вопрос, насколько расходится спектральный профиль, но не на вопрос, звучит ли реплика живо и уместно в сцене.

Ограничение метрики принципиальное: MCD почти не описывает просодию. Интонационный контур, ритм, длина пауз, логическое ударение и эмоциональная окраска могут измениться при небольшом спектральном расхождении. И наоборот, локальный щелчок или хрип не обязательно сильно повлияют на среднее расстояние, если дефект занимает короткий участок.

Для осмысленного сравнения MCD нужно:

  • использовать один и тот же референсный корпус;
  • проверять совпадение текста и временной структуры;
  • фиксировать частоту дискретизации, параметры окна и число коэффициентов;
  • анализировать не только среднее, но и распределение значений;
  • прослушивать фрагменты с худшими результатами, а не только смотреть на итоговую цифру.

PESQ и POLQA: разные шкалы и разные ограничения

PESQ (Perceptual Evaluation of Speech Quality, ITU-T P.862) и POLQA (ITU-T P.863) моделируют отдельные свойства человеческого восприятия и сравнивают тестовый сигнал с эталонным. В их основе — сопоставление временно-частотных представлений, выравнивание, моделирование громкости и перцептивные штрафы за искажения.

Для PESQ используется шкала от −0,5 до 4,5. Для POLQA в типичной таблице результатов указывают диапазон от 1,0 до 4,5. Эти диапазоны нельзя объединять в одну строку: POLQA не следует описывать как метрику с нижней границей −0,5.

PESQ создавалась прежде всего для задач оценки качества телефонной речи. Существуют варианты для узкополосного и широкополосного сигнала, но это не превращает метрику в универсальный измеритель качества современного TTS. В дубляже и озвучке полезный сигнал может содержать более широкий частотный диапазон, пространственную обработку, музыку и сложную динамику. В таких условиях телефонная перцептивная метрика способна не заметить часть проблем или, наоборот, наказать сигнал за свойства, которые в конкретном миксе не мешают слушателю.

POLQA расширяет область применения по сравнению с PESQ и рассчитана на более современные сценарии оценки речевого качества, но также не измеряет художественную выразительность, соответствие актёрской подаче или синхронизацию с видеорядом. Кроме того, условия лицензирования и реализации нужно учитывать отдельно: нельзя автоматически считать результаты разных инструментов взаимозаменяемыми.

МетрикаШкалаЧто измеряетЗависимость от эталонаОсновные ограничения
MCDДецибелы, ниже — лучшеСпектральное расхождение мел-кепстральных признаковДаСлабо описывает просодию и короткие локальные дефекты
PESQ−0,5–4,5Перцептивное качество речевого сигналаДаОриентирована на телеком-сценарии и заданные полосы
POLQA1,0–4,5Перцептивное качество речи в более широком наборе сценариевДаНе заменяет оценку эмоций, микса и синхронизации
FADЗависит от реализации, ниже обычно лучшеРасстояние между распределениями аудиопризнаковНет попарного эталонаЗависит от экстрактора признаков и состава выборки

PESQ и POLQA особенно легко неправильно применить к TTS. Эталонная запись должна содержать ту же реплику, произнесённую в сопоставимом темпе и с близкой структурой пауз. Если модель синтезировала другой ритм, даже при естественном звучании алгоритм может интерпретировать расхождение как ухудшение. Для свободной генерации, где нет пословного референса, такие метрики теряют значительную часть смысла.

Безреференсный анализ: роль FAD в оценке качества синтеза

FAD (Fréchet Audio Distance) работает без попарного эталона. Модель-экстрактор — например, VGGish или PANNs в зависимости от реализации — извлекает признаки из реального аудиодатасета и из массива синтезированных образцов. Затем вычисляется расстояние Фреше между двумя распределениями в латентном пространстве.

Плюс очевиден: не нужно иметь оригинальную запись каждой реплики. Достаточно собрать репрезентативную выборку реальной речи и сопоставимый батч сгенерированных файлов. Это удобно, когда синтез создаётся по тексту, а не копирует конкретное исполнение.

Но FAD не имеет универсальной шкалы человеческого восприятия. Значение 2,5 действительно обычно интерпретируют как более близкое к референсному распределению, чем 5,0, однако нельзя автоматически заявить, что слушатель услышит двукратное улучшение. Результат зависит от:

  • выбранного feature extractor;
  • версии и параметров его реализации;
  • объёма и состава реального корпуса;
  • длины аудиофрагментов;
  • баланса языков, дикторов и жанров;
  • уровня шума и постобработки.

Два экстрактора могут дать разные значения на одних и тех же файлах. Поэтому FAD имеет смысл сравнивать только внутри стабильного экспериментального контура. Если поменялся экстрактор, референсный датасет или способ нарезки, старые и новые числа уже не образуют чистый временной ряд.

Для озвучки с помощью нейросети FAD полезна в нескольких сценариях.

1. Мониторинг деградации при масштабировании. Квантизация весов, переход на half precision, изменение размера батча или постобработки могут изменить статистику аудиовыхода. FAD помогает заметить дрейф на уровне коллекции.

2. Сравнение распределений разных версий модели. Метрика показывает, не ушла ли новая версия от характеристик целевого корпуса по тембру и общей структуре признаков.

3. Контроль разнообразия. Если модель начинает выдавать слишком похожие по статистике фрагменты, это может указывать на сужение пространства генерации. Однако FAD сама по себе не доказывает наличие mode collapse: это гипотезу нужно проверять дополнительными признаками и прослушиванием.

4. Первичный контроль больших объёмов. FAD подходит для ночных прогонов и пакетного мониторинга, когда ручная проверка всех файлов невозможна.

Слабая сторона FAD для дубляжа — отсутствие анализа временной синхронизации. Метрика оценивает распределение аудиопризнаков, но не проверяет, совпадает ли артикуляция с движением губ, укладывается ли реплика в монтажное окно и сохранена ли драматургическая пауза. Для lip-sync-задачи FAD может быть вспомогательным сигналом, но не критерием готовности.

Автоматизация контроля: возможности моделей MOSNetBert и WhisperBert

Ручное тестирование MOS и MUSHRA дорого по времени. MCD, PESQ и POLQA быстро считаются, но не полностью коррелируют с восприятием. Третий путь — нейросетевые модели, которые предсказывают субъективную оценку по аудио, тексту или их комбинации.

В исследовательских работах и прикладных прототипах встречаются разные семейства таких моделей. Их названия не стоит воспринимать как единый утверждённый стандарт: под одним названием могут скрываться разные версии, наборы данных и способы обучения.

  • MOSNet предсказывает MOS по аудиофайлу. В типичной архитектуре используются свёрточные и рекуррентные компоненты, а входом служит спектральное представление сигнала.
  • SBSNet ориентирована на задачу Side-by-Side — попарное сравнение двух аудиофайлов.
  • WhisperBert может объединять речевые признаки, извлечённые из Whisper, с текстовым контекстом, который обрабатывается языковой моделью семейства BERT.
  • MOSNetBert в некоторых описаниях используется для текстовой оценки или для моделей, связывающих свойства текста с ожидаемым качеством синтеза.

Конкретные показатели ошибки нельзя переносить на любой проект без проверки. Например, MSE 0,161, приводимая для отдельного экспериментального протокола, описывает именно этот набор данных, модель и способ валидации. Она не означает, что предсказание будет иметь такую же точность на другом языке, жанре или движке синтеза.

Автоматическая модель полезна как фильтр первого прохода, но её прогноз — это приоритет для проверки, а не вердикт о пригодности голоса.

Условный пример выглядит так: инженер прогоняет тестовый набор из 200 предложений через TTS, затем передаёт выходы модели-предиктору MOS. Допустим, среднее предсказание составило 3,72, а стандартное отклонение — 0,24. Это не результат реального бенчмарка, а иллюстрация того, как читать распределение: при приблизительной нормальной модели около двух третей значений окажутся в интервале от 3,48 до 3,96. Но даже в таком примере нельзя автоматически объявлять нижнюю границу браком. Нужно посмотреть, какие именно фрагменты её формируют: длинные предложения, имена собственные, числа, сокращения, смена эмоционального регистра или ошибки произношения.

Пороговая логика также должна быть локальной. Значения ниже заранее выбранного уровня можно отправлять на ручную проверку в первую очередь, а высокие прогнозы — использовать для снижения объёма выборочного аудита. Но границы вроде «ниже 3,3 — всегда брак» и «выше 4,0 — всегда проходит» требуют калибровки на собственных человеческих оценках. Без неё это лишь рабочая гипотеза.

Текстовые модели интересны тем, что позволяют находить потенциально сложные места ещё до генерации аудио. Длинные синтаксические конструкции, нестандартные имена, числительные, аббревиатуры, омографы и редкие термины действительно могут повышать риск неудачного произношения. Однако текстовая модель предсказывает не готовое звучание, а вероятность проблемы. Реальный дефект появляется только после выбора голоса, параметров синтеза и контекста.

Основное ограничение всех MOS-предикторов — сдвиг домена. Модель обучалась на определённых датасетах субъективных оценок, а значит, усвоила не только общие свойства речи, но и особенности разметки. Другой язык, жанр, диктор, уровень шумов или модель синтеза могут снизить точность. Предиктор, хорошо работающий на русскоязычных нейтральных репликах, не гарантирует того же качества на японском, арабском, детской речи или эмоциональном дубляже.

Поэтому автоматизацию разумно строить как замкнутый контур: часть фрагментов проходит через ручную оценку, её результаты сравниваются с прогнозом модели, после чего пороги и приоритеты пересматриваются. Если предиктор постоянно пропускает шёпот или сарказм, проблема не в слушателях — просто этот тип материала не представлен в его обучающем распределении.

Границы применимости: почему цифры не заменят человеческое восприятие эмоций

Ни одна из рассмотренных метрик не измеряет эмоциональную выразительность напрямую. MCD считает спектральное расхождение. PESQ и POLQA моделируют отдельные аспекты качества речевого сигнала. FAD оценивает близость распределений признаков. MOSNet и родственные модели предсказывают среднюю субъективную оценку на основании того, чему научились на размеченных данных.

Задача дубляжа — не просто воспроизвести фонемы. Озвучка нейросетью для локализации фильма должна передать интонацию сарказма, тихий шёпот персонажа, нарастание паники, усталость после долгой сцены. Технически чистая реплика может оказаться драматургически неверной. Голос произнесёт все слова без ошибок, но поставит ударение не на том фрагменте, слишком рано закроет паузу или сохранит спокойный тембр там, где оригинал уже переходит к тревоге.

Шёпот и крик хорошо показывают границу числовых методов. Их спектральные характеристики могут расходиться с эталоном сопоставимо, а субъективное впечатление будет противоположным. В одном случае слушатель услышит естественную интимность, в другом — резкий и пластиковый форсаж. Средняя оценка короткого фрагмента также не расскажет, насколько голос утомляет на длинной дистанции.

Для локализации нужен не один тест, а последовательность проверок, где каждый слой закрывает свои дефекты:

1. Автоматический фильтр первого прохода. MCD, выбранная перцептивная метрика и MOS-предиктор помогают найти явные выбросы, ошибки и подозрительные версии. Это быстрый способ сократить массив для ручного прослушивания.

2. Субъективное сравнение на контрольной выборке. MOS даёт общую картину приемлемости, а MUSHRA — более тонкое сравнение близких вариантов при наличии корректного эталона и якорей.

3. ABX или A/B-тестирование финальных кандидатов. Такой формат удобен, когда нужно выбрать один из двух пайплайнов и не перегружать ассессора длинной шкалой.

4. Экспертный аудит. Звукорежиссёр или редактор дубляжа проверяет эмоциональную адекватность, логику пауз, тембровую стабильность, произношение имён, попадание в монтаж и ощущение «живости».

5. Проверка длинного прослушивания. Для аудиокниг, курсов и сериалов нужно слушать не только короткие тестовые реплики, но и непрерывные фрагменты. Монотонность и повторяемость тембра здесь становятся отдельным классом дефектов.

Доля экспертного аудита тоже не должна быть догмой. Для одного проекта достаточно стратифицированной выборки, для другого понадобится сплошная проверка из-за юридической или репутационной цены ошибки. Важно, чтобы выборка включала не только средние по качеству реплики, но и зоны риска: имена, числа, скороговорки, эмоциональные сцены, шёпот, крик, смену говорящих и фразы с жёстким ограничением по длительности.

Полезно хранить не только итоговый MOS или FAD, но и карту дефектов. Для каждой реплики можно отдельно отметить:

  • произношение и ударение;
  • темп и длительность;
  • паузы и дыхание;
  • интонацию и логическое выделение;
  • стабильность тембра;
  • щелчки, хрипы, металлические призвуки;
  • соответствие видеоряду;
  • утомляемость при последовательном прослушивании.

Такой журнал превращает оценку в инженерный процесс. Если новая версия модели улучшила MCD, но увеличила число неестественных пауз, это видно сразу. Если FAD стабилен, а редакторы регулярно отмечают ошибки в эмоциях, становится понятно, что статистическая близость распределений не покрывает нужную задачу.

Текущее состояние инструментария можно описать без победителя. Субъективные стандарты MOS и MUSHRA остаются точкой отсчёта, потому что именно человек в конечном счёте слушает локализацию. MCD, PESQ и POLQA полезны для контролируемых сравнений с референсом, но требуют одинакового протокола и не являются универсальными шкалами естественности. FAD помогает следить за распределением качества без попарного эталона, но зависит от экстрактора признаков и не проверяет синхронизацию. Модели предсказания MOS ускоряют сортировку и поиск выбросов, однако нуждаются в калибровке под язык, жанр и конкретный TTS-пайплайн.

Для продакшена разумная последовательность такова: автоматические метрики запускаются на каждом существенном изменении модели или настроек, MUSHRA проводится на вехах релиза, ABX помогает выбрать между финальными кандидатами, а экспертный аудит завершает сборку. Числа экономят время, но не отменяют слух. Синтетический голос становится естественным не тогда, когда пересёк один порог, а когда техническая чистота, просодия, эмоция и контекст перестают спорить друг с другом.

Частые вопросы

Почему MOS не гарантирует высокое качество синтезированного голоса?
Среднее значение MOS скрывает распределение ответов, поэтому два разных синтеза могут получить одинаковый балл, несмотря на разное восприятие слушателями.
В чем главное отличие MUSHRA от MOS?
MUSHRA предназначена для сравнительного анализа близких вариантов с использованием скрытого эталона и деградированных якорей, что делает её более чувствительной к мелким дефектам.
Можно ли использовать MCD для оценки естественности интонаций?
Нет, MCD измеряет лишь спектральное расхождение мел-кепстральных признаков и практически не учитывает просодию, ритм и эмоциональную окраску речи.
Для каких задач лучше всего подходит FAD?
FAD удобен для мониторинга деградации качества при масштабировании, сравнения версий моделей и первичного контроля больших объемов данных без необходимости иметь попарный эталон для каждой реплики.
Почему нельзя доверять автоматическим предикторам MOS на 100%?
Точность таких моделей сильно зависит от обучающей выборки, и при смене языка, жанра или движка синтеза возникает сдвиг домена, требующий повторной калибровки.