Озвучка персонажей нейросетью: методика оценки дубляжа
При синтезе речи для игрового персонажа продакшен упирается в одну точку: верифицировать, что нейросеть попала в образ. Автоматический пайплайн выдает аудиофайл. Файл надо проверить. Ни одна метрика не закрывает задачу в одиночку.

Стек оценки собирается из субъективных тестов, объективных акустических формул и проверки аудиовизуальной синхронизации. Дальше — разбор каждого слоя.
Субъективный контроль: почему MOS остается золотым стандартом оценки
Mean Opinion Score (MOS) — базовый тест естественности синтеза. Шкала от 1 до 5. Эксперт или слушатель ставит оценку фрагменту. 1 — «ужасно», 5 — «отлично». Для сравнения моделей применяются слепые A/B-тесты с рандомизированной подачей. Целевые значения для продакшена: 4.3–4.5. Это диапазон, в котором синтез воспринимается на уровне человеческой речи на усредненной выборке.
MOS ловит артефакты вокодера, роботизированный тембр, неестественные паузы. Не ловит провал в эмоциональном контексте конкретной сцены. Усредненная оценка маскирует per-scene брак: голос звучит ровно, но не попадает в реплику. Для игрового продакшена это критично — одна провальная фраза в кат-сцене разрушает погружение.
MOS остается обязательным слоем оценки. Без него автоматические метрики теряют точку калибровки — невозможно выставить порог, при котором синтез пригоден для релиза.
Процедура: набирается панель слушателей. Каждому выдается сет фрагментов речи персонажа. Оценивается естественность, разборчивость, общее впечатление. Результат усредняется. Методика медленная. В конвейере A/B-тестирования новых весов модели MOS-панель запускается на ключевых репликах — кат-сцены и эмоционально нагруженные диалоги.
Автоматизированные метрики: WER, MCD и PESQ в пайплайне продакшена
Ручные тесты не масштабируются. Продакшен требует формул, прогоняемых на каждом чекпоинте пайплайна. Базовый набор:
- Word Error Rate (WER) — понятность речи. Синтезированный звук прогоняется через ASR (автоматическое распознавание речи). Распознанный текст сравнивается с эталоном. Считается доля ошибок на слово. Метрика не видит просодию — только транскрипцию. Ниже — лучше.
- Mel-Cepstral Distortion (MCD) — спектральное расстояние между синтезом и эталоном в мел-частотных кепстральных коэффициентах. Измеряется в децибелах. Ниже — лучше. Чувствителен к вокодеру и шуму в эталоне.
- PESQ (Perceptual Evaluation of Speech Quality) — алгоритмическая оценка искажений относительно чистой речи. Шкала от 1 до 4.5. Выше — лучше. Стандарт из телекома, перенесенный в TTS-конвейеры. Ловит артефакты кодирования и потерю высоких частот.
- STOI (Short-Time Objective Intelligibility) — разборчивость на коротких временных окнах. Шкала 0–100%. В чистом TTS применяется реже — избыточен.
| Метрика | Что измеряет | Единицы | Ключевое ограничение |
|---|---|---|---|
| WER | Понятность через ASR | % ошибок на слово | Не видит просодию |
| MCD | Спектральное расстояние до эталона | дБ | Чувствителен к шуму эталона |
| PESQ | Перцептуальные искажения | 1–4.5 | Не ловит эмоциональный контекст |
| STOI | Кратковременная разборчивость | 0–100% | Избыточен для чистого TTS |
Метрики работают как первый фильтр. Если WER или MCD выходят за приемлемый диапазон — рендер уходит на доработку, дальше не идет. Это экономит часы ручной проверки на длинных диалогах и удерживает конвейер от накопления технического брака.
Аудиовизуальная синхронизация: липсинк и артикуляционная точность
Дубляж в играх и анимации — не только звук. Артикуляция персонажа должна совпадать с фонемами синтеза. Расхождение считывается мгновенно: рот открыт, звук идет из закрытого. Сцена выбрасывается.
Липсинк проверяется на двух уровнях:
1. Фонемный — соответствие произнесенного звука виземе (визуальной форме рта для данного звука). «М» — закрытые губы, «а» — открытый рот. Совпадение измеряется по кадрам анимации.
2. Тайминговый — задержка между началом фонемы и моментом визуального считывания артикуляции. Допустимое окно — десятки миллисекунд. Больше — лаг заметен глазом.
Технически липсинк оценивается через детекцию контрольных точек на лице персонажа и временное выравнивание с фонемной разметкой аудио. Современные фреймворки (Wav2Lip, VideoReTalking, MuseTalk и подобные) дают baseline. Контроль качества их выхода — отдельная задача: визуальный артефакт (смазанная нижняя челюсть, застывшая мимика) не ловится автоматикой и требует ручной инспекции.
Для нейросетевых lip-sync моделей применяются метрики LSE-D (Lip Sync Error - Distance) и LSE-C (Lip Sync Error - Confidence). LSE-D измеряет расстояние между аудио и видео-потоком, LSE-C — уверенность синхронизации. Конкретные пороги зависят от фреймворка, длины клипа и разрешения. На практике приемлемый результат обычно соответствует значениям ниже типичных baseline-значений референса, но точная калибровка делается на собственном датасете студии.
Просодия как фундамент эмоционального попадания в образ
MOS оценивает естественность звука как абстрактного явления. Не оценивает попадание в роль. Это разные задачи. Просодия — высота тона, темп, ударения, паузы — несет основную эмоциональную нагрузку фразы. Один и тот же текст, прочитанный с разной просодией, дает разного персонажа.
Zero-shot TTS-модели (клонирование голоса по короткому референсу) проваливаются здесь чаще всего. Они копируют тембр. Не копируют актерский рисунок. В обучающем датасете нужны размеченные эмоциональные аннотации: не просто «озвучка», а «озвучка в состоянии гнева», «озвучка шёпотом», «озвучка с сарказмом». Без разметки модель генерирует речь с нейтральной просодией. Персонаж звучит «мертво» даже при идеальном WER и чистом MCD.
Контроль просодии идет через:
- Pitch contour analysis — сравнение контура F0 (основной частоты) синтеза с эталоном актерской подачи.
- Energy curve — динамика громкости на протяжении фразы. Спады и пики маркируют эмоциональные акценты.
- Pause distribution — длительность и расположение пауз. Слишком ровная сетка — признак машинной генерации. Слишком хаотичная — ошибка просодической модели.
Эти параметры не сводятся в единую цифру. Анализ идет по фрагментам с привязкой к сценарию. Продакшен-директор слушает и помечает: «здесь просело», «здесь перебор». Автоматика помогает выявить аномалии — отсутствие микропауз в драматическом монологе, выровненный F0 в кульминации, — но финальная приемка остается ручной.
Пределы измеримости: где заканчиваются цифры и начинается актерская игра
Цифры не ловят главного: попал ли голос в персонажа как целостный образ. Метрика MOS 4.5 не гарантирует, что злодей звучит угрожающе, а ребенок — наивно. Усредненная шкала естественности не отражает специфику попадания в эмоцию, актерский контекст и липсинк. Это ограничение, которое не закрывается добавлением новых формул.
Любая методика оценки — набор фильтров, а не вердикт. Фильтры отсеивают брак. Вердикт остается за человеком, который знает персонажа изнутри.
Комплексная оценка собирается в последовательность:
1. Автоматика прогоняет WER, MCD, PESQ. Отсекает технический брак.
2. Липсинк-чек верифицирует аудиовизуальную синхронизацию. Отсекает визуальный брак.
3. MOS-панель оценивает естественность. Отсекает «машинное» звучание.
4. Просодический разбор выявляет эмоциональные провалы.
5. Режиссер или кастинг-директор слушает финальный сет в контексте сцен. Принимает или отправляет на пересборку весов.
Финальная инстанция проверки остается за человеком. Игрок воспринимает персонажа в кат-сценах и диалогах через впечатление, без обращения к формулам. Это впечатление — попадание голоса в образ — собирается в гайдах по сюжетным проектам, например на torygame.com, где разборы кат-сцен включают оценку работы озвучки. Для студии это внешний сигнал: где синтез сработал, где не сработал, и какие реплики вытаскивают кат-сцену, а какие ее роняют.
Методика оценки дубляжа нейросетью — инженерный конвейер, а не одна формула. Каждый слой фильтрует свой тип брака. MOS держит планку естественности. WER и MCD контролируют техническую чистоту. Липсинк-метрики фиксируют визуальную согласованность. Просодический анализ ловит эмоциональный провал. Ручная финальная приемка закрывает то, что не формализуется в цифрах, — актерскую работу. Внедрение TTS в игровой продакшен держится на этом стеке, и его ужесточение идет с каждым релизом новых весов моделей.