LIVE

Озвучка через нейросеть: тест на наличие аудиоартефактов

Озвучка через нейросеть может проходить обычное прослушивание и проваливаться на техническом контроле. На встроенных динамиках смартфона слышен «чистый» голос.

Обновлено13 августа 2026 г.
Чтение13 мин
Озвучка через нейросеть: тест на наличие аудиоартефактов

В наушниках проявляются цифровое шипение, рваные окончания слов, неестественные паузы и фазовая нестабильность. После сведения с музыкой дефекты усиливаются.

Проблема не сводится к субъективному вопросу «похож ли голос на человеческий». Для локализации фильма, игры или аудиокниги нужен воспроизводимый тест. Он должен разделять минимум четыре слоя: разборчивость, тембр, просодию и спектральные артефакты. Один показатель не описывает все параметры.

У нейросетевой озвучки нет универсального «детектора качества». MOS показывает восприятие слушателей. PESQ и ViSQOL сравнивают сигнал с эталоном. STOI оценивает разборчивость. MCD работает с мел-кепстральным расстоянием. Спектральный анализ выявляет следы вокодера, но не говорит, насколько естественно актер произнес реплику.

Спектральные отпечатки: почему нейросетевые вокодеры «шумят»

Типичный TTS-пайплайн разделен на несколько этапов. Текстовый фронтенд нормализует вход, расставляет ударения и преобразует строку в фонемы. Акустическая модель строит мел-спектрограмму. Нейросетевой вокодер восстанавливает из нее временной аудиосигнал.

Именно вокодер отвечает за значительную часть финальных дефектов. Он не генерирует речь напрямую из текста. Он реконструирует волну по компактному спектральному представлению. В процессе теряется часть фазовой информации, а апсемплинг и нейрокодек могут вносить периодические компоненты.

На практике используются GAN-вокодеры, авторегрессионные модели, диффузионные вокодеры и гибридные схемы. У каждого класса собственный профиль ошибок:

  • GAN-вокодеры способны давать периодические спектральные паттерны, связанные с апсемплингом и работой генератора;
  • авторегрессионные модели иногда накапливают ошибку в длинных фразах, особенно при нестабильной просодии;
  • диффузионные вокодеры обычно требуют большего числа итераций инференса, а дефекты зависят от количества шагов и параметров сэмплирования;
  • нейрокодеки могут добавлять высокочастотный шум и характерную «зернистость» при низком битрейте;
  • системы клонирования голоса дополнительно зависят от качества референсного датасета и точности speaker embedding.

Артефакт не обязательно будет слышен как явный щелчок. Часто это слабое нарушение структуры сигнала. Оно проявляется только на длинных гласных, шипящих согласных, стыках фонем или в паузах между словами.

Для диагностики применяют спектрограммы, FFT-анализ, проверку корреляции каналов и прослушивание в нескольких режимах. Стереофайл сам по себе не означает, что модель сформировала естественную стереобазу. Синтезированный голос часто монофоничен, а стерео появляется на этапе постобработки. При неудачном расширении возникают фазовые сдвиги и ослабление сигнала в моно.

Нейросетевой голос оценивают не по одному прослушиванию. Дефект проявляется на связке «фонема — частотный диапазон — громкость — длина фразы».

Проверка должна начинаться с исходного файла до нормализации, компрессии, шумоподавления и мастеринга. Постобработка способна замаскировать часть артефактов. Она же может создать новые.

Частотные маркеры синтеза: от низкочастотной грязи до цифрового свиста

Спектр речи неравномерен. Основная энергия мужского и женского голоса сосредоточена в низко-среднем диапазоне, а разборчивость согласных зависит от более высоких частот. Поэтому дефекты в разных полосах воспринимаются по-разному.

Диапазон 400–800 Гц

Здесь появляется «грязь» низкой и средней середины. Она воспринимается как мутность, гул или искусственное утолщение голоса. Причины:

  • неточная реконструкция формант;
  • чрезмерная компрессия;
  • конфликт фундаментальной частоты и первых гармоник;
  • ошибки в спектральной огибающей;
  • повторяющийся резонанс на отдельных фонемах.

Для дубляжа это критично. В изолированном голосе мутность может показаться частью тембра. В миксе с оригинальной атмосферой, музыкой и эффектами она снижает разделение дорожек. Реплика начинает конкурировать с фоном.

Проверка выполняется узкополосным эквалайзером и спектрограммой. Полосу временно поднимают, затем прослушивают длинные гласные и сонорные согласные. Если «грязь» присутствует только на конкретных фонемах, проблема, вероятно, находится не в общем балансе, а в генерации отдельных участков.

Диапазон 5–8 кГц

В этой области проявляются цифровой свист, шипение и резкость согласных. Дефект заметен на «с», «ш», «ч», «ц», а также на окончаниях слов. При клонировании голоса он может появляться только в определенных позициях: например, после паузы или перед глухой согласной.

Избыточная энергия в диапазоне не всегда означает дефект модели. Ее может добавить de-esser, лимитер или усиление высоких частот при мастеринге. Поэтому тестируют исходную нейросетевую дорожку и финальный микс отдельно.

Признаки синтетического происхождения:

  • свист имеет почти постоянную частоту;
  • шум повторяется на одинаковых фонемах;
  • интенсивность шипящих не связана с общей громкостью фразы;
  • атака согласной звучит слишком одинаково в разных дублях;
  • шумовой компонент не меняется естественным образом в начале и конце слова.

Диапазон 12–16 кГц

Высокочастотный цифровой шум особенно заметен в тишине и на протяжных гласных. Он может иметь форму узкой полосы, рассыпчатой «пыли» или периодического гребенчатого паттерна. На динамиках ноутбука такой дефект часто исчезает. В студийных наушниках он фиксируется сразу.

Вокодер может ограничивать полезный спектр, после чего апсемплинг формирует неестественную структуру верхов. Другой источник — нейрокодек с агрессивным сжатием. Третий — неправильное преобразование частоты дискретизации.

Файл с частотой 48 кГц не гарантирует наличие полезной информации до 24 кГц. Если модель генерирует сигнал с ограниченным верхним диапазоном, последующее преобразование в 48 кГц лишь меняет контейнер. Оно не восстанавливает потерянные гармоники.

Для первичного контроля достаточно фиксировать:

Зона анализаТипичный дефектКак проявляетсяЧто проверять
400–800 ГцНизко-средняя грязьМутный тембр, гул, потеря разделения в миксеФорманты, резонансы, компрессию
5–8 кГцЦифровой свист и шипениеРезкие «с» и «ш», постоянный шумШипящие фонемы и работу de-esser
12–16 кГцВысокочастотный шумЗернистость в паузах, «песок» на гласныхВокодер, нейрокодек, ресэмплинг
Вся полосаСжатие динамикиПлоская речь, одинаковая громкость слоговCrest factor, компрессор, лимитер
СтереобазаФазовый сдвигОслабление или исчезновение сигнала в моноКорреляцию каналов и delay между L/R

Эквализация не является универсальным исправлением. Узкий вырез в проблемной полосе может убрать шум, но одновременно удалить часть согласных или тембровой информации. Если дефект связан с фазой или ошибкой генерации, EQ только снижает его слышимость.

Клонирование голоса: распознавание неестественных пауз и фазовых сдвигов

В клонировании голоса добавляется отдельный класс ошибок. Модель должна воспроизвести не только тембр, но и поведенческие характеристики говорящего: темп, дыхание, длительность гласных, микродинамику, переходы между фонемами и интонационные контуры.

Для zero-shot-клонирования достаточно короткого референса. Это снижает требования к данным на входе, но ограничивает устойчивость speaker embedding. Референс может хорошо работать на одной фразе и давать заметное расхождение на другой. Особенно при смене языка, эмоционального режима или длины реплики.

Тест клонированного голоса нужно проводить не на одной демонстрационной фразе. Минимальный набор должен включать:

1. Короткие слова с разными начальными согласными. Так проверяется атака фонемы и точность тембра.

2. Длинные гласные. На них слышны дрожание высоты тона, цифровая зернистость и нестабильность вокодера.

3. Слова с шипящими. Они выявляют свист и неправильную работу высокочастотного тракта.

4. Реплики с несколькими паузами. Здесь проявляются ошибки длительности и отсутствие естественного дыхания.

5. Длинный синтаксически сложный фрагмент. Он показывает накопление ошибок просодии.

6. Одинаковую фразу в нескольких генерациях. Повторяемость артефакта отделяет дефект модели от случайного сбоя инференса.

Паузы

Нейросинтез часто строит паузы по пунктуации и акустическим шаблонам. Это не равно человеческому дыханию. В результате пауза может быть формально корректной, но акустически пустой.

Типовые признаки:

  • одинаковая длительность пауз в разных предложениях;
  • резкий обрыв энергии перед точкой;
  • отсутствие микрошумов дыхания;
  • внезапное появление голоса после абсолютной цифровой тишины;
  • пауза не соответствует синтаксической структуре или смысловому акценту.

Для аудиокниг и закадрового перевода это влияет на восприятие сильнее, чем небольшая ошибка тембра. Слушатель может не сформулировать проблему, но будет воспринимать речь как машинную.

Добавление дыхания отдельным сэмплом работает ограниченно. Если его уровень, длительность и положение не соответствуют фразе, дорожка становится искусственной уже по другой причине. Дыхание должно быть связано с длиной синтагмы, темпом и громкостью последующей реплики.

Высота тона и окончания слов

Резкий скачок F0 возникает на переходах между слогами или в финальной части фразы. У некоторых систем последняя гласная получает лишний хвост. Иногда на конце появляется дополнительный вокалический звук. Это связано с ошибкой выравнивания фонем, неточной токенизацией или нестабильным декодированием.

Проверять нужно не только графический pitch-трекер. Алгоритм может принять шум за основную частоту. Сигнал сопоставляют с формантами и прослушивают в замедлении. Артефакт обычно заметен как краткий срыв, а не как стабильная смена интонации.

Фазовые дефекты проверяют через:

  • корреляцию левого и правого каналов;
  • прослушивание в моно;
  • анализ разницы каналов;
  • измерение межканальной задержки;
  • сравнение спектрограммы до и после суммирования.

Если при моно-суммировании пропадают согласные или меняется громкость отдельных слогов, проблема находится в стереообработке. Это не обязательно дефект TTS-модели. Однако для локализации результат оценивается на финальной мастер-дорожке, поэтому источник ошибки не освобождает пайплайн от исправления.

Субъективная оценка качества: методика MOS и порог пригодности

MOS — Mean Opinion Score. Слушатели оценивают качество по шкале от 1 до 5. Единица означает неприемлемое звучание. Пятерка соответствует восприятию, близкому к эталонной человеческой записи.

MOS не измеряет один параметр. Респондент одновременно реагирует на тембр, разборчивость, паузы, просодию, шум и естественность. Поэтому методика требует контроля условий. Иначе результат смешивает качество синтеза с качеством наушников, громкостью и акустикой помещения.

Для рабочего теста используют несколько вариантов одного и того же материала:

  • эталонную человеческую запись;
  • синтетическую запись без постобработки;
  • синтетическую запись после сведения;
  • несколько генераций одной реплики;
  • при наличии — версии от разных моделей.

Слушатели не должны видеть названия систем. Порядок фрагментов рандомизируют. Речь подают короткими отрезками. Для дубляжа полезно разделять две оценки: естественность голоса и пригодность к конкретной сцене.

Например, система может получить высокий балл за чистый тембр, но не пройти сцену с быстрым диалогом. Она теряет согласные на высокой скорости и не держит репличный ритм. Для аудиокниги требования другие: критичны стабильность на длинном тексте, отсутствие утомляющей компрессии и корректная фразовая интонация.

Показатель выше 4.0 по MOS часто рассматривают как приемлемый для корпоративных задач. Это не универсальный порог для кино или игровой локализации. В коммерческом дубляже важна не только средняя оценка, но и разброс. Дорожка со средним MOS 4.2 может содержать редкие, но критичные сбои на именах, терминологии и эмоциональных репликах.

Следует фиксировать как минимум:

  • размер тестовой группы;
  • возраст и языковой профиль слушателей;
  • тип наушников или акустики;
  • громкость воспроизведения;
  • длительность фрагментов;
  • наличие эталонной записи;
  • отдельные оценки естественности и разборчивости;
  • стандартное отклонение результата.

Пять слушателей и один рекламный абзац не дают надежного бенчмарка. Такой тест выявит явные дефекты. Для сравнения моделей нужен повторяемый корпус с фонетическим и просодическим покрытием.

MOS показывает, как сигнал воспринимается человеком. Он не объясняет, какой узел пайплайна создал дефект.

В субъективной оценке есть систематические искажения. Слушатель может предпочесть более яркий голос, хотя его спектр технически перегружен. Или поставить высокий балл разборчивой, но эмоционально плоской записи. Поэтому MOS применяют вместе с инструментальным анализом.

Объективный бенчмаркинг: PESQ, ViSQOL и STOI

Объективные метрики работают только в тех сценариях, для которых у них есть корректная задача. Если TTS генерирует новый текст, эталонной человеческой записи с той же фразой может не быть. В этом случае PESQ и ViSQOL не дают прямой оценки естественности. Их нельзя превращать в универсальный рейтинг синтезаторов.

PESQ

PESQ, или Perceptual Evaluation of Speech Quality, сравнивает тестируемый сигнал с эталоном. Стандарт ITU-T P.862 был представлен в 2001 году. Диапазон оценки — от −0,5 до 4,5.

Метрика полезна при сравнении:

  • нейросетевой озвучки с человеческой контрольной записью;
  • разных вокодеров на одинаковом тексте;
  • качества после шумоподавления или кодирования;
  • повреждений при передаче аудио;
  • нескольких версий одного дубля.

PESQ ориентирован на восприятие речевого сигнала. Он не оценивает актерскую выразительность, правильность ударения и соответствие персонажу. Высокий балл возможен у записи с неестественной интонацией, если спектрально и временно она близка к эталону.

Нельзя сравнивать результаты, полученные на разной частоте дискретизации и с разной предварительной обработкой. Перед расчетом выравнивают громкость, длительность и каналы. Иначе метрика будет измерять не только качество синтеза, но и рассинхрон.

ViSQOL

ViSQOL, или Virtual Speech Quality Objective Listener, анализирует спектрально-временное сходство с эталоном. Алгоритм поддерживает режим speech с рекомендуемой частотой дискретизации 16 кГц и режим audio для 48 кГц.

Для озвучки видео режим audio ближе к производственной задаче, если анализируется полная полоса. Режим speech применим к речевому сигналу, приведенному к 16 кГц. Смешивать оценки двух режимов в одну таблицу без маркировки нельзя.

ViSQOL полезен при поиске деградации после:

  • ресэмплинга;
  • сжатия кодеком;
  • шумоподавления;
  • нормализации;
  • сведения с музыкой;
  • повторного экспорта из видеоредактора.

Но алгоритм также требует эталона. Для нового текста TTS можно сравнивать версии одной модели между собой, однако это будет относительный бенчмарк. Он покажет, какой вариант ближе к выбранной контрольной дорожке. Контрольная дорожка при этом уже должна быть технически валидной.

STOI

STOI — Short-Time Objective Intelligibility. Метрика оценивает разборчивость речи в диапазоне от 0 до 1. Она полезна в случаях, когда синтезированный голос звучит приемлемо, но теряет согласные, слоги или окончания.

STOI особенно применим для:

  • закадрового перевода с плотным музыкальным фоном;
  • игровых реплик с шумами и эффектами;
  • аудиокниг, экспортированных с низким битрейтом;
  • телефонных голосовых интерфейсов;
  • тестирования речи после агрессивной компрессии.

Высокий STOI не равен естественности. Роботизированная речь может оставаться полностью разборчивой. Для локализации это приемлемо не всегда. В интерфейсной подсказке разборчивость может быть главным критерием. В драматической сцене она не компенсирует неправильный ритм и отсутствие интонационной динамики.

MCD и тембральное сходство

Mel Cepstral Distortion применяется для оценки различий в мел-кепстральных признаках. Меньшее значение означает большее сходство с эталоном. В задачах клонирования MCD может использоваться как один из индикаторов точности тембра.

Метрика чувствительна к выбору корпуса, выравниванию и условиям записи. Она не отделяет тембр от других характеристик. Отличие по громкости, микрофону и акустике помещения также повлияет на результат. Поэтому MCD нельзя интерпретировать как прямой процент сходства голоса.

Практическая схема тестирования выглядит так:

1. Подготовить корпус фраз с фонетическим покрытием. Включить шипящие, взрывные согласные, длинные гласные, числа, имена и терминологию.

2. Сгенерировать несколько вариантов каждой фразы при одинаковых параметрах инференса.

3. Сохранить исходные WAV-файлы до обработки. Не проводить нормализацию до базового анализа.

4. Проверить спектрограмму и FFT. Отметить повторяющиеся паттерны, полосовой шум и аномалии верхних частот.

5. Провести тест в моно и стерео. Сравнить корреляцию каналов и поведение сигнала после суммирования.

6. Рассчитать STOI для разборчивости, PESQ или ViSQOL при наличии эталона, MCD для тембрального сравнения.

7. Провести MOS на тех же фрагментах. Разделить естественность, разборчивость и пригодность к сцене.

8. Сопоставить числовые оценки с журналом дефектов. Отдельно зафиксировать ошибки ударения, пауз, дыхания и окончаний слов.

9. Повторить генерацию после изменения вокодера, длины референса или параметров просодии. Так определяется узел, который влияет на результат.

Как отличить артефакт модели от дефекта постобработки

Один и тот же симптом может возникнуть на разных стадиях. Высокочастотный шум появляется в вокодере, при ресэмплинге или после возбуждающего эквалайзера. Плоская динамика может быть свойством синтеза либо результатом лимитера на мастер-шине.

Разделение выполняется по контрольным файлам. Для каждого этапа сохраняют отдельную версию:

  • выход акустической модели или вокодера;
  • файл после шумоподавления;
  • файл после эквализации;
  • файл после компрессии;
  • финальный дубль в видеомиксе.

Если артефакт присутствует в первом WAV, его источник находится в генерации или декодировании. Если он возникает после обработки, нужно менять настройки постпродакшена. Попытка исправить дефект TTS-модели компрессором увеличивает вычислительный и производственный долг. Артефакт остается в исходнике и может проявиться после другого экспорта.

Проверка на реальном материале должна включать разные уровни громкости. На малой громкости слышны грубые ошибки баланса. На высокой — цифровой шум, клиппинг и резкие сибилянты. В миксе с музыкой тестируют разборчивость, а в соло — тембр и структуру шума.

Отдельный режим — прослушивание в замедлении. Скорость снижают без изменения высоты тона. Так проще обнаружить:

  • микроскачки F0;
  • лишние гласные на концах слов;
  • разрыв между фонемами;
  • повторяющийся шумовой паттерн;
  • неестественный старт после паузы;
  • короткие фазовые провалы.

Спектрограмма дает объективную визуальную опору, но не заменяет слух. Регулярные полосы могут быть следствием нормальной гармонической структуры. А отсутствие заметного паттерна не доказывает отсутствие синтетического происхождения. Коммерческие детекторы анализируют спектральные артефакты, паттерны дыхания и цифровые отпечатки нейрокодеков, но их внутренние алгоритмы закрыты. Гарантировать абсолютную точность такой классификации нельзя.

Что считать пройденным тестом

Для рабочего пайплайна недостаточно одного высокого MOS. Озвучка считается пригодной, если одновременно выполняются несколько условий:

  • голос сохраняет разборчивость на полной скорости;
  • окончания слов не искажаются;
  • паузы соответствуют синтаксису и монтажному ритму;
  • нет устойчивого цифрового шума в диапазонах 5–8 и 12–16 кГц;
  • низко-средняя область не перегружена грязью в районе 400–800 Гц;
  • стереосигнал не разрушается при моно-суммировании;
  • повторные генерации не дают случайного разброса тембра и громкости;
  • объективные метрики не противоречат слуховой оценке;
  • финальный файл проходит проверку после сведения, а не только в сыром виде.

Для корпоративной озвучки порог MOS выше 4.0 может быть достаточным стартовым ориентиром. Для кино, игр и аудиокниг этого мало. Там проверяется согласованность большого массива реплик. Один хороший фрагмент не компенсирует десятки случаев с неверным ударением или провалом интонации.

Итоговый отчет лучше строить не вокруг одной цифры, а вокруг карты дефектов. Указывать частотный диапазон, тип фонемы, позицию во фразе, версию модели и этап пайплайна. Это позволяет сравнивать не рекламные демонстрации, а реальные конфигурации инференса.

Озвучка через нейросеть проходит технический тест тогда, когда дефекты локализованы, повторяемы и не мешают задаче продукта. MOS описывает восприятие. STOI — разборчивость. PESQ и ViSQOL — сходство с эталоном. MCD — различие тембральных признаков. Спектральный анализ показывает следы вокодера. Ни один из методов не закрывает задачу в одиночку.

Практическая оценка строится на совмещении этих уровней. Все остальное — демонстрационный прогон без контроля качества.

Частые вопросы

Почему нейросетевой голос звучит чисто на телефоне, но плохо в наушниках?
На встроенных динамиках смартфона часто не воспроизводятся высокочастотный цифровой шум и тонкие фазовые искажения, которые становятся заметны в качественных наушниках.
Какие частотные диапазоны наиболее критичны при проверке нейросетевой озвучки?
Диапазон 400–800 Гц отвечает за «мутность» и гул, 5–8 кГц — за цифровой свист и резкость согласных, а 12–16 кГц — за высокочастотный шум и «песок».
Можно ли использовать MOS для оценки качества озвучки?
MOS показывает субъективное восприятие слушателей, но не объясняет технические причины дефектов, поэтому его следует применять в связке с инструментальным анализом.
Зачем проверять синтезированный голос в моно?
Проверка в моно выявляет фазовые сдвиги и ослабление сигнала, которые возникают при неудачном расширении стереобазы на этапе постобработки.
Что такое STOI и зачем он нужен?
STOI — это метрика для оценки разборчивости речи, которая помогает выявить потерю согласных или слогов, особенно в условиях фонового шума или агрессивной компрессии.