LIVE

Нейросеть для озвучки текста на русском: метод расчёта и бенчмаркинг параметров синтеза

Нейросеть для озвучки текста на русском нельзя сравнить по одному демо-роликам. В демо нет холодного старта, длинных числительных, омографов, аббревиатур, шумного микса, смены темпа и ограничений по таймингу.

Обновлено31 июля 2026 г.
Чтение11 мин
Нейросеть для озвучки текста на русском: метод расчёта и бенчмаркинг параметров синтеза

Там обычно нет и измерений.

Рабочий бенчмарк русской TTS фиксирует минимум пять слоёв: субъективное качество, разборчивость, лингвистическую предобработку, скорость инференса и параметры готового аудио. Для ИИ-дубляжа добавляется изохронность. Липсинк оценивается отдельно. Эти показатели не сводятся к одному итоговому числу.

Онлайн-сервисы и локальные русские голосовые модели TTS часто публикуют несовместимые характеристики. Один указывает частоту дискретизации. Другой — число голосов. Третий — время генерации короткой фразы на неизвестной GPU. Сравнивать такие данные как рейтинг нельзя. Нужен единый тестовый стенд.

Тембр без нормализации текста — не показатель качества. Ошибка в ударении разрушает реплику раньше, чем слушатель оценит вокодер.

MOS: как измерять естественность, а не собирать реакции на демо

MOS, Mean Opinion Score, — среднее арифметическое субъективных оценок слушателей. Базовая шкала ACR содержит пять градаций. Участник прослушивает клип и выставляет оценку качества. Затем валидные ответы суммируются и делятся на их число.

Формула элементарна:

MOS = сумма оценок / число валидных оценок.

Если 40 слушателей дали суммарно 164 балла, MOS равен 4,10. Округление до целого числа бессмысленно. Разница между 4,10 и 4,35 может быть существенной, но только вместе с данными о размере выборки, доверительном интервале, методике скрининга и составе аудиоматериала.

Для теста нейросети для озвучки текста на русском одного общего MOS недостаточно. Нужны отдельные срезы:

  • нейтральный связный текст;
  • диалоговые реплики;
  • новости с именами, должностями и топонимами;
  • даты, суммы, дроби, артикулы и телефоны;
  • аббревиатуры и англицизмы;
  • омографы;
  • длинные предложения с несколькими синтагмами;
  • эмоционально маркированные фразы, если модель заявлена для дубляжа или игр.

MOS по чистым литературным предложениям почти всегда выглядит лучше, чем MOS по производственному набору. Это не дефект метрики. Это дефект тестового набора, если он не соответствует задаче.

Методика ITU-T P.808 описывает проведение краудсорсинговой субъективной оценки речи. В ней зафиксированы квалификационные и обучающие задания, контроль условий прослушивания, фильтрация ненадёжных ответов, требования к отчётности. Рекомендация действует с июня 2021 года. Для внутренних бенчмарков не обязательно воспроизводить каждый процедурный элемент буквально. Но без контроля слушателей MOS быстро превращается в случайную реакцию на знакомый тембр или удачную фразу.

Практический протокол выглядит так:

1. Фиксируется набор текстов. Один и тот же текст проходит через все модели. Ручные исправления допускаются только как отдельный режим теста. Нельзя исправить ударение в одной системе и не исправить в другой.

2. Фиксируется режим генерации. Темп, эмоциональные теги, SSML, температура, reference audio для voice cloning, параметры prosody control. Если режимы различаются, это отражается в названии прогона.

3. Клипы нормализуются по громкости. Слушатель не должен выбирать более громкий вариант только потому, что он кажется детальнее.

4. Ответы очищаются. Убираются результаты участников, не прошедших квалификационные задания или систематически ставивших одну оценку.

5. MOS разделяется по типам ошибок. Естественность и разборчивость не являются одной величиной. Голос может быть гладким, но неправильно читать «замок», «атлас» или «плачу».

В исследовании корпуса RUSLAN синтезированная русская речь получила MOS 4,05 по естественности и 3,78 по разборчивости. Это полезная точка отсчёта для понимания масштаба оценок. Не отраслевой норматив. Не оценка всех современных движков. Не основание объявлять модель с MOS выше четырёх пригодной для любого сценария.

Сравнение MOS между публикациями часто некорректно. Меняются слушатели, гарнитуры, длина клипов, языковой материал, способ фильтрации ответов. Меняется даже трактовка вопроса: «насколько естественно» и «насколько качественно» — не полностью идентичные задачи.

Для базового понимания того, как нейросети преобразуют данные в текстовые представления и обратно в прикладных системах, полезен разбор принципов работы нейросетей. В TTS этот общий слой дополняется акустической моделью, предсказанием длительностей, F0-контуром и вокодером. Именно эти модули определяют, как текст превращается в аудиопоток.

RTF: скорость синтеза без маркетинговой подмены

RTF, real-time factor, показывает отношение времени генерации к длительности полученного аудио:

RTF = время синтеза / длительность аудио.

Если система генерирует 60 секунд речи за 15 секунд, RTF равен 0,25. Если 60 секунд аудио строятся за 90 секунд, RTF равен 1,5. Значение ниже единицы означает генерацию быстрее реального времени.

Для локализации видео, пакетной озвучки каталога и диалогов в игре RTF — прямой параметр затрат. Для интерактивного ассистента он недостаточен: там отдельно измеряется first-chunk latency, время до первого аудиофрагмента, и устойчивость стриминга. Система с низким средним RTF может быть непригодна для диалога, если держит пользователя в тишине до завершения полного инференса.

В протоколе RTF должны быть указаны:

  • CPU или GPU, модель процессора и видеокарты;
  • версия драйвера, runtime и фреймворка;
  • число потоков CPU;
  • batch size;
  • холодный или прогретый запуск;
  • точность весов: FP32, FP16, INT8 и другие режимы;
  • длительность и тип тестовых фраз;
  • частота дискретизации и формат вывода;
  • число одновременно обслуживаемых запросов;
  • этапы пайплайна, включённые в замер.

Последний пункт обычно скрывает основную проблему. Один разработчик считает только работу акустической модели и вокодера. Другой включает загрузку весов, нормализацию текста, G2P, постановку ударений, кодирование, запись WAV и передачу по сети. Для продукта нужен второй вариант. Для анализа архитектуры полезны оба.

Что измеряетсяУзкий бенчмаркПроизводственный бенчмарк
Загрузка весовОбычно исключенаОтдельно фиксируется
Нормализация текстаЧасто исключенаВключена
Ударения и G2PМожет быть отключеноВключено
Акустическая модельВключенаВключена
ВокодерВключёнВключён
Сериализация и отдача аудиоОбычно исключенаВключена или измеряется отдельно
ЦельСравнение инференсаОценка задержки сервиса

Частота дискретизации ломает сравнение RTF не хуже аппаратной части. В Piper профили low, medium и high связаны не только с размером модели, но и с разным аудиорежимом: low использует 16 кГц, medium — 22,05 кГц, high — также 22,05 кГц при более крупной модели. У Silero v4_ru заявлены выходы 8, 24 и 48 кГц. Эти варианты нельзя ставить в одну таблицу скоростей без явной маркировки.

48 кГц не гарантирует более естественную речь, чем 24 кГц или 22,05 кГц. Результат зависит от акустической модели, вокодера, исходного датасета и назначения файла. Для телефонного IVR 48 кГц создаёт лишний объём и нагрузку. Для мастер-файла видеодубляжа ограничения другие. Но повышение sample rate не исправляет неверное ударение, сбитую паузу или плоскую интонацию.

RTF без конфигурации железа и пайплайна — рекламная величина. Для воспроизводимого теста он не существует.

Отдельно измеряется масштабирование. При росте числа параллельных запросов средний RTF может снижаться из-за батчинга, но p95 latency вырастет. Для API синтеза это критично. Пакетная генерация аудиокниги допускает очередь и агрессивный batch size. Озвучка реплик в реальном времени — нет. Поэтому отчёт должен содержать не только среднее, но и хвосты распределения задержки.

Русский текст: фронтенд определяет больше, чем тембр

Синтез речи на русском языке начинается не с вокодера. Он начинается с text frontend. Модель должна преобразовать входную строку в последовательность, пригодную для акустического декодирования. Ошибка на этом этапе проходит весь пайплайн без возможности исправления на выходе.

Русский язык создаёт несколько устойчивых классов сбоев:

  • омографы: «замок», «атлас», «мука», «плачу»;
  • числительные в контексте падежа и рода;
  • даты в разных форматах;
  • денежные суммы и единицы измерения;
  • сокращения: «г.», «ул.», «млн», «кВт», «т. д.»;
  • латиница внутри русской фразы;
  • бренды, никнеймы, игровые термины;
  • имена и фамилии с неочевидным произношением;
  • римские цифры и номера версий;
  • пунктуация, управляющая паузами и границами синтагм.

Омографы требуют контекстной постановки ударения. Словарь решает только часть задачи. Для «он открыл замок» и «старинный замок на холме» нужен разный разбор фразы. Модель, которая демонстрирует естественный тембр на подготовленных предложениях, может систематически ошибаться в неразмеченном пользовательском тексте.

Поэтому бенчмарк русской генерации речи ИИ должен иметь отдельную метрику лингвистической точности. Не обязательно сводить её к WER или CER. Эти метрики полезны при ASR-проверке, но не ловят все просодические ошибки. Распознаватель может корректно восстановить слово «замок», не различая ударения.

Рабочая разметка строится по категориям. Для каждого клипа эксперт отмечает наличие или отсутствие ошибки:

КатегорияЧто считать ошибкойПоследствие в продукте
УдарениеНеверная ударная гласнаяИскажение смысла или неестественная речь
ЧислительноеНеверное чтение даты, суммы, дробиОшибка в новостях, финансах, обучающих материалах
АббревиатураЧтение букв как слова или наоборотНепонятная терминология
Имя собственноеНеверное произношение имени, топонима, брендаСбой в дубляже и аудиокниге
ПаузаЛишний разрыв или отсутствие границыНарушение синтаксиса и темпа
ИнтонацияНеверный контур вопроса, перечисления, обращенияПотеря коммуникативной функции

Часть движков предоставляет нормализацию и ударения внутри модели. Например, у Silero v4_ru заявлена автоматическая расстановка ударений и шесть голосовых вариантов: aidar, baya, kseniya, xenia, eugene, random. Это характеристика конкретной реализации. Она не отменяет тесты на доменном корпусе.

Для видеоигры доменный корпус включает названия предметов, квестов, оружия, внутриигровые имена, искусственные топонимы и англоязычные команды. Для аудиокниги — прямую речь, архаизмы, сложный синтаксис, авторские неологизмы. Для корпоративной озвучки — продуктовые артикулы, названия тарифов, юридические сокращения. Универсального открытого русского набора, который покрывает все эти режимы одновременно, нет.

Практический вывод простой. Нейросети для озвучивания текста онлайн следует тестировать не на абстрактных фразах, а на выгрузке из будущего продукта. Достаточно обезличить данные, сохранить распределение конструкций и вручную разметить критичные токены. Так выявляется реальная стоимость постредактуры.

Аудиопоток: частота, громкость, кодек и границы экспорта

Качество готового синтеза определяется не только моделью. В продакшене аудио проходит ресемплинг, монтаж, шумоподавление, сведение с музыкой, кодирование и доставку на платформу. На каждом этапе можно потерять разборчивость или создать технический брак.

Для нейроозвучки стоит фиксировать четыре параметра:

1. Частота дискретизации. Она должна соответствовать цепочке производства. Если монтаж ведётся в проекте с 48 кГц, экспорт модели в 24 кГц потребует ресемплинга. Это допустимо, но должно быть осознанным решением, а не настройкой по умолчанию.

2. Разрядность и формат. Для мастера нужен несжатый формат. MP3 или AAC оставляют для доставки. Перекодирование с потерями между этапами не имеет смысла.

3. Пиковый уровень и клиппинг. Агрессивная нормализация может поднять дыхание, артефакты вокодера и сибилянты. После TTS нужно контролировать true peak, а не только sample peak.

4. Интегральная громкость. Для вещательного workflow EBU R 128 задаёт ориентир −23 LUFS. Это рекомендация для соответствующего производственного контура, а не универсальное правило для игр, соцсетей, аудиокниг или каждой видеоплатформы.

EBU Mode использует три окна измерения: momentary на 400 мс, short-term на 3 секунды и integrated по всей программе. Для короткой реплики важнее моментные и краткосрочные значения. Для часовой аудиокниги — интегральный уровень и стабильность между главами.

TTS часто имеет нестабильную энергию на стыках фраз. Отдельные реплики могут быть технически нормальны, но в последовательности одна звучит тише соседней на несколько децибел. При монтаже диалогов это создаёт эффект разных микрофонов. Поэтому измерять нужно не только отдельные WAV-файлы, но и собранную сцену.

Нельзя использовать LUFS как замену оценки качества. Файл, приведённый к целевой громкости, не становится лучше по дикции. Но без выравнивания громкости нельзя честно проводить MOS-тест: громкий вариант часто воспринимается как более чёткий и детальный.

Автоматический дубляж: изохронность не равна липсинку

Автоматический перевод видео добавляет слой, которого нет в обычной TTS. Реплика должна передать смысл, удержать характер персонажа, уложиться в сцену и не разрушить монтаж. Переводчик, duration model, TTS, модуль voice conversion и lip-sync здесь образуют связанный пайплайн. Ошибка в начале переносится дальше.

Изохронность — соответствие тайминга переведённой реплики исходной. Это не количество символов и не число слов. Русский перевод почти всегда меняет длину фразы относительно английского, японского или корейского оригинала. Простое ограничение символов заставляет переводчик вырезать смысловые элементы, а синтезатор — ускорять речь до неестественного темпа.

Для измерения изохронности применимы предикторы длительности TTS. Подход IsoChronoMeter рассматривает тайминг как самостоятельную оптимизационную цель. Обычный перевод, включая человеческий, без специальной подгонки не обязан хорошо совпадать с исходной длительностью.

Но совпадение длительности не закрывает задачу. Исследование 319,57 часа дубляжа из 54 профессионально выпущенных произведений показало другой порядок приоритетов: естественность голоса и качество перевода для человеческого дубляжа значимее, чем часто абсолютизируемые ограничения по числу символов и липсинку. Временные ограничения необходимы. Они не являются единственной метрикой.

Для оценки ИИ-дубляжа требуется минимум четыре независимых слоя:

  • переводческая адекватность: смысл, регистр, терминология, персонажная речь;
  • временная посадка: начало, конец, паузы, длина синтагм, отсутствие наложений;
  • акустическая естественность: тембр, интонация, дыхательные паузы, отсутствие артефактов;
  • аудиовизуальная синхронизация: соответствие звука артикуляции и видимым движениям лица.

В исследованиях липсинка встречаются LSE-D и LSE-C. Их нельзя переносить в продукт как универсальные пороги приемлемости. Метрики зависят от датасета, языка, качества видео, системы детекции лица и самой архитектуры синхронизации. Низкое значение одной метрики не гарантирует, что зритель не заметит сбой на крупном плане.

Для дубляжа полезнее тестировать не среднюю реплику, а проблемные классы сцен:

  • крупный план с отчётливой артикуляцией;
  • быстрый диалог с перебивками;
  • реплики поверх действия и шума;
  • крик, шёпот, плач, смех;
  • фразы с видимыми губными смычками;
  • монтажные склейки внутри одной реплики;
  • персонажи с разной манерой речи.

На этих сценах проверяется весь стек. Перевод может попасть в длительность, но утратить реакцию персонажа. Липсинк может совпасть на гласных, но TTS выдаст неверную фразовую интонацию. Голосовой клон может сохранить тембр, но просесть по разборчивости на повышенном темпе.

Что считать результатом бенчмарка

Отчёт по русской TTS не должен заканчиваться фразой «модель звучит естественно». Нужна таблица режимов и ограничений: MOS по типам текстов, доля лингвистических ошибок, RTF на зафиксированном оборудовании, задержка первого чанка, частота дискретизации, динамика при параллельной нагрузке, параметры громкости и результаты на дубляжных сценах.

Единого проходного MOS, RTF или порога рассинхрона для русского синтеза нет. Для аудиокниги допустим медленный офлайн-инференс и ручная корректура. Для голосового ассистента критичны задержка и стабильность стриминга. Для дубляжа приоритет смещается к переводу, изохронности и монтажной пригодности. Для игр — к управляемости эмоций, пакетной генерации и консистентности персонажа.

Нейросеть для озвучки текста на русском выбирают не по числу голосов и не по частоте 48 кГц в спецификации. Выбирают по воспроизводимому набору текстов, фиксированной конфигурации инференса и стоимости исправления ошибок после генерации. Остальные параметры вторичны.

Частые вопросы

Что такое MOS и как его правильно измерять?
MOS — это среднее арифметическое субъективных оценок слушателей, которое вычисляется делением суммы баллов на число валидных ответов. Для тестирования нейросетей одного общего показателя недостаточно, нужны срезы по нейтральным текстам, новостям, датам, омографам и другим категориям.
Что показывает метрика RTF в бенчмарках синтеза речи?
RTF отражает отношение времени генерации к длительности полученного аудио. Значение ниже единицы указывает на то, что система генерирует речь быстрее реального времени.
Какие параметры обязательно нужно указывать в протоколе RTF?
В протоколе фиксируют модель процессора или видеокарты, версию драйвера, фреймворка и рантайма, число потоков CPU, размер батча, режим запуска, точность весов, параметры аудио, а также этапы пайплайна, включенные в замер.
Почему для русского языка важен лингвистический фронтенд?
Фронтенд преобразует входную строку в последовательность для акустического декодирования и решает сложные задачи с омографами, числительными, аббревиатурами и падежами, ошибки в которых проходят весь пайплайн без возможности исправления.
Какие основные слои включает оценка автоматического ИИ-дубляжа?
Для оценки ИИ-дубляжа требуется минимум четыре слоя: переводческая адекватность, временная посадка с учетом пауз, акустическая естественность голоса и аудиовизуальная синхронизация с движениями лица.