LIVE
Новость

Ученые СПбГУ разработали метод повышения естественности синтеза речи

Лингвисты СПбГУ добавили в пайплайн обучения Tacotron2 метки интонационных вариантов — по данным CNews, это позволило нейросети передавать нюансы интонирования в синтезированной русской речи.

Савелий Попов·обновлено 07 августа 2026 г.

Ученые СПбГУ разработали метод повышения естественности синтеза речи

Работа опубликована в материалах International Conference on Speech and Computer. Подход релевантен разработчикам TTS-моделей, где монотонность генерации по-прежнему ограничивает применимость голосовых систем за пределами утилитарных сценариев.

Интонационная разметка Tacotron2

Базовая архитектура — Tacotron2, автогенеративная seq2seq-модель с attention-механизмом. Доцент Нина Вольская и профессор Павел Скрелин (кафедра фонетики и методики преподавания иностранных языков СПбГУ) разработали интонационную классификацию, включённую в датасет обучения. Система разметки охватывает: мелодический диапазон (дифференциация восклицания и акцентного выделения), скорость произношения в связке с движением тона (иерархия смысловых отношений во фразе), тип высказывания (вопрос, повествование, приказ, просьба, обращение, незавершённость). Сообщается, что модель при правильной отладке способна воспроизводить манеру произношения, тембр, акцент. Метки интонационных вариантов структурируют обучающие данные так, что нейросеть выходит за рамки воспроизведения наиболее частотного варианта произношения — главного ограничения стандартных TTS-пайплайнов без лингвистической разметки.

Валидация

Для оценки качества генерации привлечены 42 носителя русского языка. Методика — ответы на вопросы после прослушивания синтезированных аудиозаписей. В публикации не раскрываются метрики (MOS, PESU, WER), не указан объём обучающего корпуса и конфигурация гиперпараметров Tacotron2 после модификации. Без этих данных воспроизводимость метода из стороннего описания ограничена. Доцент Ульяна Кочеткова (СПбГУ) заявила, что подход делает систему «более гибкой и подходящей для различных областей применения», включая голосовое управление и образовательные программы.

Значение для ниши

Главный вынос для разработчиков TTS: лингвистически мотивированная разметка интонаций в обучающем датасете — альтернатива увеличению параметров модели для повышения естественности речи. Tacotron2 — архитектура 2017 года, и вопрос, переносится ли эффект интонационных меток на современные диффузионные и потоковые вокодеры (VITS, StyleTTS2, XTTS), остаётся открытым. Для продакшена критично: нет данных о latency после дообучения, не оценено влияние на скорость инференса, не протестирован zero-shot-режим на новых спикерах. Практическое применение — голосовые ассистенты, в том числе в приложениях для спортивных тренировок и фитнеса, где инструкции голосового сопровождения должны звучать интонационно адекватно: мотивирующий призыв и нейтральная навигация по упражнениям — разные интонационные контуры. Отсутствие такого разграничения в стандартном TTS-выводе — типичный артефакт, который метод СПбГУ призван устранять.