LIVE
Новость

Новые модели синтеза речи для 29 языков народов России

По данным Хабра, опубликованы два TTS-чекепойнта для 29 языков России, ранее не покрытых публичными моделями синтеза.

Савелий Попов·обновлено 03 августа 2026 г.

Новые модели синтеза речи для 29 языков народов России

Предыдущий релиз закрывал 20 самых популярных языков России и СНГ, оставляя без покрытия абхазо-адыгскую и нахско-дагестанскую группы. Текущий апдейт закрывает этот разрыв и расширяет тюркскую ветку. Для инженеров это конкретный набор весов с воспроизводимым пайплайном запуска и демо-ноутбуком в браузере.

Состав моделей

Кавказская модель: 15 языков, 31 голос. Покрытие — абхазо-адыгская и нахско-дагестанская группы, основной массив языков Кавказа, Дагестана и Чечни. Тюркская модель: 14 языков, 33 голоса. Дополнительно в тюркскую модель включены таджикский (иранская группа) и калмыцкий (монгольская группа) — из-за дефицита данных под отдельные семейства. Ударением управлять нельзя, модели проставляют его автоматически. Для кавказских языков это критичное ограничение, для тюркских — менее существенное.

Алфавит: конкатенация официальных кириллических алфавитов всех целевых языков. Полный список разрешённых символов включает базовую пунктуацию, основную кириллицу и расширения для конкретных языков. Поддерживаются биграммы — модель обрабатывает их без ручного вмешательства. Прикладной нюанс: в текстах из интернета часто встречаются латинские замены кириллических символов. Это причина долгой отладки на пустом месте. Использовать только кириллицу.

Пайплайн запуска

Установка: pip-пакет, torch.hub, либо прямой клон репозитория. Зависимость — PyTorch, выбор версии под CPU или GPU по официальной инструкции. CPU-инференс требует ручной настройки числа потоков, рекомендация — 4 потока как стартовая точка. Опционально поддерживается SSML. Качество синтеза улучшено относительно предыдущей публичной модели за счёт применённых оптимизаций и дополнительного ноу-хау.

Демо-ноутбук запускается прямо в браузере. Для прод-инференса — стандартный набор: загрузка весов, выбор устройства, прогон текста через модель. Продвинутый пользователь может дёргать модель собственным скриптом без репозитория.

Что отслеживать

Практическое применение — IVR, локализация интерфейсов, дубляж контента, включая поп-культурные тренды и celebrity-хронику, где русскоязычный синтез до этого был безальтернативой. Ограничение по ударению делает модель непригодной для задач с жёсткими требованиями к просодии — поэтический синтез, академическая диктовка, обучающие материалы. Отдельная точка внимания — качество данных: авторы прямо указывают, что работа с датасетом потребовала значительных затрат. Это сигнал о том, что базовые текстовые корпуса на этих языках зашумлены, и инференс на сырых данных может давать нестабильный результат. На стыке родственных языков рекомендуется максимально использовать фонетическую похожесть — это компенсирует разреженность обучающих данных и снижает артефакты произношения.