Яндекс и Сбер внедряют синтез речи и ИИ-ассистентов для языков народов России
Правды.Ру, к официальному Дню языков народов РФ Яндекс и Сбер развернули синтез, распознавание и диалоговый слой для редких региональных языков.
Савелий Попов·обновлено 08 сентября 2026 г.

Параллельно запущена платформа EthnoTech — браузерный пайплайн автоматического дубляжа видео через клонирование голоса. Для индустрии это массовый low-resource стресс-тест голосовых моделей в проде.
Контур релиза
Переводчик Яндекса расширен на 14 языков. В списке — осетинский, тувинский, чеченский, адыгейский; остальные десять позиций источник не уточняет. По пяти языкам — башкирскому, марийскому, чувашскому, удмуртскому, якутскому — внедрены TTS и ASR. Архитектурно это двусторонний голосовой конвейер с общей лингвистической базой: распознавание на входе, синтез на выходе. Задача — low-resource. Ограниченные корпуса, морфологически плотные формы, иерархические вокалические системы у ряда языков. Устойчивость акустической модели и качество вокодера на этих данных — параметр, по которому независимых бенчмарков пока нет. WER, CER, MOS, размер обучающих датасетов и задержку инференса источник не публикует.
GigaChat от Сбера заявил поддержку 18 языков, включая татарский, башкирский, якутский, крымскотатарский. Заявлены генерация текстов и диалоговый режим. Полный список из 18 позиций источник не раскрывает. Архитектурный вопрос — единый мультиязыковой трансформер или ансамбль специализированных моделей. От этого зависят cross-lingual transfer и поведение на OOD-запросах. Без публичных замеров практическая оценка невозможна.
EthnoTech: пайплайн дубляжа
Платформа EthnoTech позиционируется как браузерное расширение. Конвейер: извлечение референтной голосовой дорожки → клонирование диктора → машинный перевод сегмента → генерация речи на целевом языке тем же тембром → микширование в исходное видео. В демо заявлены 12 языков — татарский, якутский, башкирский и ещё девять; полный список источник не уточняет.
Узкое место — выравнивание просодии и длительности. Клон наследует тембр, но не паузальную структуру и интонацию исходной дорожки, что критично для естественности результата. Дополнительный риск — лингвистический слой: перевод и TTS опираются на те же low-resource модели, что формируют голосовой стек GigaChat и Яндекса. Единая точка отказа по качеству на целевых языках.
Что отслеживать
- Выход публичного API GigaChat с параметрами latency и лимитами для 18 языков.
- Независимые замеры WER и CER для ASR Яндекса на пяти low-resource языках.
- Качество клона в EthnoTech на демо-роликах: естественность просодии, утечка тембра, артефакты вокодера.
- Инфраструктурный пакет: поддержка национальных алфавитов в доменной зоне и шрифтовых системах заявлена, но конкретных сроков и параметров внедрения источник не приводит.