LIVE
Новость

ElevenLabs открыла API для эмоционального дубляжа видео на 90+ языков

ElevenLabs открыла API для модели Dubbing v2.

Савелий Попов·обновлено 12 августа 2026 г.

ElevenLabs открыла API для эмоционального дубляжа видео на 90+ языков

По данным компании, пайплайн позволяет встраивать автоматический дубляж видео в сторонние продукты и поддерживает более 90 языков с сохранением исходного голоса, эмоций, интонации и темпа спикера. Для ниши синтеза речи это переход от монолитного TTS к связке voice cloning + translation + sync в одном endpoint.

Архитектура пайплайна

Ключевое изменение версии — кондиционирование на оригинальное исполнение. Модель устраняет проблему «плоского» аудио, характерную для ранних систем: тон, эмоциональная окраска и манера подачи восстанавливаются на всех поддерживаемых языках, а не подменяются усреднённой просодией переводного TTS. Sync-aware логика перевода выравнивает старты и стопы реплик с таймкодами оригинала без ручной разметки. Локальные акценты различаются точнее — например, Castilian и Latin American Spanish идут отдельными локалями. Обработка фоновой аудио дорожки, музыки и эффектов улучшена; сцены с несколькими спикерами разделяются автоматически. Перевод, клонирование голоса, дубляж и синхронизация выполняются за один проход — интегрированный пайплайн вместо каскада отдельных модулей.

Контроль для интеграторов

API допускает подмену транскрипта: разработчик может передать собственный исходный текст и переводы на целевые языки либо отредактировать сегменты, сгенерированные моделью. Регенерация затрагивает только изменённые участки — экономия на повторных прогонах для длинных роликов заметная. Стартовая документация опубликована в виде ElevenAPI dubbing quickstart guide. Возможность править сегменты закрывает типовую проблему managed-дубляжа с именами, техническими терминами и брендами.

Что замерить перед интеграцией

Три сценария для прогона: длинный ролик с шумовым фоном и музыкальной подложкой, сцена с тремя и более спикерами, переключение между близкородственными локалями (es-ES vs es-MX, pt-BR vs pt-PT). Метрики качества — WER по выходному транскрипту обратного ASR, MOS на сохранение тембра спикера, доля сегментов, прошедших без ручной правки. По латентности API работает как managed-сервис: TTFA включает сетевой round-trip и не сопоставляется напрямую с on-prem развёртываниями. Для проектов с требованиями по резидентности данных, предсказуемой задержке и тонкой настройке каждого звена пайплайна имеет смысл параллельно оценить локальные TTS с открытыми весами.