ElevenLabs представила модель Dubbing v2 для прямого дубляжа без текстового посредника
По данным Crypto Briefing, ElevenLabs выпустила Dubbing v2 — модель дубляжа, в которой генерация обусловлена напрямую на акустике исходной дорожки, минуя текстовое представление.
Савелий Попов·обновлено 14 сентября 2026 г.

Для пайплайнов локализации аудио это убирает текстовое звено как узкое место: на входе остаётся сырая дорожка, на выходе — перевод с сохранённой манерой спикера.
Архитектура и параметры
v1 работала по классической трёхзвенной цепочке: ASR → машинный перевод → TTS. На каждом переходе терялись просодия, микропаузы и эмоциональная окраска — признаки, которые текстовый транскрипт не кодирует в принципе. Dubbing v2 выбрасывает промежуточный текстовый слой и извлекает тембр, темпо-ритмику, интонацию и эмоциональный окрас прямо из волновой формы исходной дорожки. На выходе — перевод, в котором спикер звучит так, будто произнёс фразу на целевом языке без потери исходной манеры.
Поддерживается 90+ языков с региональными вариантами. До 32 спикеров в одном файле, включая перекрывающиеся реплики — на входе это снимает ручную диаризацию и предварительную разметку тайм-кодов. Sync-aware трансляция автоматически подгоняет тайминги сегментов под хронометраж оригинала, что убирает отдельный этап лип-синка в постпродакшне. Фоновая дорожка — эмбиент, музыка, фоли — проходит транзитом без пересинтеза: меняется исключительно голосовой слой, остальные компоненты микса сохраняются.
Дистрибуция
Модель поставляется через два продукта. ElevenCreative — для индивидуальных авторов, ютуберов, подкастеров и независимых продакшнов, которым нужен быстрый дубляж без полного студийного цикла. ElevenProductions — для enterprise-клиентов с масштабной локализацией и большими объёмами контента. API запущен 6 августа 2026 — через него дубляж встраивается в собственные пайплайны обработки, что критично для интеграторов и платформ с автоматизированной локализацией. Параллельно открыта Creator Dubbing Partner Program: 30 минут бесплатного использования в течение семидневного промо-окна на старте. Dubbing v1 остаётся в линейке как бюджетный вариант — для задач, где приоритет — охват и скорость, а не точная передача манеры оригинала.
Что мерить на своих данных
Стоимость инференса на длинных дорожках не раскрыта — это ключевой параметр при масштабировании на библиотеки контента и при пакетной обработке эпизодов подкастов. Стабильность диаризации при сильных акцентах, шумных полевых записях и перекрытии реплик — тоже не верифицирована. Поведение модели на региональных вариантах с редкой парой языков и стабильность передачи просодических нюансов оригинала — параметры, которые нужно снимать на собственных материалах. Релизных бенчмарков и замеров качества в анонсе нет. Параллельно появились заголовки о планах Murf AI по обновлению голосовой модели и о подготовке Meta кастомных голосов и апгрейдов для Muse — сегмент синтеза и дубляжа движется синхронно у нескольких игроков, и сравнивать Dubbing v2 с конкурентами имеет смысл только после собственных замеров.