LIVE
Новость

ElevenLabs представила модель Dubbing v2 для прямого дубляжа без текстового посредника

По данным Crypto Briefing, ElevenLabs выпустила Dubbing v2 — модель дубляжа, в которой генерация обусловлена напрямую на акустике исходной дорожки, минуя текстовое представление.

Савелий Попов·обновлено 14 сентября 2026 г.

ElevenLabs представила модель Dubbing v2 для прямого дубляжа без текстового посредника

Для пайплайнов локализации аудио это убирает текстовое звено как узкое место: на входе остаётся сырая дорожка, на выходе — перевод с сохранённой манерой спикера.

Архитектура и параметры

v1 работала по классической трёхзвенной цепочке: ASR → машинный перевод → TTS. На каждом переходе терялись просодия, микропаузы и эмоциональная окраска — признаки, которые текстовый транскрипт не кодирует в принципе. Dubbing v2 выбрасывает промежуточный текстовый слой и извлекает тембр, темпо-ритмику, интонацию и эмоциональный окрас прямо из волновой формы исходной дорожки. На выходе — перевод, в котором спикер звучит так, будто произнёс фразу на целевом языке без потери исходной манеры.

Поддерживается 90+ языков с региональными вариантами. До 32 спикеров в одном файле, включая перекрывающиеся реплики — на входе это снимает ручную диаризацию и предварительную разметку тайм-кодов. Sync-aware трансляция автоматически подгоняет тайминги сегментов под хронометраж оригинала, что убирает отдельный этап лип-синка в постпродакшне. Фоновая дорожка — эмбиент, музыка, фоли — проходит транзитом без пересинтеза: меняется исключительно голосовой слой, остальные компоненты микса сохраняются.

Дистрибуция

Модель поставляется через два продукта. ElevenCreative — для индивидуальных авторов, ютуберов, подкастеров и независимых продакшнов, которым нужен быстрый дубляж без полного студийного цикла. ElevenProductions — для enterprise-клиентов с масштабной локализацией и большими объёмами контента. API запущен 6 августа 2026 — через него дубляж встраивается в собственные пайплайны обработки, что критично для интеграторов и платформ с автоматизированной локализацией. Параллельно открыта Creator Dubbing Partner Program: 30 минут бесплатного использования в течение семидневного промо-окна на старте. Dubbing v1 остаётся в линейке как бюджетный вариант — для задач, где приоритет — охват и скорость, а не точная передача манеры оригинала.

Что мерить на своих данных

Стоимость инференса на длинных дорожках не раскрыта — это ключевой параметр при масштабировании на библиотеки контента и при пакетной обработке эпизодов подкастов. Стабильность диаризации при сильных акцентах, шумных полевых записях и перекрытии реплик — тоже не верифицирована. Поведение модели на региональных вариантах с редкой парой языков и стабильность передачи просодических нюансов оригинала — параметры, которые нужно снимать на собственных материалах. Релизных бенчмарков и замеров качества в анонсе нет. Параллельно появились заголовки о планах Murf AI по обновлению голосовой модели и о подготовке Meta кастомных голосов и апгрейдов для Muse — сегмент синтеза и дубляжа движется синхронно у нескольких игроков, и сравнивать Dubbing v2 с конкурентами имеет смысл только после собственных замеров.