Клонирование голоса через один линейный слой: прорыв в эффективности TTS-моделей
По данным arXiv, предварительно обученную модель генерации аудио и видео удалось превратить в систему клонирования голоса через один нулево-инициализированный линейный слой и короткую донастройку.
Савелий Попов·обновлено 21 августа 2026 г.

Исследователи добавили клонирование голоса в text-to-audio-video-модель одним линейным слоем
На тесте из 674 пар «текст—диктор» модель превзошла пять TTS-базовых систем по сходству голоса, а отдельный аудиорежим дал ускорение инференса порядка 30x относительно совместного аудио-видео пути. Для аудитории Voice-AI это показательное снижение параметрической сложности адаптации: добавляемый слой — единицы параметров, бэкбон остаётся замороженным.
Архитектура и режимы инференса
Ключевой элемент — линейный слой с нулевой инициализацией весов. Приём стандартный для адаптационных вставок: нулевая матрица на старте не вносит возмущения в выход мультимодального бэкбона, и исходная text-to-audio-video модель сохраняет поведение до начала донастройки. Обучается только вставка, параметры бэкбона замораживаются. Это сокращает требования по памяти GPU и объёму данных для адаптации под нового диктора.
Исходная модель генерирует аудио и видео совместно. Для задачи клонирования голоса заявлен отдельный аудиорежим: видео-ветка отключается, проход через бэкбон сокращается до аудио-компонента. Ускорение инференса — порядка 30x относительно совместного пути. Для практики это прямой выигрыш по latency: продакшн-TTS не нуждается в видео-части, и её исключение снижает вычислительные затраты пропорционально.
Бенчмарк
Тест: 674 пары «текст—диктор». Сравнение с пятью TTS-базовыми системами. Метрика — сходство голоса. Результат: модель обходит все пять базовых систем по этой метрике. Выборка из 674 пар достаточна для устойчивого сравнения по speaker similarity. Состав базовых систем и условия генерации в анонсе не раскрыты — ограничение для воспроизведения результатов.
Контекст для ниши
Подход снижает параметрическую сложность клонирования голоса: не требуется отдельная TTS-архитектура с собственным обучением, достаточно одного линейного слоя поверх мультимодального бэкбона. Параллельно Techora.ru сообщает об инцидентах с клонированием голосов и видео близких через нейросети. В этом контексте практический фокус смещается на детекторы синтетической речи и верификационные пайплайны на стороне потребителя аудио. Инженерам стоит отслеживать, появятся ли веса бэкбона и вставки в открытом доступе, и с какой скоростью аналогичный приём перенесут в open-source TTS-инструменты.