LIVE
Новость

Новая модель Soniox TTS v2: синтез речи с управлением эмоциями и клонированием голоса

Soniox выпустила TTS v2 — модель синтеза речи, объединяющую клонирование, мультиязычность и управляемую просодию в одном пайплайне.

Савелий Попов·обновлено 13 августа 2026 г.

Новая модель Soniox TTS v2: синтез речи с управлением эмоциями и клонированием голоса

По данным компании, модель поддерживает более 60 языков, работает с клонированием по нескольким секундам аудио и доступна по цене $0.70 за сгенерированный час.

Архитектура и управляемость

Ключевое нововведение — система аудиотегов, встроенная в inference-процесс. Текст размечается маркерами [excited], [whisper], [sobs], [voice cracking] и подобными, что позволяет программно задавать эмоциональную окраску фрагментов без отдельных моделей. Без тегов модель автоматически адаптирует ритм, паузы и акценты к семантике текста. Soniox позиционирует архитектуру как изначально мультиязычную: идентичность голоса, акцент и просодия сохраняются при смене языка внутри одной utterance. Переключение между английским, испанским, корейским и хинди в одном запросе не требует отдельной модели или повторного вызова. Для клонирования достаточно секунд аудио; пайплайн включает подавление шума, эха и артефактов записи — клон строится даже по телефонным записям вне студии. Стриминг в реальном времени поддерживается.

Контекст рынка

Релиз выходит на фоне обострения конкуренции в сегменте разговорного AI. Днём позже Deepgram представила Flux TTS — модель, оптимизированную под voice-агентов: время до первого звука от 80 мс, поддержка barge-in и динамическая регулировка скорости. Soniox идёт другим путём — акцент на выразительность и контроль через аудиотеги, а не на латентность диалога. Обе модели таргетируют enterprise-сегмент: Soniox заявляет точное произношение терминологии (медицина, право, финансы, инженерия), Deepgram — удержание контекста при прерываниях и переключениях.

Что проверить на практике

Тариф $0.70/час — конкурентный ориентир для оценки TCO при интеграции. При выборе между TTS v2 и альтернативами критичны три параметра: устойчивость кода в barge-in-сценариях (поток нужен, но качество важнее для длинных озвучек), поведение при смешении языков в реальном тексте и точность произношения доменных терминов. Без собственных тестов на целевом датасете выводы о пригодности преждевременны.