LIVE
Новость

Новые модели синтеза речи Inworld и Breeze TTS 2: прорыв в управлении интонацией

По данным Business Wire, Inworld выпустила линейку Realtime TTS-2 — две модели синтеза речи с временем отклика первого байта от 25 мс.

Савелий Попов·обновлено 03 сентября 2026 г.

Новые модели синтеза речи Inworld и Breeze TTS 2: прорыв в управлении интонацией

Параллельно BreezeBlue открыла веса Breeze TTS 2 с латентностью до 40 мс. Оба релиза поддерживают клонирование голоса и управление просодией через текстовые инструкции или WebSocket API — прямой ответ на запрос controllable TTS в индустрии голосовых агентов.

Спецификации Inworld TTS-2

По данным релиза: TTFB от 25 мс; две модели — Realtime TTS-2 и Realtime TTS-2 Flash. Управление интонацией через промптинг на естественном языке. Клонирование голоса заявлено. Целевой сценарий — масштабируемые голосовые диалоговые агенты. Число параметров, требования к VRAM и формат дистрибуции весов в анонсе Business Wire не указаны.

Breeze TTS 2: open-weight альтернатива

По данным Hugging Face: Breeze TTS 2 от BreezeBlue занимает первую позицию среди open-weight моделей в Artificial Analysis TTS leaderboard.

Заявленные параметры:

  • Латентность: до 40 мс.
  • Zero-shot клонирование по чистому референсному аудио и его транскрипту.
  • Reference-free voice design: создание голоса по текстовому описанию без аудио.
  • Reference-guided voice direction: сохранение идентичности спикера при смене тона, эмоции, темпа, манеры подачи.
  • Стриминг: mono 24 kHz, signed 16-bit little-endian PCM.
  • Аудио-токенизатор — Qwen3-TTS (Alibaba Qwen Team).
  • CLI-флаги: --cfg-scale 4 усиливает следование инструкциям; --fast-all включает оптимизированный путь инференса с дополнительным cold-start.

Лицензия и инференс. Исходный код и токенизатор — Apache 2.0. Веса, чекпоинты, адаптеры, self-hosted выходы — BreezeBlue Research and Non-Commercial License. Коммерческое использование выходов — только через платную подписку breezeblue.ai; подписка не передаёт прав на open-веса и self-hosted инференс. Лицензия отдельно запрещает несанкционированное клонирование голоса и имперсонацию. Запуск — Docker в CUDA-окружении, eager execution без graph warmup по умолчанию.

Для команд, разворачивающих коммерческие голосовые сервисы, попутно встаёт вопрос платежей и расчётов в смежных цифровых экосистемах — базовые принципы криптовалюты и практика её хранения разобраны здесь.

Что отслеживать на практике

  • Публикация весов или тарифов API Inworld TTS-2.
  • Прямое сравнение Breeze TTS 2 и Inworld TTS-2 на общем бенчмарке (MOS, Seed-TTS, TTFB под нагрузкой).
  • Появление коммерческой лицензии на self-host open-весов Breeze.
  • Стабильность WebSocket-стриминга под параллельными сессиями.

Сухая оценка: для R&D и прототипов обе модели рабочие. Выбор между закрытым API Inworld и open-весами Breeze для production голосового агента определяется не метриками MOS, а юридической моделью коммерческого развёртывания и стоимостью инференса на единицу диалога.