Обновление Studio Dots AI: инструменты для редактирования речи и клонирования голоса
По данным репозитория Studio Dots AI на GitHub, в августе 2026 года вышли две ветки релизов: dots.tts.edit для редактирования речи по текстовым инструкциям и семейство чекпоинтов dots.tts-mf-1step…
Савелий Попов·обновлено 14 августа 2026 г.

По данным репозитория Studio Dots AI на GitHub, в августе 2026 года вышли две ветки релизов: dots.tts.edit для редактирования речи по текстовым инструкциям и семейство чекпоинтов dots.tts-mf-1step, dots.tts-mf-2steps, dots.tts-mf-2steps-stts для высококачественного клонирования и double-streaming TTS. Базовая архитектура dots.tts не изменилась: 2B параметров, полностью непрерывный end-to-end авторегрессионный пайплайн без дискретных токенов — семантический энкодер, LLM, авторегрессионная flow-matching акустическая голова поверх 48 кГц AudioVAE.
Спецификация и бенчмарки
На Seed-TTS-Eval модель показывает WER 0,94% / 1,30% / 6,60% и SIM 81,0 / 77,1 / 79,5 на zh / en / zh-hard соответственно. На 24-язычном бенчмарке MiniMax средняя похожесть диктора — 83,9, лучший результат среди открытых моделей. Лицензия — Apache-2.0. Файл constraints/recommended.txt фиксирует воспроизводимые версии, pyproject.toml описывает диапазоны совместимости.
Для продакшн-инференса теперь поддерживается SGLang Omni: стриминг PCM, CUDA-graph в декодере бэкбона, continuous batching для MeanFlow, sCM и STTS. Замеры на Seed-TTS-Eval EN (1×H100, dots.tts-mf, num_steps=4): пиковый throughput 4,76 req/s / 19,86 audio_s/s при конкурентности 16, WER 1,35%. Под флагом --optimize dots.tts-soar выдаёт RTF p50 0,20 / 0,18 и first-chunk latency 225 / 69 мс (voice cloning / text-only); dots.tts-mf — 0,15 / 0,13 и 204 / 68 мс соответственно.
Редактирование: точки входа и флаги
dots.tts.edit работает как отдельный entry point. Обязательные аргументы: исходное аудио, размеченная инструкция, путь к выходному файлу. Параметры --source-text и --target-text опциональны: если их опустить или оставить пустыми, оба транскрипта выводятся из инструкции; непустые значения перекрывают вывод.
Поведение спикер-гайданса по умолчанию в режиме auto. Отключается, если инструкция содержит только операции emo, bg или enhance. Включается для text, pitch, rate, pause, speaker transfer и смешанных правок. Форсированное включение — --use-xvector или --use-xvector on; принудительное отключение — --use-xvector off. В TTS-режиме гайданс остаётся активен при наличии референса.
Контекст по теме клонирования
Параллельно ElevenLabs опубликовала руководство по API клонирования с разделением Instant Voice Cloning (IVC) и Professional Voice Cloning (PVC). Заявленная латентность Eleven Flash v2.5 — около 75 мс на инференс коротких входов, без учёта сетевого RTT. Eleven v3 поддерживает свыше 70 языков, Multilingual v2 — 29. Со своей стороны Министерство юстиции Японии, по данным Slator, выпустило руководство, по которому несанкционированное клонирование голосов актёров и знаменитостей квалифицируется как гражданское правонарушение на основании прав на публичность и личность.
Что проверить на практике
- Поднять dots.tts-mf с num_steps=4 на одной H100 и снять реальные req/s при конкурентности 8, 16, 32 — пайплайн-масштабирование отличается от заявленных пиков.
- Прогнать dots.tts.edit на кейсах pitch / rate / pause и смешанных инструкциях, чтобы подтвердить логику --use-xvector auto.
- Сравнить локальный SGLang-Omni против заявленных 68–225 мс и 75 мс у Flash v2.5 — ориентир для решения on-prem vs API.
- При коммерческом клонировании учитывать позицию японского Минюста: без явного согласия правообладателя клон остаётся в серой зоне.