LIVE
Новость

Лаборатория Kyutai открыла исходный код для обучения компактной модели Pocket TTS

По данным лаборатории Kyutai, в открытый доступ выложен исходный код для обучения Pocket TTS — компактной модели синтеза речи на 100 млн параметров с CPU-инференсом и встроенным клонированием голоса.

Савелий Попов·обновлено 29 августа 2026 г.

Лаборатория Kyutai открыла исходный код для обучения компактной модели Pocket TTS

Для инженерной аудитории это редкий случай публикации именно обучающего пайплайна, а не только готовых весов.

Спецификация и состав релиза

Заявленные характеристики Pocket TTS: ~100M параметров, локальный запуск на CPU, встроенная функция клонирования голоса. Размер модели позиционирует её в нише легковесных движков для edge- и on-device-сценариев — там, где приоритет составляют малый объём артефакта, низкое потребление памяти и предсказуемая латентность на пользовательском железе, а не пиковое качество на серверном GPU. CPU-only режим исключает зависимость от CUDA-стека и специализированных ускорителей. Клонирование без внешнего voice encoder снимает необходимость подключать сторонний модуль извлечения эмбеддингов спикера и согласовывать его выход с вокодером основной модели — это сокращает число точек интеграции и упрощает деплой.

В отличие от большинства TTS-релизов, где публикуются исключительно предобученные чекпоинты, Kyutai открыла код обучения целиком. Разработчик получает: воспроизводимость тренировки с нуля на собственной инфраструктуре, модификацию обучающего датасета, fine-tune под собственный голосовой материал или целевой язык, замену компонентов пайплайна при наличии соответствующих модулей в репозитории. CPU-only режим снижает порог входа в локальные эксперименты — отпадает требование к серверным GPU, что критично для индивидуальных разработчиков и небольших команд.

Регуляторный контекст

Публикация совпала с волной обсуждения правового статуса голоса. По сообщению «Ак Жайык» со ссылкой на Би-би-си, около 80 британских артистов — в их числе Никола Кофлан и Хью Бонневилль — обратились к парламенту с кампанией «Спасите наши голоса — немедленно!». Требование — признать голос официальной собственностью человека по аналогии с датским законодательством. Аргумент кампании: нейросети воспроизводят голос по трёхсекундному аудиофрагменту; 28% взрослых жителей Великобритании уже сталкивались с мошенничеством с использованием ИИ-клонов. В правительстве заявили о готовности к публичным консультациям. Контраргумент специалистов: клонирование помогает пациентам, утратившим речь из-за тяжёлых заболеваний, восстановить коммуникацию.

Что отслеживать

Лицензия на код и на веса — ключевой параметр для коммерческого применения. Состав репозитория: скрипты подготовки данных, конфигурации обучения, документация по гиперпараметрам, наличие предобученных чекпоинтов. Публикация метрик MOS, speaker similarity и real-time factor при CPU-инференсе. Совместимость с распространёнными фреймворками инференса. Выход лицензированных голосовых датасетов, пригодных для легального fine-tune.