LIVE
Новость

Стартап Fish Audio привлек $52 млн на развитие технологий синтеза речи и клонирования голоса

По данным TechCrunch, Fish Audio закрыла seed-раунд в $52 млн.

Савелий Попов·обновлено 28 июля 2026 г.

Стартап Fish Audio привлек $52 млн на развитие технологий синтеза речи и клонирования голоса

Лид — Coreline Ventures и Capital Today, с участием 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners и HF0. Средства пойдут на расширение линейки голосовых моделей для креаторов и enterprise-сегмента.

Стек и метрики

Платформа построена вокруг библиотеки из более чем 15 000 натурально-языковых контролов, управляющих просодией, эмоциональной окраской и стилем генерации. За год выпущено пять моделей: четыре речевых и одна speech-to-text. Три речевые модели опубликованы под открытыми весами, флагман S2.1 Pro — только через платный API. Репозиторий Fish Speech на GitHub набирает 31 000+ звёзд. Аудитория открытой и hosted-версий — 8 млн пользователей, ARR — $21 млн.

Основатель — бывший исследователь Nvidia Шицзя Ляо (Shijia Liao). Первая модель обучалась на одном GPU и выложена в open-source из-за разочарования неэкспрессивными синтетическими голосами. Среди enterprise-клиентов — HeyGen, Sanas и голосовые агенты на LiveKit. CEO и сооснователь Риса Цао (Rissa Cao) фиксирует расхождение требований по сегментам: HeyGen нужна реалистичность для AI-аватаров, игровым студиям — экспрессия, голосовым агентам вроде LiveKit — низколатентный натуральный звук.

Источник голосов — пользовательские загрузки с выплатой вознаграждения при коммерческом использовании. Весной часть креаторов заявила о загрузке их голосов без согласия. Процедура DMCA-удаления существовала, но обработка занимала дни. По словам Цао, takedown-пайплайн автоматизирован: короткий голосовой сэмпл или контракт подтверждают правообладание, удаление — менее чем за три минуты.

Слабое место схемы остаётся прежним: автоматизация сокращает время реакции, но не блокирует первичную загрузку чужого голоса. До момента обнаружения голос продолжает использоваться на платформе. Партнёр Coreline Ventures Осуке Хонда (Osuke Honda) формулирует требование инженерно: consent, transparency и attribution должны быть встроены в продукт, а не добавлены постфактум. Параллельно, по данным GIGAZINE, на рынке фиксируется рост мошенничеств с клонированием голоса на основе 3-секундных аудиосэмплов — фактор, который усиливает регуляторное давление на любые платформы с пользовательским вкладом.

Ценовой контекст

По данным Digital Trends, SpeechifyAI вывела модель Simba 3.2 на первое место рейтинга Artificial Analysis TTS с ценой $6 за 1 млн символов на масштабируемом тарифе. Рынок движется к снятию классического трейдоффа «качество — латентность — стоимость». Для Fish Audio это задаёт внешний ценовой бенчмарк одновременно для open-source и hosted-тарифов.