LIVE
Новость

Wispr AI привлекла $280 млн на развитие технологий распознавания речи в шумной среде

Wispr AI, разработчик кросс-платформенного диктовщика Flow, закрыл Series B на $280 млн при оценке $2 млрд, сообщает SiliconANGLE.

Савелий Попов·обновлено 18 августа 2026 г.

Wispr AI привлекла $280 млн на развитие технологий распознавания речи в шумной среде

Серия B на $280 млн: состав раунда

Раунд возглавила Menlo Ventures. В сделке участвовали существующие инвесторы Notable Capital, NEA, Neo Ventures, 8VC и MVP Ventures, плюс новые чеки — Acrew, Forerunner, Goodwater, Peak XV, Together Fund и PLUS Capital. Совокупное финансирование компании — $361 млн.

Canto: ASR, обученная на «грязном» аудио

Параллельно с раундом компания открыла превью собственной модели — Canto. Отличие от большинства коммерческих ASR — не в размере архитектуры, а в составе обучающих данных: датасет собран на реалистичных аудиосредах, а не на студийно чистых записях. В корпус входят сценарии улицы, салона автомобиля, офиса с открытой планировкой, кафе, фоновой музыки, лая, посторонней речи, множественных дикторов одновременно. Заявленная цель архитектуры — быстрая сепарация голоса носителя от среды и удержание точности при произвольном SNR.

По метрикам компании, при интеграции Canto во Flow частота ошибок транскрипции в шумных условиях снижается с ~30% до 5–10%. В тихой комнате отрыв от современных облачных транскрибаторов минимальный — там базовая точность и так высокая. Практический эффект: диктовка перестаёт быть «офисным» сценарием и устойчиво работает в машине, кафе, на улице, в переговорных с фоновым шумом — сегмент, в котором ранее ASR выдавал катастрофический WER.

Архитектура пайплайна Flow

Flow — прослойка между текстовым полем любого приложения и микрофоном. Пайплайн: речь → распознавание → нормализация текста (грамматика, филлеры типа «эм», «э-э», запинки, повторы, ложные старты) → чистый связный текст на выходе. По данным компании, через продукт суммарно создано более 60 млрд слов. Аудитория — практически все Fortune 500 и свыше 10 000 компаний.

Что запросить у вендора

Canto пока в превью. Перед продакшн-внедрением имеет смысл проверить: независимые бенчмарки на стандартных открытых ASR-датасетах (LibriSpeech, TED-LIUM, CHiME-4/5/6), латентность end-to-end на мобильных и десктопных клиентах, режим инференса (облако, он-премис, edge), условия обработки аудио и срок хранения логов, наличие SDK/API, тарификацию за минуту распознавания. Отдельный пункт — поддержка код-свича внутри одной сессии, устойчивость к акцентам и поведение модели на длинных диктовках свыше нескольких минут.