Стартап Смаллест.ai привлек $13 млн на развитие речевого искусственного интеллекта
Стартап Смаллест.ai, основанный в конце 2024 года, закрыл раунд Серии А на 13 миллионов долларов, сообщает TechCrunch. Общий объем привлеченного финансирования достиг 21 миллиона долларов.
Савелий Попов·обновлено 02 августа 2026 г.

Для индустрии TTS и разговорного AI раунд — индикатор смещения капитала: деньги идут не в универсальные LLM, а в специализированный голосовой слой реального времени.
Архитектура: компактная голосовая модель + офлайн LLM
Голосовой пайплайн большинства современных ИИ-агентов наследует текстовую логику: вход — текст, выход — текст, озвучка — отдельный шаг через TTS-стек. Крупные языковые модели принимают текстовый запрос целиком и выдают ответ единым блоком. В текстовом чате задержка незаметна, в голосовом диалоге даже минимальная пауза воспринимается как маркер «робота».
Подход Смаллест.ai — двухступенчатая декомпозиция инференса. Компактная голосовая модель обрабатывает поток в реальном времени: акустика, интент, генерация ответа с минимальной задержкой. При выходе за пределы ограниченной базы знаний модель переводит клиента в режим ожидания на короткое время и обращается к более крупной базовой LLM. CEO Сударшан Камат описывает это как воспроизведение человеческого паттерна: слушать, думать и говорить одновременно.
Приоритеты модели: распознавание разных акцентов, поддержка десятков языков, устойчивость к шумовым условиям. Технических деталей по числу параметров, выбору вокодера, zero-shot возможностям клонирования и составу обучающих датасетов в публикации TechCrunch нет. Без этих данных оценить вычислительные затраты и пригодность модели к on-prem развертыванию невозможно.
Раунд и клиентская база
Серию А возглавила Селигман Вентурес, также участвовали Сиерра Вентурес и 3оне4 Капитал. Текущие клиенты — РингКентрал и Труекаллер, обе компании работают на рынке голосовой телефонии и идентификации звонящего. Камат обозначает целевой сегмент широко: любая клиентская поддержка, включая сервисы вроде Сиерра и Декагон. Продукт позиционируется как B2B-инфраструктура для разговорных агентов, не как потребительский голосовой API. Средства пойдут на расширение технологических возможностей, конкретный roadmap не раскрыт.
Что отслеживать
- Публичные бенчмарки TTFA (time-to-first-audio) и MOS на стандартных речевых датасетах. Без метрик заявление о «неотличимости от человеческой речи» остается маркетинговым.
- Параметры компактной модели: число весов, тип вокодера, требования к GPU для инференса в реальном времени.
- Лицензия и ценовая модель для интеграторов — on-prem против managed API.
- Академические публикации или открытые репозитории с деталями пайплайна.