LIVE
Новость

Muse Voice Transcribe: новая модель Meta для потоковой расшифровки речи

По данным Meta AI Research, Muse Voice Transcribe — первая модель real-time аудиоперцепции от Meta Superintelligence Labs.

Савелий Попов·обновлено 02 сентября 2026 г.

Muse Voice Transcribe: новая модель Meta для потоковой расшифровки речи

Стек задач: потоковый ASR, диаризация на 20+ говорящих, endpointing в реальном времени, мультиязычный вход на 25+ языках с code-switching внутри фразы. По заявлению исследователей, модель занимает первое место в Artificial Analysis по стриминговому speech-to-text и на публичных бенчмарках диаризации, данные на 1 сентября 2026.

Стек и каналы

Демо Muse Voice Transcribe принимает звук с микрофона, обрабатывает аудио локально для вывода транскрипта и не сохраняет его на сервере. В сценарии от Meta в одной комнате одновременно говорят восемь человек — модель трекает реплики в реальном времени и разделяет спикеров. Context biasing срабатывает на ключевых словах из контактов и географии пользователя. Доступ: Meta Model API, клиент Meta AI для Mac, среда Muse Code. Квоты, тарифы и лимиты по минутам в исходном материале не указаны.

Конкурентный фон

Параллельно Inworld открыла общий доступ к Realtime TTS-2 — модель синтеза для разговорных агентов с учётом тона, темпа и эмоционального состояния пользователя. Голосовая идентичность сохраняется в 100+ языках, клонирование — по образцу 5–15 секунд, дизайн голоса — по текстовому описанию. Google, по данным LIGA.net, выпустила Gemini 3.5 Transcribe для преобразования речи в структурированный текст. На периферии — кейс ИИ-помощника «Мехрибон» в Узбекистане, по данным Spot.uz, закрывающего 65% голосовых и 59% текстовых обращений по соцвыплатам. Три релиза за месяц фиксируют смещение индустрии в сторону end-to-end real-time пайплайнов.

Что замерить

Параметры для бенчмарка: latency первого токена при code-switching, WER на длинных сессиях, точность диаризации при 8+ одновременных спикерах, поведение endpointing на перебиваниях и паузах. Замеры делать на собственных записях через демо — данные не сохраняются. Отдельно — энергозатраты оператора при многочасовом мониторинге микшеров в реальном времени. Для оценки личного ресурса при таком режиме полезна оценка состояния своего здоровья по четырём ключевым осям — ось стресса и ментального баланса здесь критична.