Microsoft представила MAI-Transcribe-2: доступная транскрибация на 60 языках
Microsoft AI выпустила модель распознавания речи MAI-Transcribe-2. По данным VentureBeat, ранняя цена релиза — 10 центов за час аудио, что на 72% ниже тарифа MAI-Transcribe первого поколения ($0.36/час, апрель 2026).
Савелий Попов·обновлено 04 сентября 2026 г.

При объёме 100 000 часов в год счёт за транскрибацию падает с $36 000 до $10 000. Microsoft ставит модель как более быструю, точную и дешёвую альтернативу тому, что продают OpenAI, Google и ElevenLabs. Релиз продолжает курс на замещение OpenAI-зависимости собственными моделями по модальностям: транскрибация — вертикаль, где переход идёт быстрее всего, и MAI-Transcribe-2 — наиболее явное тому подтверждение.
Спецификация релиза
Поддержка 60 языков против 43 у MAI-Transcribe-1.5 (июнь) и 25 у апрельского оригинала. Модель развёрнута в маркетплейсе Microsoft Foundry и в тестовой среде MAI Playground. В базовый пакет включены: диаризация спикеров, word-level timestamps, keyword biasing и автоматическая идентификация языка. Keyword biasing принимает внешний список терминов — названия препаратов, продуктовые коды, имена сотрудников — и подмешивает их в декодер. Автоопределение языка снимает требование заранее объявлять код.
Два модуля выделены отдельно. Конфигурируемый режим вывода: «verbatim» сохраняет заминки, false starts и stutters для комплаенса и юридических команд, «clean» режет филлеры для читаемых субтитров и заметок. Code switching обрабатывает переключение языка внутри одной фразы; явно заявлены Hinglish и Spanglish — индийский и U.S. Hispanic рынки, где один звонок может сменить язык десяток раз. У нишевых вендоров каждая из этих возможностей традиционно тарифицировалась отдельно. Здесь весь пакет включён в 10 центов.
Бенчмарк и прод-нагрузка
Производитель заявляет первое место на FLEURS по 60 языкам при среднем WER 5.2%. FLEURS — открытый бенчмарк Google 2022 года, по ~12 часов речи на каждый из 102 языков, собранных с носителей. Метрика покрывает чистые условия студийной записи и не отражает поведения модели на шумных колл-центровских каналах с перекрёстными помехами и DTMF-тонами — именно этот сценарий Microsoft называет целевым. Разрыв между студийным FLEURS и реальным прод-аудио нужно учитывать отдельно. Само позиционирование («для грязного аудио, а не чистых студийных условий») сигнализирует, что помимо FLEURS у вендора есть собственный корпус — конкретные числа по нему не публикуются.
Что замерить до продакшена
Три параметра. WER на собственных записях с реальным шумом и акцентами — корпус FLEURS этого не покрывает. Латентность диаризации на потоке длиннее 5 минут: пайплайн накапливает ошибку сегментации нелинейно, реальное время отклика на длинных потоках может отличаться от заявленного. Поведение keyword biasing при code switching: поданный список может конфликтовать с автоопределением языка в момент переключения. Цена 10 центов заявлена как early-bird, публичного roadmap по её сохранению после промо-периода нет — это ключевой риск для интегратора, считающего юнит-экономику на горизонте 12+ месяцев.