Новые модели Gemini 3.8 Live: как голосовой ИИ научился озвучивать ход своих рассуждений
По данным Google, 15 сентября компания открыла доступ к двум голосовым моделям реального времени — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking.
Яков Новиков·обновлено 16 сентября 2026 г.

Обе доступны через Gemini API, Workspace и приложение Gemini в тот же день, поддерживают 97 языков с переключением «на лету» и принимают визуальный ввод. Ключевой edge-case голосовых UX — молчание модели при сложном запросе — в Extended Thinking закрыт через vocalized reasoning: ход рассуждения озвучивается, что меняет восприятие latency и метрики удержания в длинных диалогах.
Где раньше ломался флоу
У классических голосовых ассистентов есть типовой узкий сценарий: пользователь задаёт нетривиальный запрос, модель уходит в обработку, наступает тишина — и пауза интерпретируется как зависание. В Extended Thinking проблему решают через vocalized reasoning: модель озвучивает ход рассуждения короткими разговорными мостиками, пока обработка идёт в фоне, а голосовые апдейты приходят по ходу работы. На пользовательском пути это меняет восприятие задержки — человек слышит прогресс, а не молчание. В одном из демо модель распознаёт эскиз на доске и в связке с голосовой командой генерирует React-компонент — visual + voice пайплайн дорос до прикладных задач.
Позиция по бенчмаркам и стеку
На Speech to Speech Quality Index от Artificial Analysis модель Extended Thinking набрала 82.6 — первое место, впереди GPT-Live-1-Astra и Grok Voice Think Fast 2.0. На Speech Agent Arena, где оценка проходит вслепую живыми ассессорами, Gemini 3.8 Live заняла вторую строчку; первая — у предыдущей модели Google, Gemini 3.1 Flash Live Minimal. Итог для рынка: обе верхние позиции в обоих рейтингах — продукты одного вендора, что сужает выбор стека до сравнения моделей внутри линейки и меняет переговорную позицию при закупке.
Инфраструктура, безопасность и что проверить
Базовая Gemini 3.8 Live оптимизирована по стоимости для крупных приложений: околонулевая задержка на визуальном вводе, автоопределение языка из 97. Extended Thinking целится в многошаговые задачи со звуковым отчётом о ходе работы. Для Realtime-медиапотоков Google заключила партнёрства с Agora, LiveKit и Vercel — стриминг подключается через Gemini Live API, доступ открыт через API и Google AI Studio в день релиза. По безопасности: всё генерируемое аудио получает водяной знак SynthID, опубликован model card с мерами противодействия дипфейкам — повод сразу заложить чтение водяного знака в пайплайн модерации пользовательского контента. Перед интеграцией стоит прогнать три сценария: удержание диалога при нескольких сложных запросах подряд, мультиязычный флоу с переключением «на лету» (не теряется ли intent) и фоновое исполнение задач без разрыва разговорного потока. Метрики для сравнения с текущим стеком — task completion rate и средний latency до первого содержательного ответа.
Параллельно для отслеживания новостей по другим вертикалям — например, трансферных сводок Чемпионшипа — работают профильные ресурсы по каждой нише.