LIVE
Новость

Новые модели Gemini 3.8 Live: как голосовой ИИ научился озвучивать ход своих рассуждений

По данным Google, 15 сентября компания открыла доступ к двум голосовым моделям реального времени — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking.

Яков Новиков·обновлено 16 сентября 2026 г.

Новые модели Gemini 3.8 Live: как голосовой ИИ научился озвучивать ход своих рассуждений

Обе доступны через Gemini API, Workspace и приложение Gemini в тот же день, поддерживают 97 языков с переключением «на лету» и принимают визуальный ввод. Ключевой edge-case голосовых UX — молчание модели при сложном запросе — в Extended Thinking закрыт через vocalized reasoning: ход рассуждения озвучивается, что меняет восприятие latency и метрики удержания в длинных диалогах.

Где раньше ломался флоу

У классических голосовых ассистентов есть типовой узкий сценарий: пользователь задаёт нетривиальный запрос, модель уходит в обработку, наступает тишина — и пауза интерпретируется как зависание. В Extended Thinking проблему решают через vocalized reasoning: модель озвучивает ход рассуждения короткими разговорными мостиками, пока обработка идёт в фоне, а голосовые апдейты приходят по ходу работы. На пользовательском пути это меняет восприятие задержки — человек слышит прогресс, а не молчание. В одном из демо модель распознаёт эскиз на доске и в связке с голосовой командой генерирует React-компонент — visual + voice пайплайн дорос до прикладных задач.

Позиция по бенчмаркам и стеку

На Speech to Speech Quality Index от Artificial Analysis модель Extended Thinking набрала 82.6 — первое место, впереди GPT-Live-1-Astra и Grok Voice Think Fast 2.0. На Speech Agent Arena, где оценка проходит вслепую живыми ассессорами, Gemini 3.8 Live заняла вторую строчку; первая — у предыдущей модели Google, Gemini 3.1 Flash Live Minimal. Итог для рынка: обе верхние позиции в обоих рейтингах — продукты одного вендора, что сужает выбор стека до сравнения моделей внутри линейки и меняет переговорную позицию при закупке.

Инфраструктура, безопасность и что проверить

Базовая Gemini 3.8 Live оптимизирована по стоимости для крупных приложений: околонулевая задержка на визуальном вводе, автоопределение языка из 97. Extended Thinking целится в многошаговые задачи со звуковым отчётом о ходе работы. Для Realtime-медиапотоков Google заключила партнёрства с Agora, LiveKit и Vercel — стриминг подключается через Gemini Live API, доступ открыт через API и Google AI Studio в день релиза. По безопасности: всё генерируемое аудио получает водяной знак SynthID, опубликован model card с мерами противодействия дипфейкам — повод сразу заложить чтение водяного знака в пайплайн модерации пользовательского контента. Перед интеграцией стоит прогнать три сценария: удержание диалога при нескольких сложных запросах подряд, мультиязычный флоу с переключением «на лету» (не теряется ли intent) и фоновое исполнение задач без разрыва разговорного потока. Метрики для сравнения с текущим стеком — task completion rate и средний latency до первого содержательного ответа.

Параллельно для отслеживания новостей по другим вертикалям — например, трансферных сводок Чемпионшипа — работают профильные ресурсы по каждой нише.