Google представила речевые модели Gemini 3.8 Live и 3.8 Live Extended Thinking

Google DeepMind

модели/LLM офиц. + СМИ 2 ист. ~1 мин

Google представила Gemini 3.8 Live и 3.8 Live Extended Thinking — свои самые продвинутые модели живого диалога: околореальное время реакции на визуальный контекст, фоновое выполнение инструментов и автоматическое переключение языка между 97 языками. Extended Thinking рассуждает и говорит одновременно, заполняя паузы словами, возглавляет Speech-to-Speech Quality Index с результатом 82,6 и набирает 97,7% на Big Bench Audio. Модели становятся доступны в Gemini API, AI Studio, Workspace, Search Live и приложении Gemini; весь сгенерированный звук несёт водяной знак SynthID.

Почему это важно

Речевой режим «речь-в-речь» с одновременным рассуждением переводит голосовых агентов от компромиссов со скриптами и задержками к единой модели, способной думать вслух, — прямая конкуренция со стеком Realtime API от OpenAI.

Важность: 4/5

Релиз фронтирной realtime-речевой модели, первое место в индексе качества S2S (крупный релиз DeepMind)

Источники