←

Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS с дизайном голоса по промпту

Google DeepMind

аудио офиц. + СМИ 3 ист. ~1 мин

Google выпустила две модели text-to-speech: Gemini 3.8 Flash TTS и Flash-Lite TTS, доступные в Gemini API и AI Studio. Поддерживают кастомный дизайн голоса по текстовому описанию, клонирование голоса примерно с 30 секунд аудио, диалоги с несколькими говорящими, 2000+ голосов и 100+ языков.

Почему это важно

Лидирующая в бенчмарках генерация речи со встроенным клонированием голоса в мейнстримном frontier-API.

Важность: 3/5

Заметный аудио-релиз frontier-лаборатории, official+media

Источники