Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS с дизайном голоса по промпту
Google DeepMind
Google выпустила две модели text-to-speech: Gemini 3.8 Flash TTS и Flash-Lite TTS, доступные в Gemini API и AI Studio. Поддерживают кастомный дизайн голоса по текстовому описанию, клонирование голоса примерно с 30 секунд аудио, диалоги с несколькими говорящими, 2000+ голосов и 100+ языков.
Почему это важно
Лидирующая в бенчмарках генерация речи со встроенным клонированием голоса в мейнстримном frontier-API.
Важность: 3/5
Заметный аудио-релиз frontier-лаборатории, official+media