Google launches Gemini 3.8 Flash TTS with voice design, cloning, and 100+ language support
Google DeepMind released Gemini 3.8 Flash and Flash-Lite text-to-speech models on Sept 23, featuring studio-grade audio with emotional range, voice cloning from 30-second samples, 2,000+ prebuilt voices, and multilingual support. Ranks #1 on Hume AI Voice Design benchmark.
TLDR
Voice and audio are critical for agents, creators, podcasts, gaming, and accessibility. Google's shift from static presets to dynamic creative-studio tools with precise control and no drift in long-form audio addresses a key gap in multimodal AI. Strong benchmark performance and multilingual capabilities position Google competitively against rivals, while the emphasis on custom voice design and consent-based cloning (with SynthID) reflects growing attention to responsible voice synthesis.
