Google a annoncé le 23 septembre 2026 deux modèles qui transforment du texte en parole : Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS. Leur différence tient surtout à l’usage visé. Le premier met l’accent sur les voix de personnages et la direction créative ; le second sur une production audio moins coûteuse et à grand volume.
4
27
Flash ou Flash-Lite : comment choisir ?
Flash TTS convient aux projets où l’identité d’une voix et la manière de jouer un texte comptent particulièrement. Google indique qu’une voix peut être créée à partir d’une description de son rôle, de son accent et de ses caractéristiques vocales, puis dirigée pour une scène.
4
30
Flash-Lite TTS est destiné notamment au doublage en volume, aux contenus audio et aux agents vocaux. « Lite » ne signifie pas une voix sans nuances : Google mentionne aussi des réglages du ton et du rythme.
27
30
Voix, langues et réplication
Google annonce plus de 2 000 voix prêtes à l’emploi, ainsi que la création de voix à partir d’instructions rédigées en langage courant. Les utilisateurs peuvent guider un dialogue et préciser, réplique par réplique, le ton, l’accent ou le rythme souhaités.
4
28
29
Google évoque plus de 100 langues et dialectes. Des fiches publiées par un tiers avancent des chiffres plus précis — 130 langues pour Flash TTS et 101 pour Flash-Lite TTS — sans que cela garantisse que chaque voix ou fonction soit disponible dans chacune d’elles.
27
17
18
Créer une voix fictive n’est pas la même chose que reproduire celle d’une personne réelle. Selon les comptes rendus du lancement, cette réplication s’appuie sur un extrait de référence d’environ 30 secondes et nécessite une vérification du consentement.
22
23
Quels garde-fous ?
Google indique vérifier le consentement pour la réplication vocale. Des comptes rendus décrivent également l’intégration d’un filigrane SynthID dans les fichiers audio générés et de métadonnées de provenance C2PA pour les voix répliquées. Ces mesures ne signifient pas que tout risque d’usage abusif est écarté.
23
34
Point important pour les lecteurs européens : des comptes rendus du lancement indiquent que la réplication vocale via Google AI Studio n’est pas disponible dans l’Espace économique européen (EEE). Cette restriction ne doit pas être confondue avec la disponibilité générale des deux modèles.
19
34
Résultats annoncés et déploiement
D’après les résultats rapportés au lancement, Flash TTS a obtenu 71,4 points et la première place au Voice Design Benchmark de Hume AI ; un autre compte rendu mentionne 60,8 points à une mesure de modélisation des accents. Google affirme que Flash TTS et Flash-Lite TTS occupent les deux premières places de l’Overall Quality Index de Hume AI. Ces résultats ne préjugent pas de leur performance dans un projet donné.
19
21
Le déploiement des deux modèles a commencé le 23 septembre dans Google AI Studio et l’API Gemini. Les notes de version de l’API indiquent que les modèles TTS et un point d’accès Voices sont disponibles de manière générale. Côté produits, Google a annoncé Flash TTS dans Gemini Notebook et Flash-Lite TTS dans Google Vids ; l’accès via Gemini Enterprise était présenté comme prochainement disponible. Cela ne veut pas dire que toutes les fonctions vocales étaient proposées dans chaque produit dès le lancement.
29
32
Des articles sur les premières intégrations citent Agora, LiveKit, Pipecat et Vercel, ainsi que Figma, HeyGen et Wondercraft parmi les entreprises explorant des usages tels que le doublage, la localisation ou les agents vocaux. Ces exemples ne garantissent pas une disponibilité identique sur toutes les plateformes.
37