Google kondigde op 23 september 2026 Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS aan. Beide zetten tekst om in gesproken audio, maar hebben een andere nadruk: Flash TTS is bedoeld voor het ontwerpen en regisseren van stemmen, terwijl Flash-Lite TTS is gericht op kostenefficiënte productie op grote schaal. TTS staat voor text-to-speech, oftewel spraaksynthese.
4
27
Welk model kies je?
Flash TTS is de creatieve keuze. Volgens Google kun je een nieuwe stem beschrijven aan de hand van bijvoorbeeld een rol, accent en stemkenmerken. Ook kun je aanwijzingen geven voor de voordracht van een scène. Dat maakt het model vooral interessant wanneer een herkenbaar personage en de manier waarop zinnen worden uitgesproken belangrijk zijn.
4
30
Flash-Lite TTS is bedoeld voor grotere hoeveelheden audio, zoals nasynchronisatie, audiocontent en spraakgestuurde assistenten. ‘Lite’ betekent hier niet dat de voordracht vlak moet zijn: Google noemt ook voor dit model controle over toon en spreektempo. Het belangrijkste verschil is het beoogde gebruik.
27
30
Stemmen ontwerpen, kiezen of nabootsen
Google noemt meer dan 2.000 kant-en-klare stemmen. Daarnaast kunnen gebruikers met een tekstbeschrijving een stem ontwerpen en dialogen regel voor regel sturen, met aanwijzingen voor onder meer toon, accent en tempo.
4
28
29
Volgens Google is stemontwerp mogelijk in meer dan 100 talen en dialecten. Externe modeloverzichten noemen specifiek 130 talen voor Flash TTS en 101 voor Flash-Lite TTS. Die aantallen zijn gerapporteerde taaldekking, geen garantie dat iedere stem en functie in elke taal beschikbaar is.
27
17
18
Een nieuwe personagestem ontwerpen is iets anders dan een bestaande stem nabootsen. Volgens berichtgeving over de lancering gebruikt die laatste functie een referentieopname van ongeveer 30 seconden en is een toestemmingscontrole vereist.
22
23 Volgens berichtgeving was stemreplicatie bij de start niet beschikbaar in de Europese Economische Ruimte (EER). Dat betreft deze specifieke functie, niet de beschikbaarheid van beide spraakmodellen als geheel.
18
19
34
Welke waarborgen noemt Google?
Google zegt toestemming voor stemreplicatie te verifiëren. Berichtgeving over de introductie beschrijft daarnaast een SynthID-watermerk in gegenereerde audio en C2PA-herkomstgegevens voor nagebootste stemmen. Dat zijn waarborgen; ze betekenen niet dat misbruik onmogelijk is.
23
34
Wat zeggen de testscores?
Volgens bij de lancering gemelde resultaten behaalde Flash TTS 71,4 punten en de eerste plaats op Hume AI’s Voice Design Benchmark. Een ander bericht noemt 60,8 punten voor een test van accentmodellering. Google stelde bovendien dat Flash TTS en Flash-Lite TTS de eerste twee plaatsen bezetten op Hume AI’s Overall Quality Index. Dit zijn gerapporteerde benchmarkresultaten, geen onafhankelijke beoordeling van prestaties in een specifieke toepassing.
19
21
Waar zijn de modellen beschikbaar?
Volgens Google begon de uitrol van beide modellen op 23 september in Google AI Studio en via de Gemini API, waarmee ontwikkelaars de modellen in toepassingen kunnen gebruiken. De release notes van de API vermelden de TTS-modellen en een Voices-endpoint als algemeen beschikbaar. Voor gebruikers noemde Google Flash TTS in Gemini Notebook en Flash-Lite TTS in Google Vids. Toegang via Gemini Enterprise werd aangekondigd als ‘binnenkort’. Dat een model in een product verschijnt, betekent niet automatisch dat elke stemfunctie daar meteen beschikbaar is.
29
32
Vroege berichtgeving noemt onder meer Agora, LiveKit, Pipecat en Vercel als integratieplatforms, en Figma, HeyGen en Wondercraft als bedrijven die toepassingen voor nasynchronisatie, lokalisatie of spraakgestuurde assistenten verkennen. Dat wijst op belangstelling van ontwikkelaars, niet op gelijke beschikbaarheid bij al die partijen.
37