Google præsenterede Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS den 23. september 2026. Begge omdanner tekst til tale, men de er tænkt til forskellige opgaver: Flash TTS prioriterer særprægede stemmer og detaljeret instruktion, mens Flash-Lite TTS er den billigere model til store mængder lyd, eksempelvis dubbing og stemmeassistenter. TTS står for »text-to-speech«, altså tekst-til-tale.
4
27
Hvilken model skal man vælge?
Flash TTS er det oplagte valg, hvis en stemme skal fungere som en bestemt karakter. Ifølge Google kan man beskrive stemmens rolle, accent og klang med almindeligt sprog og derefter instruere, hvordan replikker i en scene skal leveres.
4
30
Flash-Lite TTS er målrettet produktion i stor skala, blandt andet dubbing, andet lydindhold og stemmeassistenter. Den er ikke begrænset til monoton oplæsning: Google fremhæver også styring af tone, tempo og udtryk. Forskellen handler først og fremmest om, hvad modellerne er optimeret til.
27
30
Stemmer, sprog og stemmekopiering
Google oplyser, at der er mere end 2.000 stemmer at vælge imellem. Man kan også designe en ny stemme med en tekstbeskrivelse og instruere en dialog replik for replik, eksempelvis med angivelser af tonefald, accent og tempo.
4
28
29
Google beskriver stemmedesign på mere end 100 sprog og dialekter. Tredjepartsoversigter angiver mere præcist 130 sprog for Flash TTS og 101 for Flash-Lite TTS. Tallene er rapporteret sprogdækning – ikke en garanti for, at alle stemmer og funktioner virker på hvert enkelt sprog.
27
17
18
At kopiere en stemme er noget andet end at skabe en ny karakterstemme. Her tager modellen udgangspunkt i en eksisterende persons stemme. Omtale af lanceringen beskriver en referenceoptagelse på cirka 30 sekunder og kontrol af stemmeejerens samtykke.
22
23
Hvilke sikkerhedsforanstaltninger er der?
Google siger, at stemmekopiering kræver verificeret samtykke. Ifølge omtale af lanceringen får genereret lyd desuden et SynthID-vandmærke, mens kopierede stemmer forsynes med C2PA-oplysninger om indholdets oprindelse. Det er sikkerhedsforanstaltninger, ikke en garanti mod enhver form for misbrug.
23
34
For læsere i Danmark er en begrænsning værd at bemærke: Omtale af lanceringen angiver, at stemmekopiering i Google AI Studio ikke er tilgængelig i EØS, som Danmark er en del af. Det bør ikke forveksles med adgang til de øvrige tekst-til-tale-funktioner.
19
34
Hvad viser testresultaterne?
I resultater offentliggjort ved lanceringen fik Flash TTS 71,4 point og førstepladsen i Hume AI’s Voice Design Benchmark. En anden lanceringomtale angiver 60,8 point i en test af accentmodellering. Google oplyste desuden, at Flash TTS og Flash-Lite TTS tog de to øverste pladser i Hume AI’s Overall Quality Index. Det er rapporterede testresultater – ikke en uafhængig vurdering af, hvordan modellerne vil klare en konkret opgave.
19
21
Hvor kan modellerne bruges?
Google meddelte, at begge modeller begyndte at blive rullet ud i Google AI Studio og Gemini API den 23. september. I API’ets udgivelsesnoter står både de nye TTS-modeller og et Voices-endpoint som generelt tilgængelige. Til forbrugere pegede Google på Flash TTS i Gemini Notebook og Flash-Lite TTS i Google Vids. Adgang via Gemini Enterprise blev beskrevet som på vej. Det betyder ikke, at alle stemmefunktioner var tilgængelige i alle produkter fra første dag.
29
32
Tidlig omtale nævner også integrationer med blandt andre Agora, LiveKit, Pipecat og Vercel samt virksomheder som Figma, HeyGen og Wondercraft, der arbejder med eller undersøger anvendelser inden for dubbing, lokalisering og stemmeassistenter. Eksemplerne er ikke et løfte om, at alle integrationer og funktioner allerede er tilgængelige.
37