Google kunngjorde Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS 23. september 2026. Begge gjør tekst om til tale, men er laget for ulike behov: Flash TTS gir rom for detaljert utforming av stemmer og fremføring, mens Flash-Lite TTS er rettet mot kostnadseffektiv produksjon av mye lyd, som dubbing og stemmeassistenter. TTS står for text-to-speech, eller tekst-til-tale.
4
27
Hvilken modell passer til hva?
Flash TTS er det kreative valget. Ifølge Google kan du beskrive en ny stemme med vanlige ord – for eksempel hvilken rolle den skal ha, aksent og stemmekarakter – og gi instruksjoner om hvordan replikker i en scene skal fremføres. Den er dermed mest aktuell når en særegen stemme og presis regi er viktig.
4
30
Flash-Lite TTS er laget for større produksjonsvolum til lavere kostnad. Google trekker frem dubbing, annet lydinnhold og uttrykksfulle stemmeassistenter. «Lite» betyr ikke at talen må være monoton: Modellen skal fortsatt kunne styres med hensyn til blant annet tonefall og tempo.
27
30
Ferdige stemmer, språk og regi
Google oppgir over 2 000 ferdige stemmer. Brukere kan også lage nye stemmer fra tekstbeskrivelser og styre samtaler mellom flere stemmer, med instruksjoner for hvordan hver replikk skal lyde.
4
28
29
Google beskriver stemmedesign på over 100 språk og dialekter. Tredjepartsoversikter oppgir mer presist 130 språk for Flash TTS og 101 for Flash-Lite TTS. Tallene sier likevel ikke at alle stemmer og funksjoner virker på samtlige språk.
27
17
18
Å lage en ny karakterstemme er noe annet enn å replikere stemmen til en eksisterende person. Ifølge omtale av lanseringen kan sistnevnte gjøres med et lydopptak på omtrent 30 sekunder, men først etter en samtykkekontroll.
22
23
Hva med sikkerheten?
Google sier at stemmereplikering krever verifisert samtykke. Lanseringsomtaler beskriver også SynthID, et digitalt vannmerke i generert lyd, og C2PA-opprinnelsesinformasjon for replikerte stemmer. Dette er sikkerhetstiltak, ikke en garanti mot all misbruk.
23
34
For lesere i Norge er en viktig begrensning at stemmereplikering ifølge lanseringsomtale ikke er tilgjengelig i EØS. Det er en avgrensning for denne funksjonen, ikke en påstand om at de to modellene som helhet er utilgjengelige der.
18
19
Resultater i tester – og hvor modellene finnes
I resultater omtalt ved lanseringen fikk Flash TTS 71,4 poeng og førsteplass i Hume AIs Voice Design Benchmark. En annen omtale oppgir 60,8 poeng i en måling av aksentmodellering. Google sier dessuten at Flash TTS og Flash-Lite TTS tok de to øverste plassene på Hume AIs Overall Quality Index. Dette er rapporterte testresultater, ikke en uavhengig vurdering av hvordan modellene vil fungere i et konkret prosjekt.
19
21
Google sa at utrullingen av begge modellene startet i Google AI Studio og Gemini API 23. september. I API-ets versjonsnotater er modellene og et eget Voices-endepunkt oppført som generelt tilgjengelige. For brukerprodukter nevnte Google Flash TTS i Gemini Notebook og Flash-Lite TTS i Google Vids. Tilgang via Gemini Enterprise ble beskrevet som noe som kommer senere. Det betyr ikke nødvendigvis at alle stemmefunksjonene var tilgjengelige i hvert produkt ved lansering.
29
32
Tidlig omtale av integrasjoner nevner blant annet utviklerplattformene Agora, LiveKit, Pipecat og Vercel, samt selskaper som Figma, HeyGen og Wondercraft i forbindelse med dubbing, lokalisering og stemmeassistenter. Eksemplene viser interesse for teknologien, men ikke at alle integrasjoner eller funksjoner allerede er tilgjengelige overalt.
37