Google presenterade Gemini 3.8 Flash TTS och Gemini 3.8 Flash-Lite TTS den 23 september 2026. Båda omvandlar text till tal, men de är tänkta för olika arbetsflöden: Flash TTS för den som vill utforma en karaktärsröst och regissera framförandet i detalj, Flash-Lite TTS för kostnadseffektiv produktion av stora mängder ljud, exempelvis dubbning och röstassistenter. TTS står för text-to-speech, eller text-till-tal.
4
27
Vilken modell passar jobbet?
Med Flash TTS kan användaren beskriva en ny röst med vanliga ord – till exempel dess roll, accent och röstkaraktär – och ange hur repliker i en scen ska framföras. Det är modellen Google lyfter fram när en särskild röst och noggrann kreativ styrning är viktigast.
4
30
Flash-Lite TTS är i stället inriktad på stora volymer, bland annat dubbning, ljudinnehåll och uttrycksfulla röstassistenter. Den beskrivs inte som en modell för enbart neutralt uppläst tal: Google säger att även här går det att styra tonfall och tempo.
27
30
Över 2 000 röster – och möjlighet att skapa egna
Google uppger att användare kan välja bland över 2 000 färdiga röster eller skapa röster med textinstruktioner. Det ska också gå att styra dialog mellan talare och ange tonfall, accent och tempo för enskilda repliker.
4
28
29
Enligt Google omfattar röstskapandet över 100 språk och dialekter. Externa modellförteckningar anger mer specifikt 130 språk för Flash TTS och 101 för Flash-Lite TTS. De siffrorna ska inte läsas som ett löfte om att varje röst och funktion fungerar på varje språk.
27
17
18
Att återskapa en befintlig persons röst är något annat än att designa en ny röst. Enligt lanseringsrapporteringen används ett referensklipp på omkring 30 sekunder, och samtycke kontrolleras innan rösten kan återskapas.
22
23
Skyddsåtgärder och resultat i tester
Google uppger att röståterskapning kräver verifierat samtycke. Enligt rapporteringen märks genererat ljud med SynthID, medan återskapade röster också får C2PA-uppgifter om innehållets ursprung. Det är skyddsåtgärder, inte en garanti mot allt missbruk.
23
34
För svenska läsare finns en viktig begränsning: enligt lanseringsrapporteringen är röståterskapning via Google AI Studio inte tillgänglig i EES, där Sverige ingår. Det gäller inte nödvändigtvis alla andra röstfunktioner.
19
34
I resultat som presenterades vid lanseringen fick Flash TTS 71,4 poäng och förstaplatsen i Hume AI:s Voice Design Benchmark. En annan rapport anger 60,8 poäng i ett mått på accentmodellering. Google uppgav också att Flash TTS och Flash-Lite TTS tog de två främsta platserna i Hume AI:s Overall Quality Index. Det är rapporterade testresultat, inte ett oberoende besked om hur modellerna fungerar i varje praktisk tillämpning.
19
21
Var finns modellerna?
Google meddelade att båda modellerna började rullas ut i Google AI Studio och Gemini API den 23 september. I API:ets versionsanteckningar listas TTS-modellerna och ett Voices-gränssnitt som allmänt tillgängliga. För användarprodukter pekade Google ut Flash TTS i Gemini Notebook och Flash-Lite TTS i Google Vids. Tillgång via Gemini Enterprise beskrevs som kommande. Att en modell finns i en produkt betyder inte att samtliga röstfunktioner fanns där vid lanseringen.
29
32
Tidiga rapporter nämnde integrationer via bland andra Agora, LiveKit, Pipecat och Vercel, samt företag som Figma, HeyGen och Wondercraft i samband med dubbning, lokalisering och röstassistenter. Exemplen visar intresse för tekniken, inte att varje integration eller funktion var färdig för alla användare.
37