Google julkisti 23.9.2026 kaksi tekstistä puhetta tuottavaa mallia: Gemini 3.8 Flash TTS:n ja Gemini 3.8 Flash-Lite TTS:n. Valinnan ydin on käyttötarkoitus. Flash TTS on suunnattu tilanteisiin, joissa äänen persoonallisuus ja esitystapa halutaan määritellä tarkasti. Flash-Lite TTS on tarkoitettu kustannustehokkaaseen, suurten määrien tuotantoon, kuten dubbaukseen ja puhuviin tekoälyavustajiin.
4
27
Mitä äänillä voi tehdä?
Flash TTS:lle voi kuvailla tekstillä esimerkiksi hahmon roolin, aksentin ja äänen ominaisuudet. Puheen esitystä voi ohjata kohtaus- ja repliikkikohtaisesti. Myös Flash-Lite TTS:ssä voi Googlen mukaan säätää muun muassa sävyä ja puhenopeutta: kevyempi malli ei siis tarkoita pelkkää tasapaksua ääneenlukua.
4
28
30
Google ilmoittaa tarjolla olevan yli 2 000 valmista ääntä ja mahdollisuuden luoda uusia ääniä tekstikehotteilla. Mallit tukevat myös vuoropuhelun ohjaamista repliikki kerrallaan. Googlen mukaan ääniä voi luoda yli 100 kielellä ja murteella. Ulkopuolisissa mallilistauksissa Flash TTS:n kattavuudeksi ilmoitetaan 130 ja Flash-Lite TTS:n 101 kieltä. Luvut eivät kuitenkaan takaa, että jokainen ääni tai toiminto toimisi kaikilla kielillä.
29
28
27
17
18
Uuden hahmoäänen suunnittelu ja olemassa olevan ihmisen äänen jäljentäminen ovat eri asioita. Julkaisua käsittelevien raporttien mukaan jäljentämiseen käytetään noin 30 sekunnin ääninäytettä ja puhujan suostumus tarkistetaan. Raporttien mukaan äänen jäljentäminen ei ollut Google AI Studiossa saatavilla Euroopan talousalueella julkaisun aikaan.
22
23
19
Miten väärinkäyttöä pyritään estämään?
Google kertoo tarkistavansa suostumuksen ennen äänen jäljentämistä. Julkaisuraporttien mukaan tuotettuun ääneen lisätään huomaamaton SynthID-vesileima, ja jäljennetyille äänille liitetään C2PA-alkuperätiedot. Nämä ovat suojatoimia, eivät tae siitä, ettei teknologiaa voisi käyttää väärin.
23
34
Googlen ilmoittamissa testituloksissa Flash TTS sai 71,4 pistettä ja sijoittui ensimmäiseksi Hume AI:n Voice Design Benchmark -vertailussa. Toisessa raportissa aksenttien mallintamisen tulokseksi kerrotaan 60,8 pistettä. Googlen mukaan Flash TTS ja Flash-Lite TTS veivät myös kaksi kärkisijaa Hume AI:n Overall Quality Index -vertailussa. Kyse on julkaisun yhteydessä raportoiduista vertailutuloksista, ei arviosta siitä, miten mallit toimivat kussakin käyttökohteessa.
19
21
Mistä mallit saa käyttöön?
Googlen mukaan molempien mallien käyttöönotto alkoi Google AI Studiossa ja Gemini API:ssa 23.9.2026. API:n julkaisutiedoissa mallit ja Voices-rajapinta on merkitty yleisesti saataville. Kuluttajatuotteista Google nimesi Flash TTS:n Gemini Notebookiin ja Flash-Lite TTS:n Google Vidsiin. Gemini Enterprise -käyttöoikeuden se ilmoitti tulevan myöhemmin. Tämä ei tarkoita, että kaikki ääniominaisuudet olisivat olleet heti käytettävissä jokaisessa tuotteessa.
29
32
Varhaisissa integraatioita käsittelevissä uutisissa mainittiin muun muassa Agora, LiveKit, Pipecat ja Vercel sekä dubbaukseen, lokalisointiin tai puhuviin tekoälyavustajiin liittyviä käyttötapoja selvittävät Figma, HeyGen ja Wondercraft. Maininnat eivät osoita, että ominaisuudet olisivat samalla tavoin saatavilla kaikissa näissä palveluissa.
37