Se bisogna dare una voce riconoscibile a un personaggio, Gemini 3.8 Flash TTS è il modello su cui Google mette l’accento. Se invece l’obiettivo è produrre molto audio contenendo i costi — per esempio per doppiaggio o agenti vocali — la proposta è Gemini 3.8 Flash-Lite TTS. Entrambi generano parlato a partire da testo e sono stati annunciati il 23 settembre 2026.
4
27
La differenza tra Flash e Flash-Lite
Con Flash TTS si può descrivere in linguaggio naturale una voce da creare: ruolo del personaggio, accento e caratteristiche vocali. Google lo presenta anche come uno strumento per dirigere la recitazione di dialoghi e scene, quando conta il modo in cui viene pronunciata ogni battuta.
4
30
Flash-Lite TTS è pensato per produzioni su larga scala e più attente ai costi, tra cui doppiaggio, contenuti audio e agenti vocali. Non significa però rinunciare all’espressività: Google indica controlli anche su tono e ritmo. La distinzione riguarda soprattutto l’uso a cui i due modelli sono destinati.
27
30
Voci, lingue e replica: cosa è stato annunciato
Google parla di oltre 2.000 voci pronte all’uso, oltre alla possibilità di crearne di nuove tramite istruzioni testuali. Le indicazioni possono riguardare una conversazione tra personaggi o la resa di singole battute, specificando tono, accento e ritmo.
4
28
29
Per la creazione delle voci, Google cita più di 100 lingue e dialetti. Schede di terze parti riportano numeri più precisi — 130 lingue per Flash TTS e 101 per Flash-Lite TTS — che non vanno interpretati come garanzia che ogni voce e funzione sia disponibile in ciascuna lingua.
27
17
18
Creare una voce nuova non è lo stesso che replicarne una esistente. Per la replica, i resoconti sul lancio descrivono un campione audio di circa 30 secondi e una verifica del consenso del titolare della voce.
22
23 Per chi si trova in Italia, conta anche un limite geografico: secondo i resoconti sul lancio, la replica vocale non è disponibile nello Spazio economico europeo.
19
34
Tutele e risultati dichiarati
Google afferma che la replica vocale prevede una verifica del consenso. Le cronache del lancio descrivono inoltre la filigrana digitale SynthID nell’audio generato e credenziali C2PA per le voci replicate. Sono misure di tutela, non la prova che ogni possibile abuso sia escluso.
23
34
Nei risultati comunicati al lancio, Flash TTS ha ottenuto 71,4 punti e il primo posto nel Voice Design Benchmark di Hume AI; un altro resoconto riporta 60,8 punti in una misura relativa alla modellazione degli accenti. Google ha anche dichiarato che Flash TTS e Flash-Lite TTS occupano i primi due posti nell’Overall Quality Index di Hume AI. Sono risultati riportati, non una valutazione indipendente delle prestazioni in ogni applicazione.
19
21
Dove si possono usare
Dal 23 settembre, Google ha avviato la distribuzione di entrambi i modelli in Google AI Studio e tramite Gemini API, gli strumenti rivolti agli sviluppatori. Le note di rilascio dell’API indicano come generalmente disponibili i modelli TTS e un endpoint Voices, cioè una funzione dell’API dedicata alle voci. Per i prodotti destinati agli utenti, Google ha indicato Flash TTS in Gemini Notebook e Flash-Lite TTS in Google Vids; l’arrivo di entrambi in Gemini Enterprise è stato annunciato come prossimo. Questo non implica che tutte le funzioni vocali fossero già presenti in ogni prodotto al lancio.
29
32
I primi resoconti sulle integrazioni citano piattaforme come Agora, LiveKit, Pipecat e Vercel, oltre ad aziende tra cui Figma, HeyGen e Wondercraft per impieghi legati a doppiaggio, localizzazione e agenti vocali. Sono esempi di interesse e adozione iniziale, non una conferma di disponibilità uniforme in tutte le integrazioni.
37