O Google anunciou em 23 de setembro de 2026 o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS. Os dois são modelos de síntese de fala — tecnologia que transforma texto em áudio falado —, mas atendem a prioridades diferentes: o Flash TTS foi apresentado para criação de personagens e direção vocal detalhada; o Flash-Lite TTS, para produzir grandes volumes de áudio com foco em custo, como dublagem e agentes de voz.
4
27
Qual é a diferença na prática?
Flash TTS é a opção para quem precisa definir uma voz marcante e orientar sua interpretação. Segundo o Google, é possível descrever em linguagem natural o papel, o sotaque e as características vocais de um personagem, além de indicar como ele deve dizer suas falas.
4
30
Flash-Lite TTS é a opção voltada à escala. O Google cita dublagem em grande volume, criação de conteúdo em áudio e agentes de voz entre seus usos, sem abrir mão de instruções sobre tom, ritmo e expressividade. A diferença entre os modelos, portanto, está no foco de produção — não significa que o Flash-Lite só gere falas sem variação.
27
30
Como funcionam as vozes e os controles?
O Google anunciou uma biblioteca com mais de 2 mil vozes prontas e a possibilidade de criar vozes por meio de descrições. Também apresentou controles para diálogos entre personagens e orientações fala a fala, incluindo tom, sotaque e ritmo.
4
28
29
A empresa fala em criação de vozes em mais de 100 idiomas e dialetos. Listagens de terceiros apontam 130 idiomas para o Flash TTS e 101 para o Flash-Lite TTS. Esses números descrevem a cobertura informada, mas não garantem que todas as vozes ou funções estejam disponíveis em cada idioma.
27
17
18
Criar uma voz nova não é o mesmo que replicar a voz de alguém. A replicação parte de uma gravação de um falante existente. Reportagens sobre o lançamento descrevem uma amostra de referência de aproximadamente 30 segundos e uma verificação de consentimento antes da replicação.
22
23
Que salvaguardas foram anunciadas?
O Google afirma que a replicação de voz inclui verificação de consentimento. A cobertura do lançamento também descreve marcação SynthID nos áudios gerados e credenciais de conteúdo C2PA para vozes replicadas — mecanismos voltados a identificar a origem do material. São salvaguardas, não uma garantia de que todo uso indevido seja impossível.
23
34
O que dizem os testes apresentados?
Nos resultados divulgados no lançamento, o Flash TTS obteve 71,4 pontos e o primeiro lugar no Voice Design Benchmark da Hume AI. Outra reportagem registra 60,8 pontos em uma medida de modelagem de sotaque. O Google também afirmou que Flash TTS e Flash-Lite TTS ocuparam as duas primeiras posições no Overall Quality Index da Hume AI. São resultados reportados, não uma avaliação independente do desempenho em uma aplicação específica.
19
21
Onde os modelos começaram a chegar?
Segundo o Google, os dois modelos começaram a ser disponibilizados em 23 de setembro no Google AI Studio e na API Gemini, caminhos voltados a quem desenvolve aplicações. As notas de lançamento da API listam os modelos TTS e o endpoint Voices como disponíveis em versão geral. Para produtos de uso direto, o Google indicou o Flash TTS no Gemini Notebook e o Flash-Lite TTS no Google Vids; o acesso pelo Gemini Enterprise foi anunciado como futuro. Isso não significa que todos os recursos de voz estivessem presentes em todos esses produtos na estreia.
29
32
Reportagens sobre as primeiras integrações citaram plataformas como Agora, LiveKit, Pipecat e Vercel, além de empresas que exploram usos em dublagem, localização ou agentes de voz, como Figma, HeyGen e Wondercraft. Os exemplos apontam interesse de desenvolvedores, não disponibilidade uniforme de todas as funções em cada integração.
37