Google anunció el 23 de septiembre de 2026 dos modelos que convierten texto en voz: Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS. La diferencia principal está en el trabajo para el que fueron concebidos. Flash TTS pone el acento en crear voces de personajes y dirigir su interpretación; Flash-Lite TTS busca producir grandes cantidades de audio a menor costo, por ejemplo para doblaje o agentes de voz.
4
27
¿Cuál conviene para cada proyecto?
Flash TTS permite describir con lenguaje corriente el papel, el acento y las características vocales de un personaje, y después dar indicaciones sobre cómo debe interpretar un guion. Es la opción que Google presenta para proyectos donde importa especialmente definir una voz propia y ajustar su entrega.
4
30
Flash-Lite TTS está orientado a tareas de gran volumen, como doblaje, contenido de audio y agentes de voz. Eso no significa que solo produzca una lectura plana: Google también destaca controles de tono, ritmo y expresividad para este modelo.
27
30
Voces, idiomas y dirección de escenas
Google anunció un catálogo de más de 2.000 voces listas para usar, además de la posibilidad de diseñar voces mediante instrucciones escritas. Los modelos permiten dirigir conversaciones entre personajes y precisar, línea por línea, aspectos como el tono, el acento y el ritmo.
4
28
29
La compañía habla de creación de voces en más de 100 idiomas y dialectos. Listados de terceros dan cifras más concretas: 130 idiomas para Flash TTS y 101 para Flash-Lite TTS. Esas cifras describen la cobertura reportada, no garantizan que todas las voces y funciones estén disponibles en cada idioma.
27
17
18
Crear una voz nueva no es lo mismo que replicar la de una persona. Según la información publicada sobre el lanzamiento, la réplica parte de una muestra de unos 30 segundos de la voz existente y requiere una comprobación de consentimiento.
22
23
Seguridad y resultados anunciados
Google afirma que la réplica de voces incorpora verificación del consentimiento. La cobertura del lanzamiento también describe marcas de agua SynthID en el audio generado y credenciales de contenido C2PA para las voces replicadas. Son medidas de protección, no una garantía de que se haya eliminado cualquier posible uso indebido.
23
34
En las pruebas difundidas durante el lanzamiento, Flash TTS obtuvo 71,4 puntos y el primer puesto en Voice Design Benchmark de Hume AI; otra crónica recoge 60,8 puntos en una prueba de modelado de acentos. Google también afirmó que Flash TTS y Flash-Lite TTS ocuparon los dos primeros puestos del índice de calidad general de Hume AI. Son resultados reportados, no una evaluación independiente de su desempeño en cada aplicación.
19
21
¿Dónde estarán disponibles?
Google indicó que el despliegue de ambos modelos comenzó el 23 de septiembre en Google AI Studio y la API de Gemini, herramientas dirigidas a desarrolladores. Las notas de la API catalogan los modelos TTS y un punto de acceso Voices como disponibles de forma general. Para sus productos de uso final, Google señaló Flash TTS en Gemini Notebook y Flash-Lite TTS en Google Vids; el acceso mediante Gemini Enterprise quedó anunciado para más adelante. La presencia de un modelo en un producto no implica que todas sus funciones de voz estuvieran disponibles allí desde el primer día.
29
32
Entre las primeras integraciones mencionadas figuran Agora, LiveKit, Pipecat y Vercel. También se citaron empresas que exploran usos en doblaje, localización o agentes de voz, como Figma, HeyGen y Wondercraft. Son ejemplos de interés e integración temprana, no una confirmación de disponibilidad uniforme en todas esas plataformas.
37