Gemini 3.5 Transcribe es el nuevo modelo de voz a texto de Google y el sucesor de Chirp 3: mediciones citadas por la compañía apuntan a una reducción del 70 % en el tiempo hasta la transcripción final, con una tasa de... El sistema transforma el habla improvisada en texto utilizable: elimina muletillas, integra auto...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google ha presentado Gemini 3.5 Transcribe como un modelo de voz a texto pensado para hacer algo más que copiar el audio palabra por palabra. Su objetivo es convertir una forma de hablar informal, con interrupciones y frases a medio corregir, en un texto pulido y estructurado. Por eso encaja especialmente bien con el dictado, las notas, los mensajes y la edición mediante comandos de voz. Google lo describe como su modelo de voz a texto más preciso hasta la fecha y como un avance importante frente a Chirp 3. 1 12
La diferencia es útil, pero conviene entenderla: un sistema que elimina los «eh», reorganiza una frase y deduce qué quería decir la persona puede producir una redacción mejor, aunque conserve menos de sus palabras exactas.
Gemini 3.5 Transcribe se basa en lo que Google denomina transcripción inteligente. En lugar de conservar como texto final cada pausa, muletilla o frase abandonada, el modelo puede limpiar las disfluencias, incorporar una corrección del hablante, añadir puntuación y aplicar formato. También puede responder a instrucciones de edición por voz y convertir un discurso desordenado en una prosa más fácil de leer. 1 8 12
En la práctica, esto está pensado para situaciones cotidianas. El usuario puede dictar ideas sueltas o hablar de forma conversacional y recibir algo más cercano a un mensaje terminado, un documento o la respuesta para un formulario.
Google afirma que el modelo también está preparado para trabajar con ruido de fondo, terminología técnica y vocabulario especializado. Los desarrolladores pueden proporcionar un vocabulario personalizado para que nombres propios, productos y términos de un sector concreto aparezcan con la grafía deseada. Además, detecta automáticamente más de 85 idiomas. 1 7
En audio pregrabado, Google indica que ofrece marcas de tiempo y separación de hablantes —la llamada diarización— para hasta tres personas. Esto permite asociar cada fragmento de la transcripción con quien lo pronunció. 1
Google presenta Gemini 3.5 Transcribe como una mejora considerable respecto a Chirp 3, su modelo anterior de transcripción. Datos citados por Artificial Analysis sitúan la tasa de error de palabras en el 2,6 % para audio sin streaming y en el 4,0 % para audio transmitido en tiempo real. Las mismas mediciones señalan una reducción del 70 % en el tiempo necesario para obtener la transcripción final. 3 4 9
Estas cifras no deben interpretarse como una garantía universal. La tasa de error depende del idioma, el acento, la calidad de la grabación, el ruido ambiental y el conjunto de evaluación. En sus propios materiales, Google destaca resultados del estándar FLEURS, incluido un 5,50 % de error en modo streaming, una cifra que no se puede comparar directamente con todas las mediciones de terceros porque las condiciones de prueba son distintas. 1
La conclusión práctica es más clara que cualquier cifra aislada: Google busca reducir la latencia en las interacciones en directo y, al mismo tiempo, entregar un resultado final más limpio en grabaciones y dictados.
Google plantea formas distintas de utilizar el modelo según el tipo de aplicación.
La opción en directo está pensada para aplicaciones que reciben un flujo continuo de audio y necesitan responder con rapidez. La Live API de Google permite interacciones de voz bidireccionales con baja latencia y puede proporcionar transcripciones tanto de lo que dice el usuario como de la respuesta del modelo. 12 20
Este enfoque puede servir para asistentes de voz, subtítulos en directo, interfaces conversacionales y aplicaciones que necesitan mostrar el texto mientras la persona todavía está hablando. La documentación de la API también distingue entre interacciones unitarias, en streaming y en tiempo real para las aplicaciones de Gemini. 24
Para una grabación existente, los desarrolladores pueden cargar o referenciar un archivo de audio y enviarlo mediante el flujo de interacción de la API de Gemini. Esta vía resulta más adecuada cuando importan las marcas de tiempo, el formato, el vocabulario personalizado o la identificación de hablantes, y no tanto una respuesta en fracciones de segundo. 1 12 18
La documentación general de Gemini recomienda la Interactions API como interfaz estándar para las nuevas aplicaciones, mientras que la Live API está orientada a experiencias continuas de voz y visión con baja latencia. 19 20
Gemini 3.5 Transcribe no se limita a una demostración para desarrolladores. Según varios informes, ya impulsa Rambler, la función de dictado por voz de Gboard en Android, y la aplicación Gemini para macOS. 2 13 26
Google también afirma que el reconocimiento de voz llegará próximamente a Chrome. La función permitirá dictar directamente en campos de texto de la web —por ejemplo, mensajes, publicaciones, formularios o instrucciones para Gemini— sin depender de una aplicación específica. 1 8 13
El modelo se ha presentado junto a Gemini 3.5 Live y Gemini 3.5 Live Experimental dentro de la nueva agrupación de productos de audio de Google, Gemini Audio. En ese conjunto, Transcribe se centra en convertir voz en texto, mientras que los modelos Live están diseñados para experiencias de audio interactivas. 12 26
La principal virtud de Gemini 3.5 Transcribe es también su mayor límite. Eliminar muletillas e integrar autocorrecciones hace que el resultado sea más cómodo de leer, pero modifica la relación entre el audio original y el texto obtenido.
Una versión pulida puede omitir una pausa significativa, conservar únicamente la versión corregida de una afirmación o suavizar la manera particular de hablar de alguien. Eso suele ser deseable al dictar un mensaje o preparar unas notas. Es mucho menos conveniente cuando importa cada palabra.
En entrevistas, documentos legales o médicos, trabajos de investigación, registros de accesibilidad o citas textuales, conviene conservar el audio original y revisar los fragmentos importantes. Si la implementación no ofrece un modo claramente literal, Gemini 3.5 Transcribe debe entenderse como un sistema de transcripción inteligente que reescribe y organiza el contenido, no como una grabadora neutral que simplemente pasa el audio a texto.
El lanzamiento acerca el reconocimiento de voz a una forma de escritura asistida. Gemini 3.5 Transcribe combina transcripción, limpieza, formato, detección de idiomas, vocabulario configurable e información sobre los hablantes, con flujos separados para audio en directo y grabado. 1 12
Para los desarrolladores, esto puede reducir el procesamiento posterior necesario después de reconocer la voz. Para los usuarios, el dictado podría sentirse menos como hablarle con cuidado a una máquina y más como entregarle un borrador a un editor.
La pregunta decisiva ya no es si el modelo puede generar un texto más limpio, sino qué necesita cada aplicación: ¿un texto listo para usar o un registro exacto de lo que se dijo?
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Gemini 3.5 Transcribe es el nuevo modelo de voz a texto de Google y el sucesor de Chirp 3: mediciones citadas por la compañía apuntan a una reducción del 70 % en el tiempo hasta la transcripción final, con una tasa de...
Gemini 3.5 Transcribe es el nuevo modelo de voz a texto de Google y el sucesor de Chirp 3: mediciones citadas por la compañía apuntan a una reducción del 70 % en el tiempo hasta la transcripción final, con una tasa de... El sistema transforma el habla improvisada en texto utilizable: elimina muletillas, integra autocorrecciones, aplica formato, admite vocabulario personalizado y detecta automáticamente más de 85 idiomas.
Los desarrolladores pueden elegir entre flujos para audio en tiempo real y grabaciones; la tecnología ya se utiliza en la función Rambler de dictado de Gboard y en la aplicación Gemini para macOS, mientras que Google...