Gemini 3.8 Live está orientado a conversaciones de voz de gran escala, baja latencia y eficiencia de costes; Extended Thinking se reserva para tareas complejas de varios pasos. La principal novedad de Extended Thinking es que puede seguir generando audio mientras planifica, razona y espera resultados de herramientas...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google ha presentado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos nativos de audio a audio para agentes de voz y diálogo en tiempo real. El primero está orientado a escalar con costes contenidos, diálogo fluido y comprensión visual; la variante Extended Thinking apunta a tareas más difíciles, de varios pasos, que se benefician del razonamiento en segundo plano. 10
2
La función distintiva pertenece a Gemini 3.8 Live Extended Thinking. Según Google, el modelo puede razonar en segundo plano, planificar y llamar a herramientas asíncronas mientras sigue transmitiendo una respuesta de audio. Cuando una herramienta tarda más en devolver un resultado, puede usar expresiones conversacionales naturales para mantener activa la interacción, en vez de dejar toda la conversación en espera. 1
2
Por tanto, el supuesto «razonamiento simultáneo» no se limita a responder más rápido. En el diseño de Google, la generación de voz, la planificación de fondo y el uso de herramientas asíncronas pueden ejecutarse en paralelo. Un agente de voz podría continuar explicando el siguiente paso mientras consulta datos o resuelve un proceso de varias etapas. Que eso se traduzca en una mejor experiencia dependerá de la fiabilidad de las herramientas, del diseño del diálogo y de que lo que el agente diga aporte valor, en lugar de limitarse a llenar silencios. 1
2
Google posiciona el modelo estándar, Gemini 3.8 Live, para experiencias conversacionales de alto volumen y menor latencia, sin las demoras inducidas por el razonamiento. Combina diálogo en directo con comprensión visual, de modo que un agente puede utilizar contexto visual junto con la conversación. 10
45
Representantes de Google también han indicado que el modelo admite 97 idiomas y puede alternar entre lenguas durante una conversación. Los desarrolladores deberán validar la calidad por idioma, la disponibilidad regional y el rendimiento para los acentos y casos de uso concretos antes de desplegarlo. 16
La cobertura del lanzamiento informó de puntuaciones de 76,0 para Gemini 3.8 Live y de 82,6 para Gemini 3.8 Live Extended Thinking en el Speech-to-Speech Quality Index, frente a 81,5 para GPT-Live-1 de OpenAI con esfuerzo medio. 25
En esa comparación publicada, Extended Thinking obtiene la puntuación más alta de los tres. Sin embargo, estas cifras no deben interpretarse como una auditoría independiente de la calidad global en producción. Un agente de voz debe gestionar interrupciones, habla multilingüe y con acentos diversos, precisión en el uso de herramientas, latencia bajo carga, seguridad, observabilidad y coste total por tarea resuelta. Los resultados son una señal de evaluación, no una prueba de que un sistema sea el mejor para todos los asistentes o centros de atención. 25
La tabla oficial de precios de Google agrupa los dos nuevos modelos dentro de Live API. En el nivel estándar de pago, fija el audio de entrada en US$ 3,00 por millón de tokens, o US$ 0,005 por minuto, y el audio de salida en US$ 12,00 por millón de tokens, o US$ 0,018 por minuto. El texto de entrada cuesta US$ 0,75 por millón de tokens y el texto de salida —incluidos los tokens de razonamiento—, US$ 4,50 por millón. 37
La distinción es importante: las tarifas de tokens citadas para Gemini 3.8 Flash no son automáticamente las de los modelos Live. Para presupuestar un producto, conviene usar la tabla vigente de Live API y la documentación del modelo, además de probar sesiones reales. El coste de un agente de voz depende de la combinación de audio de entrada y salida, contexto visual, texto y herramientas asociadas. 37
Google DeepMind marca ambos modelos como de disponibilidad general. La tabla publicada incluye la aplicación Gemini, Google AI Studio, Gemini API y Google Enterprise Agent Platform para ambos. También indica Google Search Live para Extended Thinking y Google Workspace para Gemini 3.8 Live. 54
Para los desarrolladores, esto plantea una elección dentro de la misma familia de modelos nativos de audio a audio: un modelo estándar para diálogo en directo y otro con mayor capacidad de razonamiento. Para las empresas, la disponibilidad del modelo es solo una parte de la decisión: deben comprobar qué producto, controles de datos, región geográfica y vía de integración corresponden a su despliegue. 54
La propuesta competitiva central es una pila de tiempo real más integrada: interacción hablada, comprensión visual, razonamiento en segundo plano y herramientas asíncronas dentro de una misma familia de modelos. En teoría, esto puede reducir el trabajo de ensamblar por separado reconocimiento de voz, un modelo de texto, orquestación de herramientas y síntesis de voz; además, puede preservar la continuidad de la conversación mientras se ejecuta una tarea. 1
10
GPT-Live-1 de OpenAI sigue siendo un referente relevante, especialmente para equipos que evalúan comportamiento conversacional full-duplex. Pero la comparación de benchmark disponible es demasiado limitada para decidir una plataforma. Una evaluación sólida debe usar llamadas representativas y medir el manejo de interrupciones, la corrección de las llamadas a herramientas, el rendimiento multilingüe, los controles de seguridad, la recuperación ante fallos, la latencia y el coste por resultado completado. 25
El material de lanzamiento disponible no establece una política concreta sobre marcas de agua de audio SynthID para Gemini 3.8 Live o Extended Thinking. Google afirma que SynthID se ha ampliado para marcar e identificar texto generado por la app y la experiencia web de Gemini, pero eso no confirma que cada flujo de audio de estos modelos lleve una marca de agua ni especifica sus condiciones de detección o despliegue. 59
La misma cautela se aplica a las afirmaciones sobre el ecosistema: las integraciones y el soporte de socios pueden cambiar con rapidez. Antes de comprometerse con una arquitectura de producción, los equipos deberían verificar la documentación vigente, los precios, la disponibilidad de la plataforma y las condiciones de servicio aplicables. 37
54
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Gemini 3.8 Live está orientado a conversaciones de voz de gran escala, baja latencia y eficiencia de costes; Extended Thinking se reserva para tareas complejas de varios pasos.
Gemini 3.8 Live está orientado a conversaciones de voz de gran escala, baja latencia y eficiencia de costes; Extended Thinking se reserva para tareas complejas de varios pasos. La principal novedad de Extended Thinking es que puede seguir generando audio mientras planifica, razona y espera resultados de herramientas asíncronas.