El anuncio de la API se publicó el 10 de septiembre de 2026, no el día 11. [3] GPT‑Live‑1 es un modelo de voz en dúplex completo que escucha y habla simultáneamente.
Publicado porImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT Live 1 full duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11.. Topic tags: general web, openai, chatgpt, prompt engineering, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidenc
OpenAI anunció el 10 de septiembre de 2026 —y no el día 11— el lanzamiento general de GPT‑Live‑1 en su API. Se trata de una capa de voz en dúplex completo, diseñada para que los agentes conversacionales puedan escuchar y hablar a la vez, con una interacción menos rígida y más parecida a una conversación humana. 3
La arquitectura habitual de un agente de voz encadena tres etapas: voz a texto, un modelo de lenguaje o razonamiento y, finalmente, texto a voz. Cada relevo entre componentes puede añadir latencia y hacer que se pierdan señales de ritmo, contexto o timing conversacional. 3
GPT‑Live‑1 reúne las funciones de escucha y habla en un único modelo de voz. Esto le permite responder a señales breves del usuario, gestionar interrupciones en el momento y mantener el intercambio mientras un sistema de backend se ocupa, en paralelo, del razonamiento más complejo o del uso de herramientas. 3
Los desarrolladores pueden conectar ese backend a un modelo de OpenAI, como GPT‑6 Astra, o a un modelo de terceros. Así pueden ajustar el equilibrio entre capacidad de razonamiento, velocidad y coste según el caso de uso. 3
OpenAI destacó controles mediante instrucciones de sistema para definir el tono, el ritmo y el estilo de la conversación. También señaló capacidades orientadas al despliegue de agentes de voz, entre ellas telefonía, gestión de ruido de fondo y silencios, fiabilidad en sesiones largas, transcripciones y texto de respuesta, reconocimiento alfanumérico y sesgo por palabras clave. 3
Las sesiones de voz de GPT‑Live‑1 tienen un precio de 0,05 dólares por minuto. La facturación se realiza por segundo, sin redondear cada llamada al minuto completo. 2
Ese importe corresponde a la capa de voz. El uso del modelo de backend y de las herramientas se cobra por separado, por lo que el coste total dependerá del modelo elegido y de las acciones ejecutadas durante la sesión. 2
La evidencia disponible no respalda los supuestos detalles de acceso empresarial gestionado bajo el nombre «Presence», ni una afirmación específica sobre una ampliación de acentos, dialectos e idiomas.
Según OpenAI, GPT‑Live‑1 logró una mejora de 30 puntos porcentuales en Full Duplex Bench frente a GPT‑Realtime‑2.1. La compañía también indicó que GPT‑Live‑1, combinado con GPT‑6 Astra con esfuerzo de razonamiento medio, ocupó el primer puesto en Tau3. 3
No obstante, las fuentes proporcionadas no muestran de manera independiente las cifras concretas de latencia ni tasas de aprobación que se han atribuido a esas pruebas; esos números específicos deben considerarse no verificados con la evidencia disponible.
Entre los primeros usuarios mencionados por OpenAI, Yelp afirmó que la integración del modelo en Yelp Host y Hatch mejoró la toma de turnos y la precisión frente a su arquitectura de voz anterior. En llamadas para reservas y pedidos de comida, reportó mejoras relevantes en la gestión de llamadas y conversaciones más naturales. 3
Speak, una plataforma de aprendizaje de idiomas, señaló que el modelo permite a los estudiantes disponer de más tiempo para pensar antes de que responda el tutor, reduciendo las interrupciones en casi un 80 % respecto a sistemas previos basados en turnos. 3
Además, el cofundador y director de tecnología de una empresa de salud citado por OpenAI sostuvo que sustituir una implementación en cascada simplificó su base de código en un 80 % y eliminó 23.000 líneas de código, facilitando conversaciones de pacientes más naturales y en tiempo real. 3
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
El anuncio de la API se publicó el 10 de septiembre de 2026, no el día 11. [3]
El anuncio de la API se publicó el 10 de septiembre de 2026, no el día 11. [3] GPT‑Live‑1 es un modelo de voz en dúplex completo que escucha y habla simultáneamente.
Sustituye la cadena tradicional de transcripción, modelo de lenguaje y síntesis de voz por una capa de voz unificada.