Ambos reemplazan el anterior Modo de Voz Avanzado de ChatGPT. Están construidos sobre una auténtica arquitectura full-duplex que procesa continuamente el audio entrante mientras genera respuestas habladas, a diferencia del antiguo enfoque half-duplex, donde el modelo debía terminar de hablar antes de poder escuchar al usuario HAT.
OpenAI señaló que los costos de inferencia han bajado lo suficiente como para que la economía del voz funcione, razón por la cual el modelo también está disponible para usuarios gratuitos A. En su lanzamiento, GPT-Live utiliza GPT-5.5 en segundo plano para el razonamiento OH.
La capacidad full-duplex cambia la sensación de la IA de voz de tres maneras específicas, que OpenAI demostró durante su presentación de lanzamiento.
El modelo puede ser interrumpido a mitad de una frase y se detendrá a escuchar, en lugar de seguir hablando por encima del usuario. También detecta cuándo un usuario hace una pausa a mitad de un pensamiento y espera, en lugar de interrumpir AT. El director de producto de OpenAI, Atty Eleti, dijo durante la presentación: "Este es un modelo full-duplex" T.
El modelo también puede mostrar que está prestando atención con frases como "mhmm" o "sí" mientras el usuario sigue hablando, y permanecerá en silencio cuando necesites un momento para pensar OB.
Cuando GPT-Live se encuentra con una pregunta difícil, delega el razonamiento a los modelos de texto más recientes de OpenAI (como GPT-5.5) en paralelo, mientras GPT-Live mismo continúa la conversación con el usuario AT. El investigador principal Kundan Kumar explicó: "Cuando GPT-Live tiene que pensar mucho para responder una pregunta, puede delegar su razonamiento y tareas complejas a GPT-5.5 en paralelo, mientras GPT-Live sigue conversando con el usuario" LT. Esto significa que los usuarios no esperan a que el modelo de voz razone tareas pesadas: la transición de la investigación a los hallazgos hablados es casi instantánea T.
GPT-Live puede complementar las discusiones con imágenes en pantalla: imágenes, diagramas u otro contenido generado por IA, creando una experiencia multimodal que va más allá del chat de voz puro HAT. The Verge informó que el modelo complementará las conversaciones sobre el clima, las acciones y los deportes con imágenes generadas por IA T.
En conjunto, estas características hacen que las conversaciones se sientan más cercanas al diálogo humano natural. Business Insider lo describió como un asistente que "quiere que le hables por encima" B. The Verge tituló que es "mejor para callarse" T.
Las dos personas clave mencionadas en las ruedas de prensa y los informes de los medios son:
Informes anteriores de enero de 2026 también mencionaron al líder de infraestructura Ben Newhouse y a la gerente de producto Jackie Shannon como involucrados en la reestructuración de la IA de audio IX.
gpt-realtime-2.1 y gpt-realtime-2.1-mini) con una latencia p95 un 25 % menor gracias a un mejor almacenamiento en caché C.Una limitación señalada en el lanzamiento: GPT-Live actualmente no admite voz con capacidades de video T.
OpenAI lanzó GPT-Live en medio de una semana excepcionalmente ajetreada en toda la industria de la IA.
El ecosistema más amplio de OpenAI:
Competidores y noticias relacionadas: