GPT Live 1 está disponible en la API de OpenAI desde el 10 de septiembre de 2026 por 0,05 dólares por minuto para la capa frontal de voz. Su enfoque full duplex le permite escuchar mientras habla, para gestionar interrupciones, silencios y confirmaciones breves con mayor naturalidad.
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GPT-Live-1 es el modelo de voz de OpenAI orientado a desarrolladores que busca hacer que un agente conversacional se parezca menos a una sucesión de mensajes grabados y más a una charla en directo. Está disponible en la API desde el 10 de septiembre de 2026 y cuesta 0,05 dólares por minuto para la capa frontal de voz. El modelo de razonamiento, las herramientas y la infraestructura que se conecten detrás se cobran aparte. 3
5
Muchos agentes de voz funcionan como una cadena: primero, un sistema de voz a texto transcribe lo que dice la persona; después, un modelo de lenguaje produce una respuesta escrita; por último, un sistema de texto a voz la convierte en audio. El método puede funcionar, pero cada relevo añade coordinación: hay que decidir cuándo alguien terminó de hablar, qué hacer ante una pausa, un cambio de idea o una interrupción. 3
GPT-Live-1 se presenta como un único modelo de voz que razona sobre el audio entrante y saliente. Su diseño full duplex le permite seguir escuchando mientras genera voz. La intención es que pueda reaccionar cuando el usuario interrumpe o dice un breve «sí» sin interpretar automáticamente cada sonido, silencio o conversación cercana como un turno nuevo que exija respuesta. 3
La diferencia, por tanto, no consiste solo en generar audio más rápido. Se trata de controlar mejor el ritmo de la conversación: distinguir si una persona está pensando, si está cortando al agente o si una confirmación breve es solo una señal de que sigue escuchando. OpenAI describe GPT-Live-1 como su modelo principal para conversaciones de voz naturales y expresivas, con manejo fluido de interrupciones. 2
3
GPT-Live-1 no obliga a que el modelo de voz resuelva toda la lógica de negocio. Puede mantener la interacción oral en tiempo real y delegar el razonamiento complejo, las llamadas a herramientas o las acciones en un modelo de backend y un marco de agentes elegidos por el desarrollador. 3
Esta separación permite plantear una arquitectura práctica:
En otras palabras, GPT-Live-1 lleva el hilo de la conversación de voz, mientras que el backend aporta razonamiento, datos del negocio y capacidad de acción. La contrapartida es importante para calcular el presupuesto: el precio anunciado para la voz no representa el coste total del agente. La inferencia del backend, las herramientas, la telefonía y otros servicios pueden elevarlo. 3
5
OpenAI indica que los desarrolladores pueden orientar el tono, la velocidad y el estilo conversacional mediante el mensaje de sistema. GPT-Live-1 también ofrece transcripciones y texto de respuesta, entiende combinaciones alfanuméricas, permite sesgar el reconocimiento hacia palabras clave e incluye detección de turnos para productos que todavía necesiten límites explícitos entre intervenciones. 3
El modelo está pensado para sesiones largas y agentes telefónicos, incluidos los flujos de atención al cliente y reservas. Según OpenAI, puede gestionar silencios y ruido de fondo sin verbalizar cada paso interno, un comportamiento relevante para llamadas reales y otros entornos poco controlados. 3
La documentación aportada no establece una lista definitiva de idiomas compatibles ni controles detallados para acentos o dialectos concretos. Antes de convertir esos puntos en requisitos de despliegue, conviene verificarlos en la documentación vigente de la API.
OpenAI informa de una mejora de 30 puntos porcentuales de GPT-Live-1 frente a GPT-Realtime-2.1 en Full Duplex Bench, una evaluación centrada en el comportamiento interactivo de voz: turnos de palabra, pausas, interrupciones, confirmaciones breves y habla de fondo. 3
Al combinar GPT-Live-1 con GPT-6 Astra, con esfuerzo de razonamiento medio, OpenAI también afirma que la configuración ocupó el primer puesto en Tau3, una prueba integral para agentes de voz. Su componente de atención al cliente incluye tareas habladas en los sectores de aerolíneas, comercio minorista y telecomunicaciones. 3
Algunas publicaciones secundarias ofrecen cifras exactas sobre la latencia de toma de turno y las puntuaciones de Tau3. Sin embargo, el material de fuente primaria disponible aquí no aporta esos valores precisos. La conclusión más prudente es que OpenAI comunica mejoras relevantes en comportamiento interactivo y un primer puesto en Tau3 para la combinación GPT-Live-1 y Astra; no que cualquier implementación vaya a reproducir una cifra concreta. 3
7
OpenAI destaca varios despliegues iniciales de agentes de voz:
Estos ejemplos ilustran dónde puede aportar más valor el modo full duplex: en conversaciones donde la persona duda, se corrige, confirma algo a mitad de frase o interrumpe al agente sin querer reiniciar toda la interacción.
GPT-Live-1 cuesta 0,05 dólares por minuto para la capa frontal de voz. Los desarrolladores pueden combinarlo con el modelo de backend y el marco de agentes que prefieran, pero esas decisiones afectan al coste operativo total porque se facturan por separado. 3
5
OpenAI también menciona OpenAI Presence como otra forma de crear flujos de trabajo de voz sobre GPT-Live-1 para interacción oral en tiempo real. El material aportado no define la elegibilidad empresarial, las condiciones comerciales, el modelo de alojamiento ni el proceso de acceso de Presence, por lo que no deberían darse por supuestos a partir del anuncio de la API. 3
Para los equipos que evalúen el modelo, la pregunta clave va más allá de la tarifa por minuto: cuánto valor aporta una conversación con turnos más fluidos al caso de uso y qué combinación de backend y herramientas ofrece la fiabilidad necesaria con un coste total aceptable.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
GPT Live 1 está disponible en la API de OpenAI desde el 10 de septiembre de 2026 por 0,05 dólares por minuto para la capa frontal de voz.
GPT Live 1 está disponible en la API de OpenAI desde el 10 de septiembre de 2026 por 0,05 dólares por minuto para la capa frontal de voz. Su enfoque full duplex le permite escuchar mientras habla, para gestionar interrupciones, silencios y confirmaciones breves con mayor naturalidad.
OpenAI afirma una mejora de 30 puntos porcentuales frente a GPT Realtime 2.1 en Full Duplex Bench y el primer puesto en Tau3 al combinarlo con GPT 6 Astra.