GPT-Live es una nueva familia de modelos de voz construida sobre una arquitectura full-duplex: puede escuchar y hablar al mismo tiempo, en lugar de alternar en modo "push-to-talk" por turnos . Se lanzaron dos versiones el 8 de julio de 2026:
Este sistema reemplaza por completo al anterior Advanced Voice Mode . Los cambios arquitectónicos clave son:
El Advanced Voice Mode anterior (lanzado a mediados de 2024) era un sistema basado en turnos que alternaba entre escuchar y hablar. Fue completamente reemplazado por GPT-Live el 8 de julio de 2026 . La antigua función de voz de escritorio en macOS se había retirado incluso antes, el 15 de enero de 2026, como parte de un plan más amplio para optimizar y mejorar las capacidades de voz antes del lanzamiento de GPT-Live
.
ChatGPT Voice en el escritorio permite a los usuarios controlar toda la aplicación unificada por voz a través de tres modos —Chat, Work y Codex—, todos accesibles desde un único shell de escritorio .
Los usuarios pueden dar comandos de voz para dirigir múltiples agentes que se ejecutan en Work o Codex simultáneamente; por ejemplo: "Revisa mi calendario, redacta un correo electrónico y prepara un resumen de la reunión" .
En la aplicación de escritorio para Mac, ChatGPT Voice se integra con Appshots, una función lanzada originalmente para Codex en mayo de 2026 que permite a la IA capturar la ventana frontal de la aplicación activa, incluyendo su captura de pantalla y el texto accesible, para usarlo como contexto .
ChatGPT Voice en el escritorio aprovecha Computer Use (la capacidad de OpenAI para controlar el sistema operativo), los archivos locales y los plugins para ejecutar solicitudes habladas . El sistema puede:
El lanzamiento de ChatGPT Voice en el escritorio se asienta sobre una importante consolidación de productos que ocurrió dos semanas antes, el 9 de julio de 2026: