GPT-Live est une nouvelle famille de modèles vocaux basée sur une architecture duplex intégral — il peut écouter et parler simultanément, plutôt qu'en alternant dans un mode « push-to-talk » . Deux versions ont été publiées le 8 juillet 2026 :
Ce système remplace entièrement l'ancien mode vocal avancé . Les principaux changements architecturaux sont :
L'ancien mode vocal avancé (lancé mi-2024) était un système séquentiel qui alternait entre l'écoute et la parole. Il a été entièrement remplacé par GPT-Live le 8 juillet 2026 . L'ancienne fonction vocale de bureau macOS avait été retirée encore plus tôt — le 15 janvier 2026 — dans le cadre d'un plan plus large visant à rationaliser et à améliorer les capacités vocales avant le déploiement de GPT-Live
.
ChatGPT Voice sur le bureau permet aux utilisateurs de contrôler l'ensemble de l'application unifiée par la voix à travers trois modes — Chat, Work et Codex — tous accessibles depuis une seule interface de bureau .
Les utilisateurs peuvent donner des commandes vocales pour diriger plusieurs agents fonctionnant dans Work ou Codex simultanément, par exemple : « Vérifie mon agenda, rédige un email et prépare un résumé de réunion » .
Sur l'application de bureau Mac, ChatGPT Voice s'intègre à Appshots, une fonctionnalité publiée initialement pour Codex en mai 2026 qui permet à l'IA de capturer la fenêtre d'application active — y compris sa capture d'écran et son texte accessible — pour obtenir du contexte .
ChatGPT Voice sur le bureau exploite Computer Use (la capacité d'OpenAI à contrôler le système d'exploitation), les fichiers locaux et les plugins pour exécuter des requêtes vocales . Le système peut :
Le lancement de ChatGPT Voice sur le bureau s'appuie sur une consolidation majeure des produits qui a eu lieu deux semaines plus tôt, le 9 juillet 2026 :