GPT-Live ist eine neue Familie von Sprachmodellen, die auf einer Full-Duplex-Architektur basiert – sie kann gleichzeitig zuhören und sprechen, anstatt in einem abwechselnden „Push-to-Talk“-Stil zu arbeiten . Zwei Versionen wurden am 8. Juli 2026 veröffentlicht:
Dieses System ersetzt den bisherigen Advanced Voice Mode vollständig . Die wichtigsten architektonischen Änderungen sind:
Der bisherige Advanced Voice Mode (eingeführt Mitte 2024) war ein wechselseitiges System, das zwischen Hören und Sprechen abwechselte. Er wurde am 8. Juli 2026 vollständig durch GPT-Live ersetzt . Die alte Desktop-Sprachfunktion für macOS war sogar noch früher – am 15. Januar 2026 – eingestellt worden, als Teil eines umfassenderen Plans zur Straffung und Verbesserung der Sprachfunktionen im Vorfeld des GPT-Live-Rollouts
.
ChatGPT Voice auf dem Desktop ermöglicht es den Nutzern, die gesamte vereinheitlichte App per Sprache zu steuern – in den drei Modi Chat, Work und Codex, die alle aus einer einzigen Desktop-Oberfläche zugänglich sind .
Die Nutzer können per Sprachbefehl mehrere Agents in Work oder Codex gleichzeitig steuern, zum Beispiel: „Prüfe meinen Kalender, entwirf eine E-Mail und bereite eine Zusammenfassung für das Meeting vor“ .
In der Mac-Desktop-App ist ChatGPT Voice mit Appshots integriert, einer Funktion, die ursprünglich im Mai 2026 für Codex veröffentlicht wurde. Sie ermöglicht es der KI, das aktuell vorderste App-Fenster – einschließlich seines Screenshots und des zugänglichen Textes – als Kontext zu erfassen .
ChatGPT Voice auf dem Desktop nutzt Computer Use (OpenAIs Fähigkeit, das Betriebssystem zu steuern), lokale Dateien und Plugins, um gesprochene Anfragen auszuführen . Das System kann:
Der Desktop-Launch von ChatGPT Voice baut auf einer großen Produktkonsolidierung auf, die zwei Wochen zuvor, am 9. Juli 2026, stattfand: