Code- und UI-Elemente wurden anschließend sowohl im Web- als auch im mobilen ChatGPT-Client gefunden. Ab Ende Juni 2026 liefen erste limitierte Tests mit einer kleinen Nutzergruppe. Vom 22. bis 24. Juni 2026 tauchten mehrere Nutzerberichte und Demonstrationsvideos auf, die das bidirektionale Modell in der Praxis zeigten.
Wichtig: OpenAI hat das Modell nicht offiziell angekündigt. Der endgültige Name, das genaue Verhalten der Stufen und der Veröffentlichungstermin sind vom Unternehmen noch nicht bestätigt.
Die aktuellen ChatGPT-Sprachmodi – Standard Voice und Advanced Voice Mode – arbeiten in einem turn-basierten Paradigma. Das Modell muss warten, bis der Nutzer ausgesprochen hat, bevor es antworten kann. GPT-Bidi-1s bidirektionale (BiDi) Architektur ermöglicht es dem Modell, zwei Audioströme gleichzeitig zu verarbeiten: den des Nutzers und den eigenen.
Wichtige Verhaltensunterschiede, die in Demonstrationen berichtet wurden:
OpenAIs internes Ziel war es, die Lücke zwischen dem Sprach-Stack von ChatGPT – der hinter den Textmodellen (bereits auf GPT-5.5-Niveau) hinterherhinkte – zu schließen und eine gleichwertige Echtzeit-Gesprächsintelligenz zu liefern.
GPT-Bidi-1 ist das erste OpenAI-Sprachmodell, das drei wählbare Intelligenz- und Geschwindigkeitsstufen für die Sprachausgabe einführt:
| Stufe | Beschreibung |
|---|---|
| High | Maximale logische Tiefe, langsamere Antwort – für komplexe Analyseaufgaben |
| Medium | Ausgewogener Kompromiss zwischen Intelligenz und Geschwindigkeit |
| Instant | Schnellstmögliche Antwort, reduzierte Logik – für beiläufige oder zeitkritische Interaktionen |
Das Stufensystem ermöglicht es Nutzern, die Interaktionstiefe im Vergleich zur Latenz pro Aufgabe anzupassen, ähnlich wie die Textmodelle von ChatGPT verschiedene logische Ebenen bieten. Eine schnelle Wetterabfrage würde beispielsweise die Instant-Stufe nutzen, während eine tiefgehende Brainstorming-Sitzung auf High umschalten würde.
Wenn GPT-Bidi-1 ausgewählt ist, wechselt die Sprachblase bzw. die Wellenformanzeige auf Gelb statt der aktuellen Standardfarbe. Das Modell erscheint im Einstellungen-Modellwähler als neue Option mit der Bezeichnung "Bidi (Latest)" neben dem bestehenden Standard Voice und Advanced Voice Mode, anstatt diese zu ersetzen.
gpt-bidi-1. Wettbewerbskontext: Die bidirektionale Sprachinitiatve ist eine direkte Reaktion auf Fortschritte von Google (Gemini Live mit Unterbrechungen), Anthropic und Echtzeit-Sprachagenten von Start-ups. OpenAI will die Sprachinteraktion auf das Niveau seiner Textintelligenz bringen, die bereits GPT-5.5-Logik antreibt.