Die API Ankündigung datiert vom 10. September 2026, nicht vom 11. GPT‑Live‑1 ist ein allgemein verfügbares Full‑Duplex Sprachmodell, das Zuhören und Sprechen gleichzeitig verarbeitet.
Veröffentlicht vonBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT Live 1 full duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11.. Topic tags: general web, openai, chatgpt, prompt engineering, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidenc
OpenAI hat GPT‑Live‑1 am 10. September 2026 – also nicht am 11. September – für seine API angekündigt. Das allgemein verfügbare Modell soll Sprachassistenten natürlicher wirken lassen, weil es als Full‑Duplex-Sprachschicht parallel zuhören und sprechen kann, statt Gespräche strikt in einzelne Frage-und-Antwort-Runden aufzuteilen. 3
Klassische Voice-Agent-Systeme bestehen meist aus mehreren aufeinanderfolgenden Bausteinen: Zuerst wird Sprache in Text umgewandelt (Speech-to-Text), dann verarbeitet ein Sprach- oder Reasoning-Modell den Text, anschließend wird die Antwort per Text-to-Speech wieder ausgegeben. Jede dieser Übergaben kann Verzögerungen verursachen und dabei Timing, Gesprächskontext oder den natürlichen Redefluss beeinträchtigen. 3
GPT‑Live‑1 bündelt Zuhören und Sprechen dagegen in einem Sprachmodell. Dadurch kann das System unmittelbar auf Einwürfe, Bestätigungen und Unterbrechungen reagieren, während ein angebundenes Backend parallel komplexeres Schlussfolgern oder Tool-Aufrufe übernimmt. 3
Entwickler können für dieses Backend ein OpenAI-Modell wie GPT‑6 Astra oder ein Modell eines Drittanbieters wählen. Damit lassen sich Rechenaufwand, Antwortgeschwindigkeit und Kosten je nach Anwendungsfall abstimmen. 3
OpenAI nennt unter anderem Steuerungsmöglichkeiten über den System-Prompt, etwa für Tonfall, Sprechtempo und Gesprächsstil. Außerdem hebt das Unternehmen Einsatzmöglichkeiten in der Telefonie, den Umgang mit Hintergrundgeräuschen und Stille, stabilere längere Sitzungen, Transkripte beziehungsweise Antworttexte, die Erkennung alphanumerischer Angaben sowie Keyword-Biasing hervor. 3
Eine GPT‑Live‑1-Sprachsitzung kostet 0,05 US-Dollar pro Minute. Die Abrechnung erfolgt sekundengenau, ohne auf volle Minuten aufzurunden. 2
Wichtig für die Kalkulation: Die Gebühr deckt nur die Sprachschicht ab. Nutzung des gewählten Backend-Modells und eingesetzter Tools wird separat berechnet. 2
OpenAI berichtet von einer Verbesserung um 30 Prozentpunkte im eigenen Full Duplex Bench gegenüber GPT‑Realtime‑2.1. In der Kombination mit GPT‑6 Astra bei mittlerem Reasoning-Aufwand habe GPT‑Live‑1 bei Tau3 den ersten Platz erreicht. 3
Für einzelne, in Umlauf befindliche Detailwerte zu Latenz und Tau3-Erfolgsraten liefern die vorliegenden Quellen jedoch keinen unabhängigen Nachweis.
Als frühe Anwender nennt OpenAI Yelp, Speak und ein nicht näher benanntes Gesundheitsunternehmen. Yelp berichtet demnach von besserem Sprecherwechsel und höherer Genauigkeit bei Yelp Host und Hatch, etwa bei Reservierungs- und Essensbestellungen. Speak zufolge ließ das Modell Sprachlernenden mehr Zeit zum Nachdenken, bevor der Tutor reagierte, und reduzierte Unterbrechungen im Vergleich zu früheren turnbasierten Systemen um fast 80 Prozent. Ein Mitgründer und CTO eines Gesundheitsunternehmens erklärte, der Wechsel von einer kaskadierten Architektur habe die Codebasis um 80 Prozent vereinfacht und 23.000 Zeilen Code entfernt. 3
Die zentrale Änderung ist damit weniger eine weitere Sprachausgabe-Komponente als eine andere Gesprächsarchitektur: Der Agent soll nicht erst warten, bis ein Redebeitrag vollständig abgeschlossen ist, sondern sich eher wie ein gleichzeitiger Gesprächspartner verhalten.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Die API Ankündigung datiert vom 10. September 2026, nicht vom 11.
Die API Ankündigung datiert vom 10. September 2026, nicht vom 11. GPT‑Live‑1 ist ein allgemein verfügbares Full‑Duplex Sprachmodell, das Zuhören und Sprechen gleichzeitig verarbeitet.
Es ersetzt die klassische Kette aus Speech to Text, Sprachmodell und Text to Speech durch eine integrierte Sprachschicht.