GPT Live 1 ist seit dem 10. September 2026 über die OpenAI API verfügbar und kostet für die Frontend Sprachschicht 0,05 US Dollar pro Minute.
Veröffentlicht vonBearbeitet mit GPT-5.6 TerraBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GPT-Live-1 ist OpenAIs Sprachmodell für Entwickler, die natürlichere Telefon- und Sprachdialoge in ihre Anwendungen einbauen wollen. Es ist seit dem 10. September 2026 über die API verfügbar. Die reine Frontend-Sprachschicht kostet 0,05 US-Dollar pro Minute; das Denkmodell im Hintergrund, Tools, Telefonie und weitere Infrastruktur werden zusätzlich berechnet. 3
5
Viele Sprachassistenten arbeiten als Kette: Zuerst wandelt Speech-to-Text die Sprache in Text um, dann formuliert ein Sprachmodell eine Antwort, anschließend erzeugt Text-to-Speech wieder Audio. Das kann gut funktionieren – doch jede Übergabe ist ein zusätzlicher Schritt. Pausen, Selbstkorrekturen, Unterbrechungen und wechselnde Absichten müssen zwischen mehreren Komponenten abgestimmt werden. 3
GPT-Live-1 ist dagegen als einzelnes Sprachmodell positioniert, das eingehendes und ausgehendes Audio verarbeitet. „Full Duplex“ bedeutet hier: Das System kann weiter zuhören, während es selbst spricht. Es soll dadurch Unterbrechungen oder kurze Bestätigungen wie „ja“ erkennen können, ohne jedes Geräusch, Schweigen oder Gespräch im Hintergrund zwangsläufig als neue Aufforderung zu behandeln. 3
Der entscheidende Punkt ist also nicht nur eine schnellere Sprachausgabe. Es geht um Gesprächsführung: Erkennt das System, dass jemand noch überlegt? Fällt die Person dem Assistenten ins Wort? Oder ist ein kurzes „mhm“ lediglich eine Bestätigung und keine neue Frage? OpenAI bezeichnet GPT-Live-1 als sein Spitzenmodell für natürliche, ausdrucksstarke Sprachgespräche mit reibungsvoller Unterbrechungsbehandlung. 2
3
GPT-Live-1 muss nicht sämtliche Geschäftslogik selbst erledigen. Das Modell kann den Echtzeitdialog führen und zugleich komplexere Schlussfolgerungen, Tool-Aufrufe oder Aktionen an ein separat ausgewähltes Backend-Modell und Agenten-Framework weitergeben. 3
Für Entwicklungsteams eröffnet das mehrere Optionen:
Praktisch entsteht damit ein zweigeteiltes System: GPT-Live-1 steuert den lebendigen Sprachdialog; das Backend liefert Wissen, Geschäftsprozesse und Aktionen. Deshalb ist der beworbene Minutenpreis nicht gleichbedeutend mit den Gesamtkosten eines Sprachagenten. Inferenz im Backend, Tool-Nutzung, Telefonie und andere Dienste können hinzukommen. 3
5
Über den System-Prompt können Entwickler laut OpenAI Tonfall, Sprechtempo und Gesprächsstil beeinflussen. GPT-Live-1 stellt zudem Transkripte und Antworttext bereit, unterstützt das Verständnis alphanumerischer Angaben sowie Keyword-Biasing und bietet Turn Detection für Anwendungen, die weiterhin klar abgegrenzte Gesprächszüge benötigen. 3
Gedacht ist das Modell auch für längere Sitzungen und telefonische Agenten, beispielsweise im Kundendienst oder bei Reservierungen. Laut OpenAI kann es mit Stille und Hintergrundgeräuschen umgehen, ohne jeden internen Zwischenschritt auszusprechen – ein relevantes Verhalten bei echten Telefonaten und anderen wenig kontrollierten Umgebungen. 3
Die vorliegenden Unterlagen nennen jedoch keine verbindliche Liste unterstützter Sprachen und belegen keine detaillierten API-Einstellungen für bestimmte Akzente oder Dialekte. Wer solche Anforderungen hat, sollte die aktuelle API-Dokumentation vor einem Produktivstart prüfen.
OpenAI berichtet, GPT-Live-1 habe im Full Duplex Bench gegenüber GPT-Realtime-2.1 um 30 Prozentpunkte zugelegt. Die Bewertung konzentriert sich auf interaktives Sprachverhalten – darunter Sprecherwechsel, Pausen, Unterbrechungen, kurze Rückmeldungen und Sprache im Hintergrund. 3
In Verbindung mit GPT-6 Astra bei mittlerem Reasoning-Aufwand habe GPT-Live-1 außerdem den ersten Platz bei Tau3 erreicht. Dieser End-to-End-Benchmark für Sprachagenten umfasst im Kundendienstteil gesprochene Aufgaben aus Luftfahrt, Handel und Telekommunikation. 3
Sekundärberichte nennen zwar konkrete Werte zur Latenz beim Sprecherwechsel und zu Tau3-Ergebnissen. Das hier vorliegende Material aus der Primärquelle enthält diese exakten Zahlen jedoch nicht. Belastbar ist daher vor allem: OpenAI meldet deutliche Verbesserungen im interaktiven Verhalten und ein Spitzenresultat der Kombination aus GPT-Live-1 und Astra bei Tau3 – nicht, dass jede konkrete Implementierung dieselben Werte erzielt. 3
7
OpenAI führt mehrere frühe Einsätze von Sprachagenten an:
Diese Beispiele zeigen, wann Full Duplex besonders nützlich sein kann: wenn Menschen zögern, sich selbst korrigieren, mitten in der Antwort kurz zustimmen oder den Agenten unterbrechen, ohne den gesamten Dialog neu starten zu wollen.
Der Preis von 0,05 US-Dollar pro Minute bezieht sich auf die Frontend-Sprachschicht von GPT-Live-1. Entwickler können das Modell mit einem eigenen Backend-Modell und Agenten-Framework kombinieren. Diese Wahl beeinflusst aber die Gesamtkosten, weil Backend-Inferenz, Tools und weitere Dienste separat abgerechnet werden. 3
5
OpenAI nennt zudem OpenAI Presence als weiteren Weg, Sprachworkflows mit GPT-Live-1 für Echtzeit-Sprachinteraktionen aufzubauen. Die bereitgestellten Informationen erläutern jedoch weder Voraussetzungen für Unternehmenskunden noch kommerzielle Konditionen, Hosting-Modell oder Zugangsverfahren von Presence. Diese Punkte sollten daher nicht allein aus der API-Ankündigung abgeleitet werden. 3
Für Teams lautet die entscheidende Frage somit nicht nur, ob 0,05 US-Dollar pro Minute günstig sind. Wichtig ist, welchen Nutzen ein flüssigerer Dialog im jeweiligen Prozess bringt – und welches Backend samt Tool-Kette die erforderliche Zuverlässigkeit zu vertretbaren Gesamtkosten liefert.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
GPT Live 1 ist seit dem 10. September 2026 über die OpenAI API verfügbar und kostet für die Frontend Sprachschicht 0,05 US Dollar pro Minute.
GPT Live 1 ist seit dem 10. September 2026 über die OpenAI API verfügbar und kostet für die Frontend Sprachschicht 0,05 US Dollar pro Minute. Anders als klassische STT LLM TTS Ketten soll das Modell Gesprächspausen, Unterbrechungen, kurze Bestätigungen und Nebengeräusche direkt im laufenden Dialog einordnen.
OpenAI meldet 30 Prozentpunkte Vorsprung gegenüber GPT Realtime 2.1 im Full Duplex Bench sowie Platz eins bei Tau3 in Kombination mit GPT 6 Astra.