Ogłoszenie dotyczące API opublikowano 10 września 2026 r., a nie 11 września. GPT‑Live‑1 to ogólnie dostępna warstwa głosowa full duplex, zdolna jednocześnie słuchać i mówić.
Opublikowane przezObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT Live 1 full duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11.. Topic tags: general web, openai, chatgpt, prompt engineering, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidenc
Ogłoszenie OpenAI dotyczące API nosi datę 10 września 2026 r., a nie 11 września. Firma udostępniła wtedy GPT‑Live‑1 jako model głosowy full duplex — czyli taki, który może równocześnie słuchać użytkownika i mówić. Ma to ułatwić tworzenie agentów głosowych prowadzących rozmowę bardziej podobną do naturalnej konwersacji, zamiast czekać na zakończenie każdej wypowiedzi. 3
W klasycznej architekturze rozmowa głosowa przechodzi przez kolejne etapy: rozpoznawanie mowy (speech-to-text), model językowy lub rozumujący, a następnie syntezę mowy (text-to-speech). Każde takie przekazanie danych może zwiększać opóźnienie i powodować utratę elementów ważnych w rozmowie — jej rytmu, czasu reakcji i części kontekstu. GPT‑Live‑1 łączy słuchanie oraz mówienie w jednym modelu głosowym. 3
W praktyce oznacza to, że system może reagować na przerwania i krótkie sygnały potwierdzające w trakcie rozmowy. Głębsze rozumowanie albo korzystanie z narzędzi może odbywać się równolegle w modelu backendowym. 3
Twórcy aplikacji mogą przekazywać takie zadania do zaplecza OpenAI, np. GPT‑6 Astra, albo do modelu innej firmy. Pozwala to dobierać kompromis między jakością rozumowania, szybkością działania i kosztem do konkretnego zastosowania. 3
OpenAI wskazało m.in. możliwość sterowania w promptach systemowych tonem, tempem i stylem rozmowy. Model ma też wspierać wdrożenia telefoniczne, radzenie sobie z hałasem w tle i ciszą, dłuższe sesje, transkrypcje oraz tekst odpowiedzi, rozpoznawanie znaków alfanumerycznych i wzmacnianie wskazanych słów kluczowych. 3
Sesje głosowe GPT‑Live‑1 kosztują 0,05 USD za minutę. Rozliczenie odbywa się co do sekundy, bez zaokrąglania do pełnych minut. 2
To nie jest jednak pełny koszt obsługi rozmowy: użycie wybranego modelu backendowego oraz narzędzi jest naliczane osobno. 2
Dostarczone materiały nie potwierdzają szczegółów dotyczących rzekomego zarządzanego dostępu korporacyjnego „Presence” ani konkretnych twierdzeń o rozszerzeniu obsługiwanych akcentów, dialektów i języków.
Według OpenAI GPT‑Live‑1 poprawił wynik w teście Full Duplex Bench o 30 punktów procentowych względem GPT‑Realtime‑2.1. W konfiguracji z GPT‑6 Astra i średnim poziomem wysiłku rozumowania model zajął pierwsze miejsce w teście Tau3. 3
W przedstawionych materiałach nie ma jednak niezależnie pokazanych dokładnych wartości opóźnienia — 1,41 s wobec 0,798 s — ani wyników Tau3 na poziomie 86,2% wobec 45,7%. Te konkretne liczby należy więc uznać za niezweryfikowane na podstawie dostępnych źródeł.
Yelp podał, że integracja GPT‑Live‑1 z Yelp Host i Hatch poprawiła zmianę tur w rozmowie oraz dokładność względem wcześniejszej architektury głosowej. W rozmowach o rezerwacjach i zamówieniach jedzenia firma odnotowała istotną poprawę obsługi połączeń, a dzwoniący mieli wypowiadać się pełniejszymi, bardziej naturalnymi zdaniami. 3
Speak przekazał, że model dawał osobom uczącym się języka więcej czasu na zastanowienie przed odpowiedzią wirtualnego lektora. Według firmy liczba przerwań spadła niemal o 80% w porównaniu z wcześniejszymi systemami działającymi turami. 3
Współzałożyciel i CTO firmy z branży ochrony zdrowia stwierdził natomiast, że zastąpienie architektury kaskadowej uprościło kod o 80% i pozwoliło usunąć 23 tys. linii kodu, co miało umożliwić bardziej naturalne rozmowy z pacjentami w czasie rzeczywistym. 3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ogłoszenie dotyczące API opublikowano 10 września 2026 r., a nie 11 września.
Ogłoszenie dotyczące API opublikowano 10 września 2026 r., a nie 11 września. GPT‑Live‑1 to ogólnie dostępna warstwa głosowa full duplex, zdolna jednocześnie słuchać i mówić.
W odróżnieniu od klasycznego łańcucha STT–model językowy–TTS, model łączy odbieranie i generowanie głosu w jednym systemie.