GPT Live 1 trafił do API 10 września 2026 r.; cena warstwy głosowej na froncie wynosi 0,05 USD za minutę. Tryb full duplex pozwala modelowi słuchać podczas mówienia, dzięki czemu ma lepiej reagować na przerwania, krótkie potwierdzenia i pauzy.
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GPT-Live-1 to udostępniony deweloperom model głosowy OpenAI, zaprojektowany tak, by rozmowa brzmiała mniej jak seria nagranych tur, a bardziej jak kontakt na żywo. Jest dostępny w API od 10 września 2026 r. i kosztuje 0,05 USD za minutę za frontową warstwę głosową. Osobno rozliczane są jednak model rozumowania, narzędzia i infrastruktura podłączone po stronie zaplecza. 3
5
Wiele agentów głosowych działa jako łańcuch trzech etapów: system rozpoznawania mowy zamienia głos na tekst, model językowy przygotowuje odpowiedź, a synteza mowy odczytuje ją rozmówcy. Taka architektura może działać dobrze, ale każdy etap to osobne przekazanie danych. Aplikacja musi sama koordynować pauzy, zmianę intencji i tzw. barge-in, czyli wejście użytkownika w słowo agentowi. 3
GPT-Live-1 ma być pojedynczym modelem głosowym, który operuje na przychodzącym i wychodzącym audio. W architekturze full duplex może nadal słuchać, gdy jednocześnie generuje wypowiedź. Ma to pozwolić reagować na przerwanie albo krótkie potwierdzenie bez uznawania każdego dźwięku, milczenia czy rozmowy w tle za nową, obowiązkową turę. 3
Nie chodzi więc wyłącznie o szybsze wygenerowanie dźwięku. Stawką jest kontrola przebiegu rozmowy: rozpoznanie, czy osoba nadal układa odpowiedź, rzeczywiście chce przerwać, czy mówi jedynie krótkie „tak” albo „mhm” jako sygnał, że słucha. OpenAI określa GPT-Live-1 jako swój czołowy model do naturalnych, ekspresyjnych rozmów głosowych z płynną obsługą przerwań. 2
3
GPT-Live-1 nie musi sam realizować całej logiki biznesowej. Może prowadzić rozmowę w czasie rzeczywistym, a głębsze rozumowanie, wywołania narzędzi lub wykonanie czynności przekazywać do osobno wybranego modelu zaplecza i frameworka agenta. 3
Daje to zespołom kilka praktycznych możliwości:
Powstaje w ten sposób system dwuczęściowy: GPT-Live-1 zarządza samą rozmową głosową, a zaplecze dostarcza rozumowanie, dane firmowe i wykonuje działania. Konsekwencja jest istotna przy kalkulacji budżetu: ogłoszona stawka za głos nie jest pełnym kosztem agenta. Dodatkowo płatne mogą być inferencja modelu backendowego, narzędzia, telefonia i powiązane usługi. 3
5
Według OpenAI deweloperzy mogą określać ton, tempo i styl prowadzenia rozmowy w promptcie systemowym. GPT-Live-1 udostępnia też transkrypcje i tekst odpowiedzi, obsługuje rozumienie ciągów alfanumerycznych oraz wzmacnianie wskazanych słów kluczowych. Jest również funkcja wykrywania tur dla produktów, które nadal wymagają wyraźnej granicy między wypowiedzią użytkownika a odpowiedzią systemu. 3
Model ma być przeznaczony do dłuższych sesji i agentów telefonicznych, m.in. w obsłudze klienta oraz systemach rezerwacyjnych. OpenAI deklaruje, że potrafi radzić sobie z ciszą i hałasem w tle bez komentowania każdego wewnętrznego kroku, co ma znaczenie w realnych rozmowach telefonicznych i innych mniej kontrolowanych warunkach. 3
Dostarczona dokumentacja nie zawiera ostatecznej listy obsługiwanych języków ani szczegółowego opisu kontrolek API dotyczących konkretnych akcentów i dialektów. Przed wdrożeniem wymagającym takich funkcji należy sprawdzić aktualną dokumentację API.
OpenAI informuje, że GPT-Live-1 uzyskał wynik wyższy o 30 punktów procentowych od GPT-Realtime-2.1 w Full Duplex Bench — teście skupionym na interaktywnym zachowaniu głosowym, w tym zmianie tury, pauzach, przerwaniach, krótkich potwierdzeniach i mowie w tle. 3
Po połączeniu z GPT-6 Astra przy średnim poziomie wysiłku rozumowania model miał również zająć pierwsze miejsce w Tau3, benchmarku kompleksowo oceniającym agentów głosowych. Część dotycząca obsługi klienta obejmuje zadania mówione z branż lotniczej, handlowej i telekomunikacyjnej. 3
Część wtórnych publikacji przytacza dokładne wartości opóźnienia przejmowania tury i wyniki Tau3, lecz udostępnione tu materiały źródłowe OpenAI nie podają tych precyzyjnych liczb. Ostrożny wniosek brzmi więc: OpenAI raportuje duży postęp w zachowaniu interaktywnym i najlepszy rezultat Tau3 dla konfiguracji GPT-Live-1 z Astrą, ale nie oznacza to, że każda implementacja odtworzy konkretny wynik benchmarkowy. 3
7
OpenAI wskazuje kilka wczesnych wdrożeń agentów głosowych:
Przykłady pokazują, gdzie full duplex może mieć największą wartość: w sytuacjach, gdy rozmówca się waha, poprawia własną wypowiedź, potwierdza coś w trakcie odpowiedzi agenta albo przerywa mu bez zamiaru rozpoczynania całej interakcji od nowa.
Cena GPT-Live-1 wynosi 0,05 USD za minutę za frontową warstwę głosową. Model można połączyć z wybranym backendem i frameworkiem agenta, lecz wybory te wpływają na całkowity koszt działania, ponieważ są rozliczane niezależnie od warstwy głosowej. 3
5
OpenAI wskazuje także OpenAI Presence jako inną drogę budowania procesów głosowych z wykorzystaniem GPT-Live-1 do interakcji głosowej w czasie rzeczywistym. Dostarczony materiał nie wyjaśnia jednak zasad dostępu dla przedsiębiorstw, warunków handlowych, modelu hostingu ani procesu uzyskania dostępu do Presence. Nie należy więc zakładać tych szczegółów wyłącznie na podstawie ogłoszenia API. 3
Dla zespołu rozważającego wdrożenie najważniejsze pytanie wykracza zatem poza stawkę za minutę: ile w danym procesie jest warte płynniejsze prowadzenie rozmowy oraz jaki model zaplecza i zestaw narzędzi zapewni wymaganą niezawodność przy akceptowalnym koszcie całkowitym?
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GPT Live 1 trafił do API 10 września 2026 r.; cena warstwy głosowej na froncie wynosi 0,05 USD za minutę.
GPT Live 1 trafił do API 10 września 2026 r.; cena warstwy głosowej na froncie wynosi 0,05 USD za minutę. Tryb full duplex pozwala modelowi słuchać podczas mówienia, dzięki czemu ma lepiej reagować na przerwania, krótkie potwierdzenia i pauzy.
OpenAI podaje poprawę o 30 punktów procentowych w Full Duplex Bench względem GPT Realtime 2.1 oraz 1.