GPT Live 1 blev tillgänglig i OpenAI:s API den 10 september 2026 och kostar 0,05 dollar per minut för det främre röstlagret. Modellen kan lyssna medan den talar, med målet att hantera avbrott, korta bekräftelser, pauser och bakgrundsljud mer naturligt än en traditionell STT–LLM–TTS kedja.
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
OpenAI:s GPT-Live-1 är en röstmodell för utvecklare som ska få automatiserade samtal att kännas mindre som inspelade fråge-och-svar och mer som ett levande samtal. Modellen blev tillgänglig i API:t den 10 september 2026 och kostar 0,05 dollar per minut för det främre röstlagret. Resonemangsmodell, verktyg och annan infrastruktur som kopplas bakom röstlagret debiteras separat. 3
5
Många röstassistenter bygger på en kedja: tal-till-text omvandlar personens röst till text, en språkmodell formulerar ett svar och text-till-tal läser sedan upp svaret. Upplägget kan fungera väl, men varje steg innebär en överlämning. Applikationen måste själv samordna pauser, tvekan, ändrad avsikt och avbrott mellan flera separata komponenter. 3
GPT-Live-1 är i stället positionerad som en enskild röstmodell som arbetar med både inkommande och utgående ljud. Full-duplex-upplägget innebär att den kan fortsätta lyssna samtidigt som den genererar tal. Tanken är att den ska kunna reagera när en användare avbryter eller ger en kort bekräftelse, utan att tolka varje ljud, tystnad eller samtal i bakgrunden som en ny tur i dialogen. 3
Det handlar alltså inte bara om att skapa ljud snabbare, utan om samtalsstyrning: att avgöra när någon fortfarande tänker, när personen avbryter och när ett kort ”ja” bara är en bekräftelse snarare än en begäran om ett nytt svar. OpenAI beskriver GPT-Live-1 som sin främsta modell för naturliga, uttrycksfulla röstsamtal med smidig avbrottshantering. 2
3
GPT-Live-1 behöver inte själv utföra all affärslogik. Den kan hålla igång röstsamtalet i realtid medan mer avancerat resonemang, verktygsanrop eller åtgärder delegeras till en separat backendmodell och ett agentramverk. 3
Det ger utvecklare flera möjliga upplägg:
Systemet blir därmed tvådelat: GPT-Live-1 sköter själva röstdialogen, medan backendmodellen tillför resonemang, verksamhetsdata och åtgärder. Följden är att det annonserade röstpriset inte är hela kostnaden för en röstagent. Modellinferens i backend, verktyg, telefoni och närliggande tjänster kan tillkomma. 3
5
Enligt OpenAI kan utvecklare styra tonfall, tempo och samtalsstil via systemprompten. GPT-Live-1 ger även transkriptioner och svarstext, har stöd för alfanumerisk förståelse och nyckelordsbiasering samt erbjuder turdetektering för produkter som fortfarande behöver tydliga gränser mellan samtalsturer. 3
Modellen är avsedd för längre sessioner och telefonbaserade agenter, bland annat inom kundtjänst och bokning. OpenAI uppger att den kan hantera tystnad och bakgrundsljud utan att redogöra för varje internt steg – ett beteende som är relevant i vanliga telefonsamtal och andra mindre kontrollerade miljöer. 3
Det tillhandahållna underlaget fastslår däremot ingen definitiv lista över stödda språk och beskriver inte detaljerade utvecklarinställningar för specifika accenter eller dialekter. Sådana krav bör därför kontrolleras i den aktuella API-dokumentationen före en driftsättning.
OpenAI uppger att GPT-Live-1 förbättrade resultatet i Full Duplex Bench med 30 procentenheter jämfört med GPT-Realtime-2.1. Utvärderingen fokuserar på interaktivt röstbeteende, bland annat turtagning, pauser, avbrott, korta bekräftelser och bakgrundstal. 3
Tillsammans med GPT-6 Astra med medelhög resonemangsnivå uppger OpenAI också att GPT-Live-1 placerade sig etta i Tau3, ett benchmark för röstagenters förmåga att utföra uppgifter från början till slut. Kundtjänstdelen omfattar talade uppgifter inom flyg, handel och telekom. 3
Vissa sekundärkällor anger exakta siffror för fördröjning vid turtagning och Tau3-resultat. Det primärkällmaterial som finns här innehåller dock inte dessa exakta värden. Den säkrare slutsatsen är därför att OpenAI rapporterar tydliga förbättringar i interaktivt samtalsbeteende och en topplacering i Tau3 för kombinationen GPT-Live-1 och Astra – inte att varje installation kommer att nå ett visst benchmarkresultat. 3
7
OpenAI lyfter fram flera tidiga användningsfall för röstagenter:
Exemplen visar var full duplex kan vara mest värdefullt: i situationer där den som ringer tvekar, rättar sig själv, bekräftar något mitt i ett svar eller avbryter agenten utan att vilja börja om hela ärendet.
GPT-Live-1 kostar 0,05 dollar per minut för det främre röstlagret. Utvecklare kan kombinera modellen med valfri backendmodell och agentmiljö, men de valen påverkar den totala driftskostnaden eftersom de debiteras utöver röstlagret. 3
5
OpenAI pekar också ut OpenAI Presence som ett annat sätt att bygga röstflöden med GPT-Live-1 för röstinteraktion i realtid. Underlaget definierar dock inte Presence villkor för företag, kommersiella villkor, driftmodell eller hur åtkomst ges. Det går därför inte att dra säkra slutsatser om dessa delar enbart utifrån API-lanseringen. 3
För team som utvärderar modellen är huvudfrågan alltså större än minutpriset: hur mycket är ett smidigare samtalsflöde värt i det aktuella arbetsflödet, och vilken kombination av backendmodell och verktyg ger tillräcklig tillförlitlighet till en rimlig totalkostnad?
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GPT Live 1 blev tillgänglig i OpenAI:s API den 10 september 2026 och kostar 0,05 dollar per minut för det främre röstlagret.
GPT Live 1 blev tillgänglig i OpenAI:s API den 10 september 2026 och kostar 0,05 dollar per minut för det främre röstlagret. Modellen kan lyssna medan den talar, med målet att hantera avbrott, korta bekräftelser, pauser och bakgrundsljud mer naturligt än en traditionell STT–LLM–TTS kedja.
OpenAI uppger en förbättring på 30 procentenheter mot GPT Realtime 2.1 i Full Duplex Bench och förstaplats i Tau3 tillsammans med GPT 6 Astra.