GPT Live 1 è il modello API di OpenAI per conversazioni vocali full duplex: è disponibile dal 10 settembre 2026 e costa 0,05 dollari al minuto per il solo livello vocale front end. A differenza della classica catena riconoscimento vocale–LLM–sintesi vocale, è progettato per gestire in modo continuo pause, interruzio...
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GPT-Live-1 è il modello vocale per sviluppatori con cui OpenAI punta a rendere gli assistenti telefonici e vocali meno simili a una successione di messaggi registrati e più vicini a una conversazione in diretta. È disponibile nell’API dal 10 settembre 2026 e costa 0,05 dollari al minuto per il livello vocale front-end. A questa spesa vanno aggiunti il modello di ragionamento, gli strumenti e l’infrastruttura collegati al servizio. 3
5
Molti agenti vocali seguono una catena a tre passaggi: il riconoscimento vocale trasforma l’audio in testo, un modello linguistico prepara la risposta e la sintesi vocale la restituisce come audio. È un approccio efficace, ma richiede di coordinare più componenti, compresi silenzi, pause, cambi d’idea e sovrapposizioni tra chi parla e chi risponde. 3
GPT-Live-1 è invece presentato come un unico modello vocale che ragiona sull’audio in entrata e in uscita. La caratteristica full-duplex significa che può continuare ad ascoltare mentre sta parlando. L’obiettivo è reagire a un’interruzione o a un breve cenno di assenso senza interpretare ogni rumore, silenzio o voce in sottofondo come un nuovo turno obbligatorio della conversazione. 3
Non si tratta quindi soltanto di generare audio più rapidamente. Il punto è la gestione del dialogo: capire se la persona sta ancora pensando, se sta interrompendo davvero l’assistente oppure se un semplice «sì» o «capito» è soltanto un segnale di ascolto. OpenAI definisce GPT-Live-1 il suo modello di punta per conversazioni vocali naturali ed espressive, con interruzioni gestite in modo fluido. 2
3
GPT-Live-1 non deve svolgere internamente tutta la logica di business. Può mantenere la conversazione vocale in tempo reale e affidare ragionamenti più complessi, chiamate a strumenti o azioni a un modello backend e a un framework per agenti scelti dallo sviluppatore. 3
In pratica, i team possono:
Ne risulta un’architettura a due livelli: GPT-Live-1 governa la conversazione dal vivo, mentre il backend fornisce ragionamento, dati aziendali e azioni. Di conseguenza, il prezzo pubblicizzato della componente vocale non coincide con il costo totale di un agente: inferenza del backend, strumenti, telefonia e altri servizi possono incidere sul conto finale. 3
5
Secondo OpenAI, tono, ritmo e stile della conversazione possono essere indicati nel system prompt. Il modello fornisce anche trascrizioni e testo delle risposte, supporta la comprensione di sequenze alfanumeriche e il keyword biasing — utile per dare priorità a termini specifici — e offre il rilevamento dei turni per i prodotti che richiedono comunque confini espliciti fra un intervento e l’altro. 3
GPT-Live-1 è pensato per sessioni più lunghe e per agenti telefonici, ad esempio nell’assistenza clienti o nelle prenotazioni. OpenAI afferma che può gestire silenzio e rumore ambientale senza verbalizzare ogni passaggio interno, un comportamento utile nelle chiamate reali e in contesti poco controllati. 3
La documentazione fornita non stabilisce però un elenco definitivo delle lingue supportate né controlli dettagliati per singoli accenti e dialetti. Prima di considerare questi aspetti requisiti di distribuzione, gli sviluppatori dovrebbero verificarli nella documentazione API aggiornata.
OpenAI dichiara per GPT-Live-1 un miglioramento di 30 punti percentuali rispetto a GPT-Realtime-2.1 su Full Duplex Bench, una valutazione incentrata sui comportamenti interattivi: alternanza dei turni, pause, interruzioni, segnali di ascolto e parlato di sottofondo. 3
Abbinato a GPT-6 Astra con livello di ragionamento medio, GPT-Live-1 si è inoltre classificato al primo posto su Tau3, benchmark end-to-end per gli agenti vocali. La sua componente dedicata al servizio clienti comprende compiti vocali nei settori aereo, retail e telecomunicazioni. 3
Alcune fonti secondarie riportano valori precisi per la latenza nell’alternanza dei turni e per i punteggi Tau3, ma il materiale primario disponibile qui non fornisce tali numeri. La conclusione più solida è dunque che OpenAI segnala importanti progressi nel comportamento interattivo e un primo posto su Tau3 per la configurazione GPT-Live-1 più GPT-6 Astra; non che ogni implementazione riprodurrà uno specifico valore di benchmark. 3
7
OpenAI cita alcuni impieghi iniziali dei propri agenti vocali:
Questi esempi mostrano dove il full-duplex può essere più utile: chiamate in cui la persona esita, si corregge, conferma mentre l’agente sta ancora parlando o interrompe senza voler ricominciare l’interazione da capo.
Il prezzo di GPT-Live-1 è fissato a 0,05 dollari al minuto per il livello vocale front-end. Gli sviluppatori possono abbinarlo al modello backend e al framework per agenti preferiti, ma queste scelte incidono sul costo complessivo perché vengono fatturate separatamente dalla componente vocale. 3
5
OpenAI indica anche OpenAI Presence come un altro modo per creare flussi vocali basati su GPT-Live-1 per l’interazione in tempo reale. Il materiale disponibile non definisce però requisiti di accesso per le imprese, condizioni commerciali, modello di hosting o procedura di attivazione di Presence: non è quindi possibile dedurre questi dettagli dal solo annuncio dell’API. 3
Per chi valuta il modello, la domanda centrale va oltre il costo al minuto: quanto valore portano una gestione più naturale dei turni e meno interruzioni, e quale combinazione di backend e strumenti offre l’affidabilità necessaria a un costo totale sostenibile?
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GPT Live 1 è il modello API di OpenAI per conversazioni vocali full duplex: è disponibile dal 10 settembre 2026 e costa 0,05 dollari al minuto per il solo livello vocale front end.
GPT Live 1 è il modello API di OpenAI per conversazioni vocali full duplex: è disponibile dal 10 settembre 2026 e costa 0,05 dollari al minuto per il solo livello vocale front end. A differenza della classica catena riconoscimento vocale–LLM–sintesi vocale, è progettato per gestire in modo continuo pause, interruzioni, conferme brevi e rumore di fondo.
OpenAI dichiara un miglioramento di 30 punti percentuali su Full Duplex Bench rispetto a GPT Realtime 2.1 e il primo posto su Tau3 quando il modello è abbinato a GPT 6 Astra.