Entrambi sostituiscono la precedente Modalità Vocale Avanzata di ChatGPT. Sono costruiti su una vera architettura full-duplex che elabora continuamente l'audio in arrivo mentre genera la risposta vocale, a differenza del vecchio approccio half-duplex in cui il modello doveva finire di parlare prima di poter ascoltare l'utente HAT.
OpenAI ha dichiarato che i costi di inferenza sono scesi abbastanza da rendere economicamente sostenibile la voce, motivo per cui il modello è disponibile anche per gli utenti gratuiti A. Al lancio, GPT-Live utilizza GPT-5.5 per il ragionamento in background OH.
La capacità full-duplex cambia la sensazione dell'AI vocale in tre modi specifici, dimostrati da OpenAI durante il briefing di lancio.
Il modello può essere interrotto a metà frase e si ferma ad ascoltare, invece di parlare sopra l'utente. Inoltre, rileva quando l'utente fa una pausa a metà pensiero e aspetta, invece di intervenire AT. Atty Eleti, responsabile del prodotto ChatGPT Voice, ha dichiarato durante il briefing: "Questo è un modello full-duplex" T.
Il modello può anche mostrare di stare prestando attenzione con espressioni come "mhmm" o "sì" mentre l'utente parla, e resta in silenzio quando serve un momento per pensare OB.
Quando GPT-Live incontra una domanda difficile, delega il ragionamento ai modelli di testo più recenti di OpenAI (come GPT-5.5) in parallelo, mentre GPT-Live stesso rimane in conversazione con l'utente AT. Il responsabile della ricerca Kundan Kumar ha spiegato: "Quando GPT-Live deve pensare a fondo per una domanda, può delegare il suo ragionamento e i compiti complessi a GPT-5.5 in parallelo, mentre GPT-Live rimane in conversazione con l'utente" LT. Questo significa che gli utenti non devono aspettare che il modello vocale ragioni attraverso compiti pesanti: il passaggio dalla ricerca ai risultati parlati è quasi istantaneo T.
GPT-Live può arricchire le discussioni con elementi visivi sullo schermo — immagini, diagrammi o altri contenuti generati dall'AI — creando un'esperienza multimodale che va oltre la pura chat vocale HAT. The Verge ha riportato che il modello integrerà le conversazioni su meteo, azioni e sport con immagini generate dall'AI T.
Complessivamente, queste caratteristiche rendono le conversazioni molto più simili al dialogo umano naturale. Business Insider lo ha descritto come un assistente che "vuole che gli parli sopra" B. The Verge ha titolato che è "migliore a stare zitto" T.
Le due figure chiave menzionate nei briefing stampa e nei resoconti dei media sono:
Report precedenti di gennaio 2026 menzionavano anche il responsabile dell'infrastruttura Ben Newhouse e la product manager Jackie Shannon come coinvolti nella ristrutturazione dell'audio AI IX.
gpt-realtime-2.1 e gpt-realtime-2.1-mini) con una latenza p95 inferiore del 25% grazie a una cache migliorata C.Un limite segnalato al lancio: GPT-Live al momento non supporta la voce con funzionalità video T.
OpenAI ha lanciato GPT-Live nel bel mezzo di una settimana eccezionalmente intensa per l'industria dell'AI.
L'ecosistema di OpenAI:
Concorrenti e notizie correlate: