Gemini 3.8 Live è pensato per dialoghi vocali fluidi, a bassa latenza e convenienti su larga scala; Extended Thinking affronta attività complesse a più passaggi. La novità centrale di Extended Thinking è la capacità di pianificare e usare strumenti in background mentre continua a generare audio, evitando pause prolu...
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google ha presentato Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, due modelli nativi audio-to-audio per agenti vocali e dialoghi in tempo reale. Il primo è rivolto a implementazioni su larga scala, con attenzione a costi, fluidità della conversazione e comprensione del contesto visivo; il secondo è destinato a compiti più difficili, che richiedono ragionamento in più passaggi. 10
2
La funzione distintiva è di Gemini 3.8 Live Extended Thinking. Secondo Google, il modello può ragionare in background, pianificare e invocare strumenti asincroni senza interrompere il flusso della risposta audio. Se uno strumento impiega alcuni secondi a completare un’operazione, il sistema può mantenere viva l’interazione con formule conversazionali naturali, anziché lasciare l’utente in attesa nel silenzio. 1
2
Non si tratta quindi soltanto di tempi di risposta più rapidi. Nell’architettura descritta da Google, generazione vocale, pianificazione in background e attività asincrone degli strumenti possono procedere in parallelo. Un assistente potrebbe, per esempio, spiegare il prossimo passaggio mentre recupera dati o completa una procedura articolata. L’efficacia reale dipenderà però dall’affidabilità degli strumenti collegati, dalla progettazione del dialogo e dalla capacità di evitare riempitivi inutili. 1
2
Google posiziona il modello standard Gemini 3.8 Live come opzione per esperienze conversazionali ad alto volume e bassa latenza, senza i ritardi associati al ragionamento più esteso. Combina il dialogo in diretta con il visual grounding, cioè la capacità di usare il contesto visivo insieme a ciò che viene detto nella conversazione. 10
45
Rappresentanti di Google hanno inoltre dichiarato il supporto per 97 lingue, con possibilità di passare da una lingua all’altra durante lo stesso dialogo. Per un prodotto destinato al pubblico, sviluppatori e aziende dovranno comunque verificare qualità linguistica, accenti, disponibilità regionale e prestazioni nel proprio caso d’uso. 16
Secondo la copertura del lancio, lo Speech-to-Speech Quality Index assegna 76,0 a Gemini 3.8 Live e 82,6 a Gemini 3.8 Live Extended Thinking, contro 81,5 per GPT-Live-1 di OpenAI con livello di impegno medio. 25
Nel confronto riportato, Extended Thinking risulta dunque il modello con il punteggio più alto. Ma questi valori non equivalgono a una verifica indipendente della qualità complessiva in produzione. Un agente vocale deve anche gestire interruzioni dell’utente, parlato multilingue e accenti, correttezza delle chiamate agli strumenti, latenza sotto carico, sicurezza, monitoraggio e costo per ogni richiesta risolta. I benchmark sono un elemento di valutazione, non una risposta universale su quale piattaforma sia migliore. 25
La tabella ufficiale di Google raggruppa entrambi i nuovi modelli nella Live API. Nel piano standard a pagamento, l’input audio costa 3,00 dollari per milione di token, oppure 0,005 dollari al minuto; l’output audio costa 12,00 dollari per milione di token, oppure 0,018 dollari al minuto. L’input testuale è indicato a 0,75 dollari per milione di token e l’output testuale, inclusi i token di ragionamento, a 4,50 dollari per milione. 37
È una distinzione importante: i prezzi dei token citati per Gemini 3.8 Flash non corrispondono automaticamente a quelli dei modelli Live. Per stimare il budget conviene partire dalla tabella aggiornata della Live API e dalla documentazione del modello, poi testare sessioni reali: il costo dipende dalla combinazione di audio in ingresso e uscita, contesto visivo, testo e strumenti usati. 37
Google DeepMind indica entrambi i modelli come generalmente disponibili. La tabella pubblicata comprende, per tutti e due, l’app Gemini, Google AI Studio, la Gemini API e Google Enterprise Agent Platform. Per Extended Thinking è indicato anche Google Search Live; per Gemini 3.8 Live, Google Workspace. 54
Per gli sviluppatori, la scelta è quindi tra un modello per il dialogo live standard e uno con maggiore capacità di ragionamento, nella stessa famiglia audio-to-audio. Per le imprese, non basta sapere che il modello è disponibile: occorre verificare il prodotto specifico, i controlli sui dati, l’area geografica e il percorso di integrazione adatti al progetto. 54
La proposta competitiva di Google è uno stack più integrato: interazione parlata, contesto visivo, ragionamento in background e strumenti asincroni nella stessa famiglia di modelli. In linea di principio, questo può ridurre il lavoro necessario per collegare riconoscimento vocale, modello testuale, orchestrazione degli strumenti e sintesi vocale, mantenendo al tempo stesso la continuità del dialogo mentre il sistema opera. 1
10
GPT-Live-1 di OpenAI resta un riferimento per i team che stanno valutando conversazioni full-duplex e comportamento in tempo reale. Il confronto disponibile è però troppo ristretto per decidere una piattaforma. Una valutazione credibile dovrebbe misurare, su chiamate rappresentative, la gestione delle interruzioni, la correttezza delle chiamate agli strumenti, le prestazioni multilingue, i controlli di sicurezza, il recupero dagli errori, la latenza e il costo per risultato completato. 25
Il materiale di lancio disponibile non definisce una politica precisa sul watermark audio SynthID per Gemini 3.8 Live o Extended Thinking. Google afferma di aver esteso SynthID al watermarking e all’identificazione del testo generato nell’app Gemini e nell’esperienza web, ma questa dichiarazione non conferma che ogni flusso audio dei due modelli Live sia marcato, né chiarisce modalità di rilevamento o condizioni di distribuzione. 59
Vale la stessa cautela per integrazioni e supporto dell’ecosistema, che possono cambiare rapidamente. Prima di scegliere un’architettura per un servizio in produzione, è opportuno verificare documentazione aggiornata, prezzi, disponibilità della piattaforma e termini di servizio applicabili. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live è pensato per dialoghi vocali fluidi, a bassa latenza e convenienti su larga scala; Extended Thinking affronta attività complesse a più passaggi.
Gemini 3.8 Live è pensato per dialoghi vocali fluidi, a bassa latenza e convenienti su larga scala; Extended Thinking affronta attività complesse a più passaggi. La novità centrale di Extended Thinking è la capacità di pianificare e usare strumenti in background mentre continua a generare audio, evitando pause prolungate nella conversazione.