Gemini 3.5 Transcribe è il nuovo modello voce testo di Google e il successore di Chirp 3: secondo misurazioni citate da Artificial Analysis, riduce del 70% il tempo necessario per arrivare alla trascrizione finale, co... Il modello è pensato per trasformare il parlato imperfetto in testo utilizzabile: rimuove gli in...
Pubblicato daModificato con GPT-5.6 LunaImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google ha presentato Gemini 3.5 Transcribe, un modello voce-testo progettato per fare qualcosa di più che riportare l’audio parola per parola. L’obiettivo è trasformare un parlato spontaneo, pieno di pause, ripensamenti e frasi lasciate a metà, in un testo ordinato e già pronto per essere usato in un messaggio, una nota o un documento. Google lo definisce il suo modello di trascrizione più preciso e lo presenta come un importante passo avanti rispetto a Chirp 3. 1
12
La differenza è rilevante anche per un altro motivo: un sistema che elimina gli “ehm”, interpreta le correzioni e ricostruisce l’intenzione di chi parla può produrre un testo migliore, ma conservare meno fedelmente le parole pronunciate.
Il modello si basa su quella che Google chiama trascrizione intelligente. Invece di trattare ogni esitazione o frase interrotta come una parte intoccabile del risultato finale, può rimuovere le disfluenze, incorporare una correzione pronunciata dall’utente, aggiungere la punteggiatura e applicare una struttura al testo. Può inoltre eseguire modifiche tramite comandi vocali e rendere più leggibile un discorso inizialmente disorganizzato. 1
8
12
È un approccio pensato soprattutto per l’uso quotidiano. L’utente può parlare per appunti, con frasi brevi e non necessariamente ben costruite, e ottenere un risultato più vicino a un messaggio o a una risposta completa che a una semplice sbobinatura.
Gemini 3.5 Transcribe è progettato anche per gestire rumori di fondo, terminologia tecnica e vocabolari specialistici. Google permette di aggiungere un vocabolario personalizzato, così nomi propri, prodotti e termini di settore hanno maggiori probabilità di essere trascritti con la grafia corretta. Il modello rileva automaticamente più di 85 lingue. 1
7
Con l’audio preregistrato, può fornire marcatori temporali e distinguere fino a tre interlocutori, associando le diverse parti della trascrizione alla persona che sta parlando. 1
Google presenta Gemini 3.5 Transcribe come un miglioramento sostanziale rispetto al precedente modello Chirp 3. Dati citati da Artificial Analysis indicano un tasso di errore sulle parole del 2,6% per l’audio non in streaming e del 4,0% per quello in streaming, oltre a una riduzione del 70% nel tempo necessario per ottenere la trascrizione finale. 3
4
9
Questi numeri non sono però una garanzia valida per ogni situazione. Il tasso di errore dipende dalla lingua, dall’accento, dalla qualità della registrazione, dal rumore ambientale e dal set di valutazione utilizzato. Nei materiali ufficiali di Google compare, per esempio, un risultato del 5,50% in modalità streaming sul benchmark FLEURS, una misura che non è direttamente confrontabile con tutte le valutazioni di terze parti perché le condizioni di test possono essere diverse. 1
Il dato più utile, sul piano pratico, è quindi l’intenzione generale: Google punta a ridurre la latenza nelle interazioni dal vivo e a offrire un testo finale più pulito per l’audio registrato o dettato.
Google prevede percorsi differenti a seconda del tipo di applicazione.
La modalità live è pensata per i servizi che devono ricevere un flusso audio continuo e rispondere rapidamente. La Live API di Google supporta interazioni vocali bidirezionali a bassa latenza e può restituire la trascrizione sia dell’input dell’utente sia dell’output del modello. 12
20
Questa integrazione può essere usata per assistenti vocali, sottotitoli in tempo reale, interfacce conversazionali e applicazioni che devono mostrare il testo mentre una persona sta ancora parlando. La documentazione API distingue inoltre tra modalità singola, streaming e interazione in tempo reale. 24
Per l’audio già registrato, gli sviluppatori possono caricare o indicare un file e inviarlo tramite il flusso di interazione delle API Gemini. Questa modalità è più adatta quando contano marcatori temporali, formattazione, vocabolari personalizzati e attribuzione delle battute, più che una risposta in frazioni di secondo. 1
12
18
La documentazione generale di Gemini indica la Interactions API come interfaccia standard consigliata per i nuovi progetti. La Live API resta invece destinata alle esperienze vocali e visive continue, dove la bassa latenza è essenziale. 19
20
Gemini 3.5 Transcribe non è soltanto una tecnologia presentata agli sviluppatori. Secondo i resoconti disponibili, alimenta già Rambler, la funzione di dettatura di Gboard su Android, e l’app Gemini per macOS. 2
13
26
Google ha inoltre annunciato l’arrivo del supporto per la dettatura in Chrome. La funzione dovrebbe consentire di parlare direttamente all’interno dei campi di testo del browser, per esempio durante la scrittura di messaggi, post, moduli o richieste da inviare a Gemini, senza dover ricorrere a un’app separata. 1
8
13
Il modello arriva insieme a Gemini 3.5 Live e Gemini 3.5 Live Experimental, all’interno della più ampia famiglia audio che Google chiama Gemini Audio. In questo insieme, Transcribe è dedicato alla conversione della voce in testo, mentre i modelli Live puntano soprattutto sulle esperienze audio interattive. 12
26
La caratteristica più interessante di Gemini 3.5 Transcribe è anche il suo limite principale. Eliminare gli intercalari e integrare le autocorrezioni rende il risultato più leggibile, ma modifica il rapporto tra registrazione e trascrizione.
Un testo rifinito può omettere un’esitazione significativa, mantenere soltanto la versione corretta di una frase oppure attenuare il modo personale di parlare di qualcuno. Per dettare un messaggio o preparare una nota, è spesso esattamente ciò che si desidera. Diventa invece un problema quando conta la formulazione precisa.
Nel caso di interviste, documenti legali o sanitari, trascrizioni di ricerca, documentazione per l’accessibilità o citazioni, è quindi prudente conservare l’audio originale e verificare i passaggi importanti. In assenza di una modalità chiaramente verbatim, Gemini 3.5 Transcribe va considerato un sistema di trascrizione con riscrittura intelligente, non un registratore neutrale che converte ogni parola senza intervenire.
Google sta spostando il riconoscimento vocale verso una forma di scrittura assistita dalla voce. Gemini 3.5 Transcribe combina trascrizione, pulizia del parlato, formattazione, rilevamento linguistico, vocabolari personalizzati e informazioni sugli interlocutori, offrendo flussi separati per l’audio live e per quello registrato. 1
12
Per gli sviluppatori, questo potrebbe ridurre il lavoro di revisione necessario dopo il riconoscimento vocale. Per gli utenti, la dettatura potrebbe diventare meno simile al parlare con una macchina e più simile al consegnare a un editor una prima bozza ancora grezza.
La domanda centrale, però, non è soltanto se il modello sappia produrre un testo più pulito. È capire se l’applicazione abbia bisogno di un testo pulito oppure della registrazione esatta di ciò che è stato detto.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.5 Transcribe è il nuovo modello voce testo di Google e il successore di Chirp 3: secondo misurazioni citate da Artificial Analysis, riduce del 70% il tempo necessario per arrivare alla trascrizione finale, co...
Gemini 3.5 Transcribe è il nuovo modello voce testo di Google e il successore di Chirp 3: secondo misurazioni citate da Artificial Analysis, riduce del 70% il tempo necessario per arrivare alla trascrizione finale, co... Il modello è pensato per trasformare il parlato imperfetto in testo utilizzabile: rimuove gli intercalari, integra le autocorrezioni, applica la formattazione, riconosce vocabolari personalizzati e rileva automaticame...
Gli sviluppatori possono scegliere tra flussi per l’audio in tempo reale e per i file preregistrati.
Gemini 3.5 Transcribe è il nuovo modello voce testo di Google e il successore di Chirp 3: secondo misurazioni citate da Artificial Analysis, riduce del 70% il tempo necessario per arrivare alla trascrizione finale, co... Il modello è pensato per trasformare il parlato imperfetto in testo utilizzabile: rimuove gli in...
Pubblicato daModificato con GPT-5.6 LunaImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google ha presentato Gemini 3.5 Transcribe, un modello voce-testo progettato per fare qualcosa di più che riportare l’audio parola per parola. L’obiettivo è trasformare un parlato spontaneo, pieno di pause, ripensamenti e frasi lasciate a metà, in un testo ordinato e già pronto per essere usato in un messaggio, una nota o un documento. Google lo definisce il suo modello di trascrizione più preciso e lo presenta come un importante passo avanti rispetto a Chirp 3. 1
12
La differenza è rilevante anche per un altro motivo: un sistema che elimina gli “ehm”, interpreta le correzioni e ricostruisce l’intenzione di chi parla può produrre un testo migliore, ma conservare meno fedelmente le parole pronunciate.
Il modello si basa su quella che Google chiama trascrizione intelligente. Invece di trattare ogni esitazione o frase interrotta come una parte intoccabile del risultato finale, può rimuovere le disfluenze, incorporare una correzione pronunciata dall’utente, aggiungere la punteggiatura e applicare una struttura al testo. Può inoltre eseguire modifiche tramite comandi vocali e rendere più leggibile un discorso inizialmente disorganizzato. 1
8
12
È un approccio pensato soprattutto per l’uso quotidiano. L’utente può parlare per appunti, con frasi brevi e non necessariamente ben costruite, e ottenere un risultato più vicino a un messaggio o a una risposta completa che a una semplice sbobinatura.
Gemini 3.5 Transcribe è progettato anche per gestire rumori di fondo, terminologia tecnica e vocabolari specialistici. Google permette di aggiungere un vocabolario personalizzato, così nomi propri, prodotti e termini di settore hanno maggiori probabilità di essere trascritti con la grafia corretta. Il modello rileva automaticamente più di 85 lingue. 1
7
Con l’audio preregistrato, può fornire marcatori temporali e distinguere fino a tre interlocutori, associando le diverse parti della trascrizione alla persona che sta parlando. 1
Google presenta Gemini 3.5 Transcribe come un miglioramento sostanziale rispetto al precedente modello Chirp 3. Dati citati da Artificial Analysis indicano un tasso di errore sulle parole del 2,6% per l’audio non in streaming e del 4,0% per quello in streaming, oltre a una riduzione del 70% nel tempo necessario per ottenere la trascrizione finale. 3
4
9
Questi numeri non sono però una garanzia valida per ogni situazione. Il tasso di errore dipende dalla lingua, dall’accento, dalla qualità della registrazione, dal rumore ambientale e dal set di valutazione utilizzato. Nei materiali ufficiali di Google compare, per esempio, un risultato del 5,50% in modalità streaming sul benchmark FLEURS, una misura che non è direttamente confrontabile con tutte le valutazioni di terze parti perché le condizioni di test possono essere diverse. 1
Il dato più utile, sul piano pratico, è quindi l’intenzione generale: Google punta a ridurre la latenza nelle interazioni dal vivo e a offrire un testo finale più pulito per l’audio registrato o dettato.
Google prevede percorsi differenti a seconda del tipo di applicazione.
La modalità live è pensata per i servizi che devono ricevere un flusso audio continuo e rispondere rapidamente. La Live API di Google supporta interazioni vocali bidirezionali a bassa latenza e può restituire la trascrizione sia dell’input dell’utente sia dell’output del modello. 12
20
Questa integrazione può essere usata per assistenti vocali, sottotitoli in tempo reale, interfacce conversazionali e applicazioni che devono mostrare il testo mentre una persona sta ancora parlando. La documentazione API distingue inoltre tra modalità singola, streaming e interazione in tempo reale. 24
Per l’audio già registrato, gli sviluppatori possono caricare o indicare un file e inviarlo tramite il flusso di interazione delle API Gemini. Questa modalità è più adatta quando contano marcatori temporali, formattazione, vocabolari personalizzati e attribuzione delle battute, più che una risposta in frazioni di secondo. 1
12
18
La documentazione generale di Gemini indica la Interactions API come interfaccia standard consigliata per i nuovi progetti. La Live API resta invece destinata alle esperienze vocali e visive continue, dove la bassa latenza è essenziale. 19
20
Gemini 3.5 Transcribe non è soltanto una tecnologia presentata agli sviluppatori. Secondo i resoconti disponibili, alimenta già Rambler, la funzione di dettatura di Gboard su Android, e l’app Gemini per macOS. 2
13
26
Google ha inoltre annunciato l’arrivo del supporto per la dettatura in Chrome. La funzione dovrebbe consentire di parlare direttamente all’interno dei campi di testo del browser, per esempio durante la scrittura di messaggi, post, moduli o richieste da inviare a Gemini, senza dover ricorrere a un’app separata. 1
8
13
Il modello arriva insieme a Gemini 3.5 Live e Gemini 3.5 Live Experimental, all’interno della più ampia famiglia audio che Google chiama Gemini Audio. In questo insieme, Transcribe è dedicato alla conversione della voce in testo, mentre i modelli Live puntano soprattutto sulle esperienze audio interattive. 12
26
La caratteristica più interessante di Gemini 3.5 Transcribe è anche il suo limite principale. Eliminare gli intercalari e integrare le autocorrezioni rende il risultato più leggibile, ma modifica il rapporto tra registrazione e trascrizione.
Un testo rifinito può omettere un’esitazione significativa, mantenere soltanto la versione corretta di una frase oppure attenuare il modo personale di parlare di qualcuno. Per dettare un messaggio o preparare una nota, è spesso esattamente ciò che si desidera. Diventa invece un problema quando conta la formulazione precisa.
Nel caso di interviste, documenti legali o sanitari, trascrizioni di ricerca, documentazione per l’accessibilità o citazioni, è quindi prudente conservare l’audio originale e verificare i passaggi importanti. In assenza di una modalità chiaramente verbatim, Gemini 3.5 Transcribe va considerato un sistema di trascrizione con riscrittura intelligente, non un registratore neutrale che converte ogni parola senza intervenire.
Google sta spostando il riconoscimento vocale verso una forma di scrittura assistita dalla voce. Gemini 3.5 Transcribe combina trascrizione, pulizia del parlato, formattazione, rilevamento linguistico, vocabolari personalizzati e informazioni sugli interlocutori, offrendo flussi separati per l’audio live e per quello registrato. 1
12
Per gli sviluppatori, questo potrebbe ridurre il lavoro di revisione necessario dopo il riconoscimento vocale. Per gli utenti, la dettatura potrebbe diventare meno simile al parlare con una macchina e più simile al consegnare a un editor una prima bozza ancora grezza.
La domanda centrale, però, non è soltanto se il modello sappia produrre un testo più pulito. È capire se l’applicazione abbia bisogno di un testo pulito oppure della registrazione esatta di ciò che è stato detto.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.5 Transcribe è il nuovo modello voce testo di Google e il successore di Chirp 3: secondo misurazioni citate da Artificial Analysis, riduce del 70% il tempo necessario per arrivare alla trascrizione finale, co...
Gemini 3.5 Transcribe è il nuovo modello voce testo di Google e il successore di Chirp 3: secondo misurazioni citate da Artificial Analysis, riduce del 70% il tempo necessario per arrivare alla trascrizione finale, co... Il modello è pensato per trasformare il parlato imperfetto in testo utilizzabile: rimuove gli intercalari, integra le autocorrezioni, applica la formattazione, riconosce vocabolari personalizzati e rileva automaticame...
Gli sviluppatori possono scegliere tra flussi per l’audio in tempo reale e per i file preregistrati.