Gemini 3.5 Transcribe is Googles nieuwe spraak naar tekstmodel en opvolger van Chirp 3. Het model verwijdert stopwoordjes, verwerkt zelfcorrecties, voegt interpunctie en opmaak toe, ondersteunt aangepaste woordenlijsten en detecteert automatisch meer dan 85 talen.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google heeft Gemini 3.5 Transcribe geïntroduceerd als een spraak-naar-tekstmodel dat meer doet dan audio woord voor woord uitschrijven. Het is bedoeld om informele, onderbroken of rommelige spraak om te zetten in nette, gestructureerde tekst — handig voor dicteren, notities, berichten en tekstbewerking met je stem. Google noemt het zijn meest nauwkeurige spraak-naar-tekstmodel tot nu toe en positioneert het als een grote stap vooruit ten opzichte van Chirp 3. 1 12
Die aanpak is praktisch, maar het is belangrijk om te weten wat er precies gebeurt. Een systeem dat ‘eh’ en ‘uhm’ verwijdert, correcties van de spreker verwerkt en probeert te begrijpen wat iemand bedoelt, kan een beter leesbare tekst opleveren — terwijl het tegelijk minder van de oorspronkelijke formulering bewaart.
Gemini 3.5 Transcribe is gebouwd rond wat Google intelligente transcriptie noemt. Het model hoeft niet iedere aarzeling of afgebroken zin letterlijk in het eindresultaat te laten staan. Het kan stopwoordjes verwijderen, een zelfcorrectie meenemen, interpunctie toevoegen en tekst automatisch opmaken. Ook kan het reageren op gesproken bewerkingsopdrachten en losse gedachten omzetten in beter leesbare tekst. 1 8 12
Daardoor is het vooral interessant voor alledaagse spraakinvoer. Je kunt bijvoorbeeld in losse zinnen een bericht of notitie inspreken en een resultaat krijgen dat al meer op een afgewerkte tekst lijkt dan op een ruwe transcriptie.
Google zegt bovendien dat het model overweg kan met achtergrondgeluid, technische termen en gespecialiseerde woordenschat. Gebruikers kunnen een eigen woordenlijst toevoegen, zodat namen, producten en vaktermen vaker met de gewenste spelling worden weergegeven. Het model detecteert automatisch meer dan 85 talen. 1 7
Bij vooraf opgenomen audio biedt Google tijdstempels en sprekerherkenning voor maximaal drie personen. Daarmee kunnen ontwikkelaars tekstfragmenten aan afzonderlijke deelnemers koppelen. 1
Google presenteert Gemini 3.5 Transcribe als een duidelijke verbetering ten opzichte van het eerdere transcriptiemodel Chirp 3. Metingen die verwijzen naar Artificial Analysis noemen een woordfoutpercentage van 2,6% bij niet-streamende audio en 4,0% bij streamingaudio. Ook zou de tijd tot een definitieve transcriptie met 70% zijn afgenomen. 3 4 9
Die cijfers zijn geen garantie voor elke situatie. Het woordfoutpercentage hangt onder meer af van de taal, het accent, de opnamekwaliteit, achtergrondgeluiden en de gebruikte testset. In Googles eigen materiaal wordt bijvoorbeeld een woordfoutpercentage van 5,50% in streamingmodus genoemd op de FLEURS-benchmark. Dat resultaat is niet één op één te vergelijken met alle metingen van externe partijen, omdat de testomstandigheden verschillen. 1
De praktische boodschap is wel duidelijk: Google richt zich tegelijk op een lagere vertraging bij livegesprekken en op een schoner eindresultaat bij opgenomen of gedicteerde spraak.
Google beschrijft twee manieren om Gemini 3.5 Transcribe te gebruiken, afhankelijk van het soort toepassing.
De livevariant is bedoeld voor toepassingen die een continue audiostroom verwerken en snel moeten reageren. Googles Live API ondersteunt spraakinteracties met lage vertraging en kan transcripties leveren van zowel de invoer van de gebruiker als de uitvoer van het model. 12 20
Dat maakt de technologie geschikt voor onder meer stemassistenten, liveondertiteling, gesprekstoepassingen en diensten die al tekst nodig hebben terwijl iemand nog aan het praten is. De API-documentatie onderscheidt daarnaast eenmalige, streaming- en realtime interacties voor Gemini-toepassingen. 24
Voor bestaande opnames kunnen ontwikkelaars een audiobestand uploaden of ernaar verwijzen en het via de interactiestroom van de Gemini API laten verwerken. Deze route past beter bij opnames waarbij tijdstempels, opmaak, een eigen woordenlijst en sprekerstoewijzing belangrijker zijn dan een reactie binnen een fractie van een seconde. 1 12 18
Google adviseert voor nieuwe Gemini-toepassingen de Interactions API als standaardinterface. De Live API is bedoeld voor continue spraak- en beeldinteracties met een lage vertraging. 19 20
Gemini 3.5 Transcribe is niet alleen een model voor ontwikkelaars. Volgens berichtgeving vormt het al de basis voor Rambler, de dicteerfunctie in Androids Gboard, en voor de Gemini-app op macOS. 2 13 26
Google zegt daarnaast dat spraak-naar-tekst binnenkort naar Chrome komt. Gebruikers zouden dan rechtstreeks in webvelden kunnen dicteren, bijvoorbeeld in berichten, formulieren, posts en prompts, zonder daarvoor een aparte app te openen. 1 8 13
Het model verschijnt naast Gemini 3.5 Live en Gemini 3.5 Live Experimental als onderdeel van Googles bredere Gemini Audio-aanbod. Transcribe richt zich daarbij op het omzetten van spraak naar tekst, terwijl de Live-modellen bedoeld zijn voor interactieve audio-ervaringen. 12 26
De sterkste eigenschap van Gemini 3.5 Transcribe is tegelijk de belangrijkste beperking. Door stopwoordjes te verwijderen en zelfcorrecties samen te voegen, wordt de uitvoer prettiger om te lezen. Maar daarmee verandert ook de relatie tussen de opname en het transcript.
Een nette tekst kan betekenisvolle aarzelingen weglaten, alleen de gecorrigeerde versie van een zin bewaren of iemands persoonlijke spreekstijl gladstrijken. Bij het dicteren van een bericht of het maken van aantekeningen is dat meestal precies de bedoeling. Bij een interview, juridisch of medisch dossier, onderzoek, toegankelijkheidsdocumentatie of een letterlijk citaat ligt dat anders.
Bewaar in zulke gevallen altijd de originele audio en controleer belangrijke passages. Zolang een implementatie geen duidelijk aangegeven letterlijke modus biedt, kun je Gemini 3.5 Transcribe beter zien als een intelligent transcriptie- en herschrijfsysteem — niet als een neutrale recorder die exact vastlegt wat er is gezegd.
Met Gemini 3.5 Transcribe schuift Google spraakherkenning verder op richting schrijven met hulp van je stem. Het model combineert transcriptie met opschoning, opmaak, taaldetectie, aanpasbare woordenschat en informatie over sprekers. Voor live en opgenomen audio zijn afzonderlijke workflows beschikbaar. 1 12
Voor ontwikkelaars kan dat betekenen dat er na de spraakherkenning minder nabewerking nodig is. Voor gebruikers kan dicteren daardoor minder voelen als zorgvuldig tegen een machine praten en meer als een ruwe eerste versie aan een redacteur geven.
De belangrijkste vraag is dus niet langer alleen of het model schonere tekst kan maken. Het gaat erom of een toepassing behoefte heeft aan schone tekst — of aan een exact verslag van wat iemand zei.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.5 Transcribe is Googles nieuwe spraak naar tekstmodel en opvolger van Chirp 3.
Gemini 3.5 Transcribe is Googles nieuwe spraak naar tekstmodel en opvolger van Chirp 3. Het model verwijdert stopwoordjes, verwerkt zelfcorrecties, voegt interpunctie en opmaak toe, ondersteunt aangepaste woordenlijsten en detecteert automatisch meer dan 85 talen.
Ontwikkelaars kunnen kiezen tussen realtime audio en vooraf opgenomen bestanden.