Gemini 3.5 Transcribe er Googles nye tale til tekst modell og etterfølgeren til Chirp 3. Modellen er laget for å gjøre ufullkommen tale om til brukbar tekst ved å fjerne fyllord, ta hensyn til selvkorrigeringer, formatere innhold, bruke egendefinert vokabular og automatisk oppdage mer enn 85 språk.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google har lansert Gemini 3.5 Transcribe, en tale-til-tekst-modell som skal gjøre mer enn å gjengi lyd ord for ord. Målet er å forvandle uformell, avbrutt og ustrukturert tale til ryddig tekst som kan brukes i notater, meldinger, skjemaer og dokumenter. Google omtaler den som sin mest presise tale-til-tekst-modell hittil og presenterer den som et betydelig steg videre fra Chirp 3. 1 12
Det er en nyttig forskjell – men også en forskjell brukerne bør være klar over. Når modellen fjerner «eh» og «hm», innarbeider rettelser og tolker hva taleren forsøkte å si, kan resultatet bli bedre skrevet tekst. Samtidig kan deler av den nøyaktige ordlyden forsvinne.
Gemini 3.5 Transcribe bygger på det Google kaller intelligent transkripsjon. I stedet for å behandle hver nøling eller halvferdige setning som tekst som må stå urørt, kan modellen rydde opp i taleflyt, ta med talerens korrigering, sette inn tegnsetting og formatere resultatet. Den kan også utføre redigeringer etter stemmekommandoer og gjøre stikkordspreget tale om til mer lesbar prosa. 1 8 12
I praksis betyr det at du kan snakke mer som du ville gjort til et annet menneske, i stedet for å diktere langsomt og kontrollert. En rekke løse tanker eller et muntlig førsteutkast kan ende opp som en tekst som allerede ligner en ferdig melding, et dokument eller et svar i et nettskjema.
Modellen skal også kunne håndtere bakgrunnsstøy, tekniske uttrykk og spesialisert terminologi. Google sier at utviklere kan legge inn et eget vokabular, slik at navn, produktnavn og faguttrykk oftere blir skrevet på riktig måte. Den oppdager automatisk mer enn 85 språk. 1 7
Ved behandling av forhåndsinnspilt lyd oppgir Google dessuten tidsstempler og taleridentifikasjon for opptil tre personer. Det gjør det mulig å knytte bestemte deler av transkripsjonen til riktig deltaker. 1
Google beskriver Gemini 3.5 Transcribe som en klar forbedring sammenlignet med den tidligere Chirp 3-modellen. Målinger fra Artificial Analysis som er omtalt i flere rapporter, viser en ordfeilrate på 2,6 prosent for ikke-strømmende lyd og 4,0 prosent for strømmende lyd. Tiden frem til en ferdig transkripsjon skal samtidig være redusert med 70 prosent. 3 4 9
Tallene bør likevel ikke leses som en garanti for alle situasjoner. Ordfeilrate påvirkes blant annet av språk, aksent, opptakskvalitet, bakgrunnsstøy og hvilket testsett som brukes. Googles egne tall fra FLEURS-testen viser en ordfeilrate på 5,50 prosent i strømmemodus, og dette kan ikke sammenlignes direkte med alle tredjepartsmålinger fordi testbetingelsene er forskjellige. 1
Den praktiske konklusjonen er likevel tydelig: Google forsøker både å redusere forsinkelsen i direkte samtaler og å levere et renere sluttresultat for opptak og diktering.
Google skiller mellom bruk i sanntid og behandling av lyd som allerede er tatt opp.
Sanntidsalternativet er beregnet på apper som mottar en kontinuerlig lydstrøm og må svare raskt. Googles Live API støtter taleinteraksjoner med lav forsinkelse og kan transkribere både brukerens tale og modellens eget svar. 12 20
Det kan brukes i taleassistenter, direkteteksting, samtalegrensesnitt og andre løsninger som trenger tekst mens personen fortsatt snakker. API-dokumentasjonen skiller også mellom vanlige enkeltforespørsler, strømming og sanntidsinteraksjoner for Gemini-applikasjoner. 24
For lydfiler kan utviklere laste opp eller referere til et opptak og sende det inn gjennom Googles API-flyt. Denne metoden passer bedre når opptaket allerede finnes, og når tidsstempler, formatering, egendefinert vokabular og informasjon om hvem som snakker, er viktigere enn svar på brøkdelen av et sekund. 1 12 18
Googles bredere API-dokumentasjon anbefaler Interactions API som standardgrensesnitt for nye Gemini-applikasjoner. Live API er i stedet beregnet på kontinuerlige tale- og bildeopplevelser med lav forsinkelse. 19 20
Modellen er ikke bare en utviklerdemo. Ifølge rapporteringen driver den allerede Rambler, dikteringsfunksjonen i Gboard på Android, og brukes i Gemini-appen for macOS. 2 13 26
Google sier også at tale-til-tekst snart kommer til Chrome. Da skal brukere kunne diktere direkte i tekstfelt på nettet – for eksempel når de skriver meldinger, innlegg, skjemaer eller instruksjoner til en tjeneste – uten å måtte bruke en separat app. 1 8 13
Lanseringen skjer samtidig med Gemini 3.5 Live og Gemini 3.5 Live Experimental som del av Googles samlede Gemini Audio-satsing. Transcribe er rettet mot å gjøre tale om til tekst, mens Live-modellene først og fremst er laget for interaktive lydopplevelser. 12 26
Det som gjør Gemini 3.5 Transcribe nyttig, er også modellens viktigste begrensning. Når fyllord fjernes og selvkorrigeringer flettes inn i teksten, blir resultatet enklere å lese. Men avstanden mellom lydopptaket og transkripsjonen blir samtidig større.
En polert tekst kan utelate meningsfulle pauser, bare beholde den korrigerte versjonen av en setning eller glatte ut personlige særtrekk ved måten noen snakker på. Det er ofte en fordel når du dikterer en melding eller lager et førsteutkast. Det er langt mindre ønskelig når den eksakte formuleringen har betydning.
Ved intervjuer, juridisk eller medisinsk dokumentasjon, forskning, tilgjengelighetsarbeid eller sitater bør brukeren derfor beholde originalopptaket og kontrollere viktige passasjer. Med mindre en konkret løsning tilbyr en tydelig ordrett modus, bør Gemini 3.5 Transcribe forstås som et intelligent transkripsjonsverktøy som redigerer underveis – ikke som en nøytral lydopptaker på tekst.
Google flytter talegjenkjenning nærmere stemmestyrt skriving. Gemini 3.5 Transcribe kombinerer transkripsjon med opprydding, formatering, språkdeteksjon, tilpasset vokabular og informasjon om talere, samtidig som utviklere får separate arbeidsflyter for direkte tale og innspilte filer. 1 12
For utviklere kan dette bety mindre behov for etterbehandling etter at talen er gjenkjent. For brukerne kan diktering føles mindre som å snakke forsiktig til en maskin – og mer som å gi en grovskisse til en redaktør.
Det viktigste spørsmålet er derfor ikke bare om modellen kan lage renere tekst. Det er om appen trenger ren tekst – eller en nøyaktig oversikt over akkurat det som ble sagt.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.5 Transcribe er Googles nye tale til tekst modell og etterfølgeren til Chirp 3.
Gemini 3.5 Transcribe er Googles nye tale til tekst modell og etterfølgeren til Chirp 3. Modellen er laget for å gjøre ufullkommen tale om til brukbar tekst ved å fjerne fyllord, ta hensyn til selvkorrigeringer, formatere innhold, bruke egendefinert vokabular og automatisk oppdage mer enn 85 språk.
Utviklere får separate løsninger for sanntid og forhåndsinnspilt lyd. Teknologien brukes allerede i Gboards Rambler diktering og Gemini appen for macOS, mens støtte i Chrome er på vei.