Gemini 3.5 Transcribe er Googles nye tale til tekst model og en hurtigere efterfølger til Chirp 3. Modellen kan fjerne fyldord som »øh« og »hmm«, indarbejde selvrettelser, formatere tekst, håndtere baggrundsstøj og tekniske termer, bruge brugerdefinerede ordlister og automatisk registrere over 85 sprog.
Udgivet afRedigeret med GPT-5.6 LunaBilleder genereret med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google har lanceret Gemini 3.5 Transcribe, en tale-til-tekst-model, der skal gøre mere end blot at gengive en lydoptagelse ord for ord. Modellen er udviklet til at omdanne upræcis, afbrudt eller spontan tale til mere poleret og struktureret tekst – eksempelvis til diktering, noter, beskeder og stemmestyret redigering. Google kalder den sin hidtil mest præcise tale-til-tekst-model og placerer den som et markant skridt videre fra Chirp 3. 1
12
Det er en nyttig ændring, men også en vigtig forskel. Når et system fjerner »øh«, samler en sætning efter en rettelse og forsøger at forstå, hvad taleren mente, kan resultatet blive bedre at læse – samtidig med at det indeholder mindre af talerens præcise formulering.
Gemini 3.5 Transcribe bygger på det, Google kalder intelligent transskription. I stedet for at behandle enhver tøven eller afbrudt sætning som tekst, der skal bevares, kan modellen rydde op i talens fyldord, indarbejde en talers rettelse, sætte tegn og tilføje formatering. Den kan også reagere på stemmekommandoer til redigering og gøre spontan tale til mere sammenhængende prosa. 1
8
12
Det gør modellen særligt interessant til almindelig stemmeinput. Man kan tale i stikord eller halve sætninger og få et resultat, der ligger tættere på en færdig besked, et dokument eller et svar i en formular.
Modellen er desuden udviklet til at håndtere baggrundsstøj, tekniske termer og specialiseret ordforråd. Google oplyser, at brugere kan tilføje en brugerdefineret ordliste, så navne, produkter og fagudtryk i højere grad skrives med den ønskede stavemåde. Den registrerer automatisk mere end 85 sprog. 1
7
Ved forudindspillet lyd kan Google levere tidskoder og skelne mellem op til tre talere. Det giver udviklere mulighed for at knytte dele af en transskription til de enkelte deltagere. 1
Google præsenterer Gemini 3.5 Transcribe som en betydelig forbedring i forhold til den tidligere Chirp 3-model. Målinger omtalt med henvisning til Artificial Analysis angiver en fejlrate på 2,6 % for lyd uden streaming og 4,0 % for streaming. Samtidig skulle tiden frem til den endelige transskription være reduceret med 70 %. 3
4
9
Tallene bør dog ikke læses som en garanti for alle situationer. En såkaldt word error rate – fejlrate for ord – afhænger blandt andet af sprog, accent, optagekvalitet, baggrundsstøj og det datasæt, der testes på. Googles egne materialer fremhæver resultater fra FLEURS-benchmarken, hvor modellen opnåede en fejlrate på 5,50 % i streamingtilstand. Det tal kan ikke sammenlignes direkte med alle tredjepartsmålinger, fordi testbetingelserne er forskellige. 1
Den praktiske konklusion er dog tydelig: Google vil både sænke forsinkelsen i live-samtaler og levere et renere slutresultat ved optaget eller dikteret tale.
Google beskriver forskellige måder at bruge modellen på alt efter applikationens behov.
Live-løsningen er beregnet til tjenester, der modtager en konstant lydstrøm og skal reagere hurtigt. Googles Live API understøtter taleinteraktioner med lav forsinkelse i realtid og kan levere transskriptioner af både brugerens input og modellens svar. 12
20
Det kan bruges til stemmeassistenter, live-undertekster, samtalegrænseflader og andre applikationer, hvor teksten skal være tilgængelig, mens personen stadig taler. API-dokumentationen skelner desuden mellem enkeltstående kald, streaming og realtidsinteraktioner i Gemini-applikationer. 24
Ved optaget lyd kan udviklere uploade eller henvise til en lydfil og sende den gennem Geminis API-flow. Denne løsning passer bedre til eksisterende optagelser, hvor tidskoder, formatering, brugerdefinerede ord og taleridentifikation er vigtigere end svar på brøkdele af et sekund. 1
12
18
Googles bredere Gemini-dokumentation anbefaler Interactions API som standardgrænseflade til nye Gemini-applikationer. Live API er i stedet beregnet til kontinuerlige tale- og billedoplevelser med lav forsinkelse. 19
20
Gemini 3.5 Transcribe er ikke kun et udviklerforsøg i et lukket laboratorium. Ifølge rapporteringen driver modellen allerede Rambler, stemmedikteringsfunktionen i Android-tastaturet Gboard, og Gemini-appen til macOS. 2
13
26
Google oplyser også, at tale-til-tekst er på vej til Chrome. Den planlagte funktion skal gøre det muligt at diktere direkte i tekstfelter på nettet – blandt andet beskeder, opslag, formularer og prompts – i stedet for at begrænse stemmeinput til en bestemt app. 1
8
13
Modellen lanceres sammen med Gemini 3.5 Live og Gemini 3.5 Live Experimental som del af Googles bredere Gemini Audio-satsning. I den familie fokuserer Transcribe på at omdanne tale til tekst, mens Live-modellerne er rettet mod interaktive lydoplevelser. 12
26
Gemini 3.5 Transcribes største styrke er også den vigtigste begrænsning. Når fyldord fjernes, og selvrettelser flettes ind, bliver teksten lettere at læse. Men samtidig ændres forbindelsen mellem lydoptagelsen og transskriptionen.
Et poleret resultat kan udelade meningsfuld tøven, kun bevare den rettede version af en sætning eller udglatte en persons særlige talemåde. Det er ofte en fordel, når man dikterer en besked eller laver kladdenoter. Det er mindre ønskværdigt, når den præcise ordlyd er det vigtigste.
Ved interviews, juridiske eller medicinske journaler, forskning, tilgængelighedsdokumentation og citater bør brugere derfor gemme den originale lyd og kontrollere vigtige passager. Medmindre en konkret løsning tilbyder en tydelig ordret tilstand, bør Gemini 3.5 Transcribe forstås som en intelligent, redigerende transskriptionsmodel – ikke som en neutral optager, der blot skriver alt ned.
Googles lancering bringer talegenkendelse tættere på stemmeassisteret skrivning. Gemini 3.5 Transcribe kombinerer transskription med oprydning, formatering, sproggenkendelse, tilpasning af ordforråd og oplysninger om talere. Samtidig tilbyder den separate arbejdsgange til live- og optaget lyd. 1
12
For udviklere kan det betyde mindre efterbehandling, når talen først er genkendt. For brugere kan diktering komme til at føles mindre som at tale meget tydeligt til en maskine og mere som at give en rå kladde til en redaktør.
Det centrale spørgsmål er derfor ikke kun, om modellen kan lave renere tekst. Det er, om den enkelte opgave kræver ren tekst – eller en helt nøjagtig gengivelse af det, der blev sagt.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.5 Transcribe er Googles nye tale til tekst model og en hurtigere efterfølger til Chirp 3.
Gemini 3.5 Transcribe er Googles nye tale til tekst model og en hurtigere efterfølger til Chirp 3. Modellen kan fjerne fyldord som »øh« og »hmm«, indarbejde selvrettelser, formatere tekst, håndtere baggrundsstøj og tekniske termer, bruge brugerdefinerede ordlister og automatisk registrere over 85 sprog.
Udviklere får separate arbejdsgange til direkte lyd og forudindspillede filer. Teknologien bruges allerede i Gboards Rambler diktering og Gemini appen til macOS, mens Google planlægger understøttelse i Chrome.
Gemini 3.5 Transcribe er Googles nye tale til tekst model og en hurtigere efterfølger til Chirp 3. Modellen kan fjerne fyldord som »øh« og »hmm«, indarbejde selvrettelser, formatere tekst, håndtere baggrundsstøj og tekniske termer, bruge brugerdefinerede ordlister og automatisk registrere over 85 sprog.
Udgivet afRedigeret med GPT-5.6 LunaBilleder genereret med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google har lanceret Gemini 3.5 Transcribe, en tale-til-tekst-model, der skal gøre mere end blot at gengive en lydoptagelse ord for ord. Modellen er udviklet til at omdanne upræcis, afbrudt eller spontan tale til mere poleret og struktureret tekst – eksempelvis til diktering, noter, beskeder og stemmestyret redigering. Google kalder den sin hidtil mest præcise tale-til-tekst-model og placerer den som et markant skridt videre fra Chirp 3. 1
12
Det er en nyttig ændring, men også en vigtig forskel. Når et system fjerner »øh«, samler en sætning efter en rettelse og forsøger at forstå, hvad taleren mente, kan resultatet blive bedre at læse – samtidig med at det indeholder mindre af talerens præcise formulering.
Gemini 3.5 Transcribe bygger på det, Google kalder intelligent transskription. I stedet for at behandle enhver tøven eller afbrudt sætning som tekst, der skal bevares, kan modellen rydde op i talens fyldord, indarbejde en talers rettelse, sætte tegn og tilføje formatering. Den kan også reagere på stemmekommandoer til redigering og gøre spontan tale til mere sammenhængende prosa. 1
8
12
Det gør modellen særligt interessant til almindelig stemmeinput. Man kan tale i stikord eller halve sætninger og få et resultat, der ligger tættere på en færdig besked, et dokument eller et svar i en formular.
Modellen er desuden udviklet til at håndtere baggrundsstøj, tekniske termer og specialiseret ordforråd. Google oplyser, at brugere kan tilføje en brugerdefineret ordliste, så navne, produkter og fagudtryk i højere grad skrives med den ønskede stavemåde. Den registrerer automatisk mere end 85 sprog. 1
7
Ved forudindspillet lyd kan Google levere tidskoder og skelne mellem op til tre talere. Det giver udviklere mulighed for at knytte dele af en transskription til de enkelte deltagere. 1
Google præsenterer Gemini 3.5 Transcribe som en betydelig forbedring i forhold til den tidligere Chirp 3-model. Målinger omtalt med henvisning til Artificial Analysis angiver en fejlrate på 2,6 % for lyd uden streaming og 4,0 % for streaming. Samtidig skulle tiden frem til den endelige transskription være reduceret med 70 %. 3
4
9
Tallene bør dog ikke læses som en garanti for alle situationer. En såkaldt word error rate – fejlrate for ord – afhænger blandt andet af sprog, accent, optagekvalitet, baggrundsstøj og det datasæt, der testes på. Googles egne materialer fremhæver resultater fra FLEURS-benchmarken, hvor modellen opnåede en fejlrate på 5,50 % i streamingtilstand. Det tal kan ikke sammenlignes direkte med alle tredjepartsmålinger, fordi testbetingelserne er forskellige. 1
Den praktiske konklusion er dog tydelig: Google vil både sænke forsinkelsen i live-samtaler og levere et renere slutresultat ved optaget eller dikteret tale.
Google beskriver forskellige måder at bruge modellen på alt efter applikationens behov.
Live-løsningen er beregnet til tjenester, der modtager en konstant lydstrøm og skal reagere hurtigt. Googles Live API understøtter taleinteraktioner med lav forsinkelse i realtid og kan levere transskriptioner af både brugerens input og modellens svar. 12
20
Det kan bruges til stemmeassistenter, live-undertekster, samtalegrænseflader og andre applikationer, hvor teksten skal være tilgængelig, mens personen stadig taler. API-dokumentationen skelner desuden mellem enkeltstående kald, streaming og realtidsinteraktioner i Gemini-applikationer. 24
Ved optaget lyd kan udviklere uploade eller henvise til en lydfil og sende den gennem Geminis API-flow. Denne løsning passer bedre til eksisterende optagelser, hvor tidskoder, formatering, brugerdefinerede ord og taleridentifikation er vigtigere end svar på brøkdele af et sekund. 1
12
18
Googles bredere Gemini-dokumentation anbefaler Interactions API som standardgrænseflade til nye Gemini-applikationer. Live API er i stedet beregnet til kontinuerlige tale- og billedoplevelser med lav forsinkelse. 19
20
Gemini 3.5 Transcribe er ikke kun et udviklerforsøg i et lukket laboratorium. Ifølge rapporteringen driver modellen allerede Rambler, stemmedikteringsfunktionen i Android-tastaturet Gboard, og Gemini-appen til macOS. 2
13
26
Google oplyser også, at tale-til-tekst er på vej til Chrome. Den planlagte funktion skal gøre det muligt at diktere direkte i tekstfelter på nettet – blandt andet beskeder, opslag, formularer og prompts – i stedet for at begrænse stemmeinput til en bestemt app. 1
8
13
Modellen lanceres sammen med Gemini 3.5 Live og Gemini 3.5 Live Experimental som del af Googles bredere Gemini Audio-satsning. I den familie fokuserer Transcribe på at omdanne tale til tekst, mens Live-modellerne er rettet mod interaktive lydoplevelser. 12
26
Gemini 3.5 Transcribes største styrke er også den vigtigste begrænsning. Når fyldord fjernes, og selvrettelser flettes ind, bliver teksten lettere at læse. Men samtidig ændres forbindelsen mellem lydoptagelsen og transskriptionen.
Et poleret resultat kan udelade meningsfuld tøven, kun bevare den rettede version af en sætning eller udglatte en persons særlige talemåde. Det er ofte en fordel, når man dikterer en besked eller laver kladdenoter. Det er mindre ønskværdigt, når den præcise ordlyd er det vigtigste.
Ved interviews, juridiske eller medicinske journaler, forskning, tilgængelighedsdokumentation og citater bør brugere derfor gemme den originale lyd og kontrollere vigtige passager. Medmindre en konkret løsning tilbyder en tydelig ordret tilstand, bør Gemini 3.5 Transcribe forstås som en intelligent, redigerende transskriptionsmodel – ikke som en neutral optager, der blot skriver alt ned.
Googles lancering bringer talegenkendelse tættere på stemmeassisteret skrivning. Gemini 3.5 Transcribe kombinerer transskription med oprydning, formatering, sproggenkendelse, tilpasning af ordforråd og oplysninger om talere. Samtidig tilbyder den separate arbejdsgange til live- og optaget lyd. 1
12
For udviklere kan det betyde mindre efterbehandling, når talen først er genkendt. For brugere kan diktering komme til at føles mindre som at tale meget tydeligt til en maskine og mere som at give en rå kladde til en redaktør.
Det centrale spørgsmål er derfor ikke kun, om modellen kan lave renere tekst. Det er, om den enkelte opgave kræver ren tekst – eller en helt nøjagtig gengivelse af det, der blev sagt.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.5 Transcribe er Googles nye tale til tekst model og en hurtigere efterfølger til Chirp 3.
Gemini 3.5 Transcribe er Googles nye tale til tekst model og en hurtigere efterfølger til Chirp 3. Modellen kan fjerne fyldord som »øh« og »hmm«, indarbejde selvrettelser, formatere tekst, håndtere baggrundsstøj og tekniske termer, bruge brugerdefinerede ordlister og automatisk registrere over 85 sprog.
Udviklere får separate arbejdsgange til direkte lyd og forudindspillede filer. Teknologien bruges allerede i Gboards Rambler diktering og Gemini appen til macOS, mens Google planlægger understøttelse i Chrome.