Microsofts tre modeller dækker både talegenkendelse og talegenerering: MAI Transcribe 2 Streaming understøtter 60 sprog, mens de to stemmemodeller angives at dække 23. Transskriptionsmodellen sender tekst løbende, mens nogen taler.
Udgivet afRedigeret med GPT-6 LunaBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsofts tre nye MAI-modeller dækker begge ender af en mundtlig samtale: MAI-Transcribe-2-Streaming laver løbende tale om til tekst, mens MAI-Voice-2.1 og MAI-Voice-2.1-Flash omdanner tekst til tale. Modellerne er udviklet til blandt andet stemmeassistenter og kan prøves i offentlig forhåndsvisning via Microsoft Foundry. 36
39
| Model | Hovedfunktion | Rapporteret sprogunderstøttelse | Rapporteret pris |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Løbende talegenkendelse med tekst, der opdateres undervejs | 60 sprog med automatisk sproggenkendelse | 0,54 USD pr. lydtime – introduktionspris frem til udgangen af 2026 |
| MAI-Voice-2.1 | Tekst-til-tale med fokus på udtryksfuld tale | 23 sprog | 22 USD pr. million tegn |
| MAI-Voice-2.1-Flash | Hurtigere tekst-til-tale til situationer, hvor svartid er vigtig | 23 sprog angivet for stemmemodellerne | 15 USD pr. million tegn |
Priserne er rapporterede listepriser, ikke en garanti for, at pris eller tilgængelighed forbliver uændret. Transskriptionsprisen er specifikt beskrevet som en introduktionspris. 4
35
I stedet for at vente på, at en person taler færdig, sender MAI-Transcribe-2-Streaming transskriptionsresultater løbende. Modellen modtager kontinuerlig lyd via WebSocket og kan ifølge omtalen af dens modeloversigt automatisk genkende mellem 60 sprog. 1
De rapporterede latenstider er ikke helt sammenlignelige. Én omtale siger, at modellen kan begynde at levere foreløbige resultater lidt over 100 millisekunder efter, at den modtager lyd. En anden angiver, at ord kan dukke op cirka 320 millisekunder efter, de er blevet sagt. Da målingerne tager udgangspunkt i forskellige tidspunkter, bør tallene ikke læses som en direkte sammenligning. 2
4
På Artificial Analysis’ benchmark for streamingtransskription debuterede modellen ifølge rapporter som nummer ét på nøjagtighed. En omtale angiver en endelig word error rate – fejlrate for genkendte ord – på 2,5 procent blandt 38 modeller. Det er et rapporteret benchmarkresultat, ikke en garanti for samme præcision på alle sprog, i alle optagelsesforhold eller i alle produkter. 34
Den oplyste introduktionspris er 0,54 USD pr. lydtime frem til udgangen af 2026. Udviklere, der afprøver modellen, bør derfor være opmærksomme på, at prisen er tidsbegrænset. 4
35
Begge stemmemodeller omdanner tekst til tale, men de er målrettet forskellige behov. MAI-Voice-2.1 beskrives som den mere udtryksfulde mulighed, mens Flash er den hurtigere variant til anvendelser, hvor det er vigtigt at holde ventetiden mellem samtaleturene nede. De rapporterede sprogoplysninger angiver 23 sprog for stemmemodellerne. 6
35
36
De rapporterede priser er 22 USD pr. million tegn for MAI-Voice-2.1 og 15 USD pr. million tegn for Flash. En omtale beskriver Flash som i stand til at generere 45 sekunders lyd med 150 millisekunders latenstid. Det bør læses som et rapporteret tal – ikke som et mål for den samlede svartid i enhver løsning. 35
36
De tilgængelige rapporter giver ikke en direkte sammenlignelig, offentlig benchmarkscore for stemmekvaliteten. Transskriptionsmodellens placering på et nøjagtighedsbenchmark siger derfor ikke noget om, hvordan de to modeller til talegenerering klarer sig i forhold til hinanden. 32
34
Alle tre modeller er ifølge rapporterne tilgængelige i offentlig forhåndsvisning via Microsoft Foundry. Det giver udviklere mulighed for at afprøve dem, men er ikke det samme som en melding om, at de er generelt tilgængelige. 36
Den praktiske nyhed for udviklere er, at Microsoft nu tilbyder egne komponenter til både talegenkendelse og talegenerering i et stemmebaseret arbejdsforløb. Det kan gøre det lettere at bygge flere af talefunktionerne inden for Microsofts udviklerøkosystem og mindske behovet for at hente netop disse komponenter hos andre leverandører. Det betyder dog ikke, at en komplet stemmeassistent kan undvære eksterne tjenester: ræsonnement, koordinering og andre funktioner kan fortsat kræve andre modeller eller tjenester. 6
39
Den tydeligste sammenligning gælder transskriptionsmodellen: Den understøtter 60 sprog, leverer tekst løbende og har ifølge rapporter opnået førstepladsen på Artificial Analysis’ nøjagtighedsbenchmark med en angivet endelig word error rate på 2,5 procent. De to stemmemodeller giver et valg mellem mere udtryksfuld tale og højere hastighed, med rapporteret understøttelse af 23 sprog og forskellige priser pr. tegn. Udviklere bør kontrollere den aktuelle adgang, pris og latenstid i deres egen opsætning, før de træffer beslutninger om brug i produktion. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Microsofts tre modeller dækker både talegenkendelse og talegenerering: MAI Transcribe 2 Streaming understøtter 60 sprog, mens de to stemmemodeller angives at dække 23.
Microsofts tre modeller dækker både talegenkendelse og talegenerering: MAI Transcribe 2 Streaming understøtter 60 sprog, mens de to stemmemodeller angives at dække 23. Transskriptionsmodellen sender tekst løbende, mens nogen taler. Rapporter angiver forskellige latenstider, fordi de måler fra forskellige tidspunkter.
Modellerne er tilgængelige i offentlig forhåndsvisning via Microsoft Foundry. De giver udviklere taleværktøjer, men erstatter ikke nødvendigvis andre modeller til ræsonnement og resten af en stemmeassistent.