Microsofts tre nye MAI modeller dekker både talegjenkjenning og taleproduksjon. Transcribe 2 Streaming støtter 60 språk, og har ifølge rapportering fått førsteplass på en benchmark for transkripsjonsnøyaktighet.
Publisert avRedigert med GPT-6 LunaBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsofts tre nye MAI-modeller dekker begge retninger i en muntlig samtale: MAI-Transcribe-2-Streaming gjør tale om til tekst mens den pågår, mens MAI-Voice-2.1 og MAI-Voice-2.1-Flash lager tale fra tekst. Modellene er laget for utviklere som bygger stemmeagenter, og er tilgjengelige i offentlig forhåndsvisning gjennom Microsoft Foundry. 36
39
| Modell | Hovedoppgave | Rapportert språkstøtte | Oppgitt pris |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Løpende tale-til-tekst med oppdateringer underveis | 60 språk, med automatisk språkregistrering | 0,54 dollar per lydtime, introduksjonspris ut 2026 |
| MAI-Voice-2.1 | Tekst-til-tale med vekt på uttrykk | 23 språk | 22 dollar per million tegn |
| MAI-Voice-2.1-Flash | Raskere tekst-til-tale for apper der responstid er viktig | 23 språk oppgis for stemmemodellene | 15 dollar per million tegn |
Dette er rapporterte priser og opplysninger om tilgjengelighet, ikke noen garanti for at vilkårene forblir uendret. Prisen på transkripsjonsmodellen er uttrykkelig omtalt som en introduksjonspris. 4
35
I stedet for å vente til noen er ferdig med å snakke, sender MAI-Transcribe-2-Streaming ut tekstoppdateringer mens lyden kommer inn. Modellen tar imot kontinuerlig lyd via WebSocket og skal automatisk kunne registrere hvilket av 60 språk som snakkes, ifølge omtalen av modelloppføringen. 1
Rapportene oppgir ulike tall for forsinkelsen. Én omtale sier at modellen kan begynne å vise foreløpige resultater litt over 100 millisekunder etter at den mottar lyd. En annen oppgir at ord kan begynne å vises omtrent 320 millisekunder etter at de er sagt. Siden målingene tar utgangspunkt i ulike tidspunkter, kan tallene ikke sammenlignes direkte. 2
4
I Artificial Analysis’ benchmark for strømmende talegjenkjenning skal modellen ha debutert på førsteplass for nøyaktighet. Én rapport oppgir en endelig ordfeilrate på 2,5 prosent blant 38 modeller. Det er et rapportert benchmark-resultat, ikke en garanti for samme nøyaktighet på alle språk, i alle opptakssituasjoner eller i alle apper. 34
Introduksjonsprisen er oppgitt til 0,54 dollar per lydtime ut 2026. Utviklere som vurderer modellen, bør ta høyde for at dette er en tidsbegrenset pris. 4
35
Begge stemmemodellene gjør tekst om til lyd, men er ment for ulike behov. MAI-Voice-2.1 beskrives som det mer uttrykksfulle alternativet. Flash er den raskere varianten, for løsninger der det er viktig å holde ventetiden mellom samtaleturer kort. Språkstøtten oppgis til 23 språk for stemmemodellene. 6
35
36
Oppføringer av modellene oppgir en pris på 22 dollar per million tegn for MAI-Voice-2.1 og 15 dollar per million tegn for Flash. En rapport oppgir også at Flash kan lage 45 sekunder med lyd med 150 millisekunders forsinkelse. Dette bør leses som et rapportert tall, ikke som et mål på responstiden i enhver løsning fra start til slutt. 35
36
Rapportene som er tilgjengelige, gir ikke en offentlig benchmark-score for stemmekvalitet som kan sammenlignes direkte. Transkripsjonsmodellens plassering på en nøyaktighetsbenchmark sier derfor ikke noe om hvilken av de to stemmemodellene som presterer best. 32
34
Alle tre modellene er rapportert tilgjengelige i offentlig forhåndsvisning gjennom Microsoft Foundry. En forhåndsvisning lar utviklere teste modellene, men betyr ikke at de er generelt tilgjengelige. 36
For utviklere er hovednyheten at Microsoft nå tilbyr egne komponenter både for talegjenkjenning og taleproduksjon i en arbeidsflyt for stemmeagenter. Det kan gjøre det enklere å bygge mer av taledelen innenfor Microsofts utviklerøkosystem og redusere behovet for å hente akkurat disse komponentene fra andre leverandører. Men lanseringen viser ikke at en komplett stemmeagent kan klare seg uten eksterne tjenester: resonnering, koordinering og andre funksjoner kan fortsatt bygge på andre modeller eller tjenester. 6
39
Det tydeligste sammenligningsgrunnlaget gjelder transkripsjonsmodellen: Den støtter 60 språk, leverer tekst fortløpende og skal ha fått førsteplass i Artificial Analysis’ benchmark for nøyaktighet. En rapport oppgir også en endelig ordfeilrate på 2,5 prosent. De to stemmemodellene gir et valg mellom mer uttrykksfull tale og høyere hastighet, med rapportert støtte for 23 språk og ulike priser per tegn. Før en produksjonsbeslutning bør utviklere sjekke gjeldende tilgang, priser og responstid i oppsettet de faktisk skal bruke. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Microsofts tre nye MAI modeller dekker både talegjenkjenning og taleproduksjon. Transcribe 2 Streaming støtter 60 språk, og har ifølge rapportering fått førsteplass på en benchmark for transkripsjonsnøyaktighet.
Microsofts tre nye MAI modeller dekker både talegjenkjenning og taleproduksjon. Transcribe 2 Streaming støtter 60 språk, og har ifølge rapportering fått førsteplass på en benchmark for transkripsjonsnøyaktighet. Strømmemodellen oppdaterer transkripsjonen mens noen snakker. Rapporter oppgir ulik responstid: litt over 100 millisekunder fra lyd mottas til de første resultatene, eller rundt 320 millisekunder fra ordene blir sagt.
Voice 2.1 er rettet mot mer uttrykksfull tale, mens Flash prioriterer hastighet.