Microsofts tre nya MAI modeller omfattar strömmande transkribering på 60 språk och två modeller för talgenerering på 23 språk. Transkriberingsmodellen visar text löpande medan någon pratar.
Publicerad avRedigerad med GPT-6 LunaBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsofts tre nya MAI-modeller täcker båda riktningarna i ett talbaserat samtal: MAI-Transcribe-2-Streaming gör tal till text medan det sägs, och MAI-Voice-2.1 samt MAI-Voice-2.1-Flash gör text till tal. Modellerna är tänkta för utvecklare som bygger röststyrda AI-agenter och finns i offentlig förhandsversion via Microsoft Foundry. 36
39
| Modell | Huvudfunktion | Uppgivet språkstöd | Uppgivet pris |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Transkribering i realtid med löpande textuppdateringar | 60 språk, med automatisk språkidentifiering | 0,54 USD per ljudtimme, introduktionspris till och med 2026 |
| MAI-Voice-2.1 | Text-till-tal med fokus på uttrycksfullhet | 23 språk | 22 USD per miljon tecken |
| MAI-Voice-2.1-Flash | Snabbare text-till-tal för appar där kort väntetid är viktig | 23 språk uppges för röstmodellerna | 15 USD per miljon tecken |
Priserna är de som har rapporterats och ska inte ses som en garanti för framtida pris eller tillgänglighet. Särskilt transkriberingsmodellens pris beskrivs som ett introduktionserbjudande. 4
35
I stället för att vänta tills någon har pratat klart skickar MAI-Transcribe-2-Streaming ut textuppdateringar medan ljudet kommer in. Modellen tar emot kontinuerligt ljud via WebSocket och uppges automatiskt kunna identifiera vilket av 60 språk som talas. 1
Uppgifterna om svarstid varierar mellan rapporterna och mäter inte nödvändigtvis samma sak. En uppgift säger att modellen kan börja visa preliminära resultat drygt 100 millisekunder efter att ljudet tagits emot. En annan anger att ord kan börja visas ungefär 320 millisekunder efter att de har sagts. Eftersom mätningarna utgår från olika startpunkter är de inte direkt jämförbara. 2
4
Enligt rapporter placerade sig modellen högst för träffsäkerhet när den lanserades på Artificial Analysis test för strömmande taligenkänning. En rapport anger en slutlig felfrekvens på 2,5 procent för ord (WER) bland 38 modeller. Det är ett rapporterat testresultat – inte en garanti för samma träffsäkerhet i alla språk, ljudmiljöer eller användningsområden. 34
Det uppgivna introduktionspriset är 0,54 USD per ljudtimme till och med slutet av 2026. Utvecklare som utvärderar modellen bör ta höjd för att det är ett tidsbegränsat erbjudande. 4
35
Båda röstmodellerna omvandlar text till tal, men de är inriktade på olika behov. MAI-Voice-2.1 beskrivs som det mer uttrycksfulla alternativet. Flash är den snabbare versionen, för användningsområden där det är viktigt att minimera väntan mellan repliker. Röstmodellerna uppges stödja 23 språk. 6
35
36
De rapporterade priserna är 22 USD per miljon tecken för MAI-Voice-2.1 och 15 USD per miljon tecken för MAI-Voice-2.1-Flash. En rapport uppger också att Flash kan skapa 45 sekunders ljud med 150 millisekunders fördröjning. Se det som en rapporterad siffra, inte ett allmängiltigt mått på tiden från användarens fråga till färdigt svar. 35
36
De tillgängliga rapporterna ger ingen direkt jämförbar offentlig testpoäng för röstkvalitet. Transkriberingsmodellens placering i ett träffsäkerhetstest säger därför inget om hur de två modellerna för talgenerering står sig mot varandra. 32
34
Alla tre modellerna uppges finnas i offentlig förhandsversion via Microsoft Foundry. Det ger utvecklare möjlighet att prova dem, men är inte detsamma som att modellerna är allmänt tillgängliga i en färdig, slutlig version. 36
För utvecklare innebär lanseringen att Microsoft nu erbjuder egna komponenter för både taligenkänning och talgenerering i ett röstbaserat arbetsflöde. Det kan göra det enklare att bygga större delar av talfunktionen inom Microsofts utvecklarmiljö och minska behovet av att hämta just de komponenterna från andra leverantörer. Men det betyder inte att en komplett röstagent kan klara sig utan andra modeller eller tjänster: exempelvis resonemang och samordning kan fortfarande hanteras på andra håll. 6
39
Den tydligaste jämförelsen gäller transkribering: MAI-Transcribe-2-Streaming stöder 60 språk, skickar text medan talet pågår och uppges ha placerat sig högst i ett test av träffsäkerhet från Artificial Analysis. En rapport anger en slutlig ord-felfrekvens på 2,5 procent. De två röstmodellerna erbjuder i stället ett val mellan mer uttrycksfullt tal och högre hastighet, med uppgivet stöd för 23 språk och olika priser per tecken. Kontrollera aktuell tillgång, prissättning och svarstid i den miljö där modellen ska användas innan du fattar beslut om produktion. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Microsofts tre nya MAI modeller omfattar strömmande transkribering på 60 språk och två modeller för talgenerering på 23 språk.
Microsofts tre nya MAI modeller omfattar strömmande transkribering på 60 språk och två modeller för talgenerering på 23 språk. Transkriberingsmodellen visar text löpande medan någon pratar. Rapporter anger olika svarstider: drygt 100 millisekunder från att ljudet tas emot respektive omkring 320 millisekunder från att orden sägs.
Modellerna finns i offentlig förhandsversion via Microsoft Foundry. De ger utvecklare komponenter för tal in och tal ut, men ersätter inte automatiskt andra modeller för exempelvis resonemang.