Microsofts drie MAI modellen combineren streamingtranscriptie in 60 talen met twee modellen die tekst omzetten in spraak. De transcriptiedienst geeft tussentijdse resultaten terwijl iemand praat.
Gepubliceerd doorBewerkt met GPT-6 LunaAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoft heeft drie nieuwe MAI-modellen aangekondigd voor ontwikkelaars die toepassingen bouwen waarmee mensen via spraak kunnen communiceren. MAI-Transcribe-2-Streaming zet live spraak om in tekst en geeft tussentijdse transcripties door. MAI-Voice-2.1 en MAI-Voice-2.1-Flash doen het omgekeerde: ze zetten tekst om in gesproken audio. De modellen zijn beschikbaar als publieke preview via Microsoft Foundry. 36
39
| Model | Waarvoor bedoeld? | Taalondersteuning volgens de berichtgeving | Vermelde prijs |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Live spraak omzetten in tekst, met tussentijdse updates | 60 talen, met automatische taaldetectie | 0,54 dollar per audio-uur; introductietarief tot eind 2026 |
| MAI-Voice-2.1 | Expressieve tekst-naar-spraak | 23 talen | 22 dollar per miljoen tekens |
| MAI-Voice-2.1-Flash | Snellere tekst-naar-spraak voor toepassingen waarbij reactiesnelheid belangrijk is | 23 talen voor de spraakmodellen |
15 dollar per miljoen tekens |
Dit zijn vermelde prijzen en beschikbaarheidsgegevens; ze zijn geen garantie dat die ongewijzigd blijven. Microsofts tarief voor transcriptie wordt uitdrukkelijk als introductieprijs omschreven. 4
35
Een transcriptiesysteem wacht vaak tot iemand is uitgesproken voordat het de tekst terugstuurt. MAI-Transcribe-2-Streaming is bedoeld om al tijdens het spreken updates te geven. Het model ontvangt doorlopende audio via een WebSocket-verbinding en herkent volgens berichtgeving automatisch welke van 60 talen wordt gesproken. 1
De genoemde latentie verschilt per bericht en meetmethode. Eén bron meldt dat het model iets meer dan 100 milliseconden na ontvangst van audio voorlopige resultaten kan geven. Een andere zegt dat woorden ongeveer 320 milliseconden nadat ze zijn uitgesproken kunnen verschijnen. Omdat de metingen vanaf verschillende momenten lijken te beginnen, zijn ze niet rechtstreeks met elkaar te vergelijken. 2
4
Op de benchmark voor streamingtranscriptie van Artificial Analysis zou het model bij introductie bovenaan hebben gestaan voor nauwkeurigheid. Een bericht noemt een uiteindelijke word error rate van 2,5 procent, gemeten bij 38 modellen. Dat is een gerapporteerde benchmarkuitkomst, geen garantie voor elk accent, elke taal, opnamekwaliteit of toepassing. 34
De genoemde introductieprijs is 0,54 dollar per uur audio tot eind 2026. Ontwikkelaars die het model testen, moeten er dus rekening mee houden dat dit een tijdelijk tarief is. 4
35
Beide spraakmodellen zetten tekst om in audio, maar leggen volgens de berichtgeving een ander accent. MAI-Voice-2.1 is gericht op expressieve spraak; Flash is de snellere variant voor toepassingen waarbij een korte wachttijd tussen gespreksbeurten belangrijk is. Voor de spraakmodellen wordt ondersteuning voor 23 talen genoemd. 6
35
36
De vermelde prijs is 22 dollar per miljoen tekens voor MAI-Voice-2.1 en 15 dollar per miljoen tekens voor MAI-Voice-2.1-Flash. Een bericht meldt dat Flash 45 seconden audio kan genereren met een latentie van 150 milliseconden. Zie dat als een gerapporteerd cijfer, niet als een universele maat voor de totale responstijd in elke toepassing. 35
36
In de beschikbare berichtgeving staat geen rechtstreeks vergelijkbare openbare benchmarkscore voor de stemkwaliteit. De hoge benchmarkpositie van het transcriptiemodel zegt dus niets over de onderlinge kwaliteit van de twee modellen die spraak genereren. 32
34
Alle drie de modellen zijn volgens de berichtgeving beschikbaar als publieke preview in Microsoft Foundry. Dat biedt ontwikkelaars de mogelijkheid om ze uit te proberen, maar betekent niet automatisch dat ze algemeen beschikbaar zijn. 36
De praktische inzet is duidelijk: Microsoft biedt nu eigen onderdelen voor zowel spraakherkenning als spraakgeneratie, bedoeld voor een workflow rond spraakassistenten. Daardoor kunnen ontwikkelaars meer van de spraaklaag binnen Microsofts ontwikkelomgeving bouwen en hoeven ze voor die specifieke onderdelen mogelijk niet elders aan te kloppen. Dat betekent niet dat een volledige spraakassistent zonder andere aanbieders kan: voor redeneren, orkestratie en andere functies kunnen nog steeds andere modellen of diensten nodig zijn. 6
39
MAI-Transcribe-2-Streaming is het model met de duidelijkste vergelijkingspunten: het ondersteunt 60 talen, geeft tussentijdse transcripties en zou volgens berichtgeving bovenaan staan in een Artificial Analysis-benchmark, met een uiteindelijke word error rate van 2,5 procent. De twee spraakmodellen bieden een keuze tussen expressiviteit en snelheid, ondersteunen volgens de vermelde gegevens 23 talen en hebben verschillende prijzen per miljoen tekens. Controleer vóór een productiekeuze de actuele toegang, tarieven en latentie in de beoogde toepassing. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Microsofts drie MAI modellen combineren streamingtranscriptie in 60 talen met twee modellen die tekst omzetten in spraak.
Microsofts drie MAI modellen combineren streamingtranscriptie in 60 talen met twee modellen die tekst omzetten in spraak. De transcriptiedienst geeft tussentijdse resultaten terwijl iemand praat. Berichten noemen verschillende latencymetingen: iets meer dan 100 milliseconden na ontvangst van audio of circa 320 milliseconden nadat woorden...
De twee spraakmodellen zijn volgens de beschikbare informatie geschikt voor 23 talen.