MAI Transcribe 2 Streaming převádí řeč na text průběžně, podporuje 60 jazyků a jeho přesnost se podle zveřejněných výsledků umístila na prvním místě v benchmarku Artificial Analysis. Dva modely pro převod textu na řeč cílí na různé potřeby: MAI Voice 2.1 na expresivnější projev, varianta Flash na rychlost.
PublikovalUpraveno pomocí GPT-6 LunaObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoft představil tři modely MAI určené vývojářům hlasových asistentů: MAI-Transcribe-2-Streaming převádí živou řeč na text a MAI-Voice-2.1 s variantou MAI-Voice-2.1-Flash převádějí text na mluvené slovo. Všechny tři jsou dostupné ve veřejném preview v Microsoft Foundry. 36
39
| Model | K čemu slouží | Uváděná podpora jazyků | Uváděná cena |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Průběžný přepis řeči v reálném čase | 60 jazyků, automatické rozpoznání jazyka | 0,54 USD za hodinu zvuku; úvodní cena platí do konce roku 2026 |
| MAI-Voice-2.1 | Expresivní převod textu na řeč | 23 jazyků | 22 USD za milion znaků |
| MAI-Voice-2.1-Flash | Rychlejší převod textu na řeč pro aplikace citlivé na prodlevu | 23 jazyků podle dostupných údajů o hlasových modelech | 15 USD za milion znaků |
Jde o uváděné ceny a dostupnost, které se mohou změnit. Zvlášť u přepisu Microsoft označuje sazbu 0,54 USD za zaváděcí. 4
35
MAI-Transcribe-2-Streaming nečeká, až člověk domluví. Přijímá nepřetržitý zvuk přes WebSocket a průběžně posílá dílčí přepis, který následně potvrzuje jako finální segment. Podle dostupných informací automaticky rozpoznává jazyk z nabídky 60 jazyků. 1
Uváděné časy odezvy se v jednotlivých zprávách liší. Jeden zdroj píše o prvních částečných výsledcích něco málo přes 100 milisekund po přijetí zvuku, jiný uvádí, že se slova mohou začít zobrazovat přibližně 320 milisekund poté, co zaznějí. Protože údaje vycházejí z odlišných výchozích okamžiků, nejde o přímé srovnání stejné metriky. 2
4
V benchmarku streamovaného přepisu od Artificial Analysis se model podle zveřejněných zpráv při uvedení umístil na prvním místě v přesnosti. Jeden z přehledů uvádí konečnou chybovost přepisu (WER) 2,5 % při srovnání 38 modelů. Jde o výsledek konkrétního testu, nikoli o záruku stejné přesnosti pro každý jazyk, nahrávku nebo způsob použití. 34
Úvodní cena je 0,54 USD za hodinu zvuku a má platit do konce roku 2026. Vývojáři by proto při odhadu provozních nákladů měli počítat s tím, že jde o časově omezenou sazbu. 4
35
Oba hlasové modely mění text na mluvené audio, ale každý klade důraz na něco jiného. MAI-Voice-2.1 je popisován jako expresivnější varianta, zatímco Flash cílí na rychlejší reakce tam, kde záleží na krátké prodlevě mezi jednotlivými replikami. U hlasových modelů se uvádí podpora 23 jazyků. 6
35
36
Uváděná cena MAI-Voice-2.1 je 22 USD za milion znaků, u Flash 15 USD za milion znaků. Jeden zdroj u varianty Flash navíc uvádí vytvoření 45 sekund zvuku s latencí 150 milisekund. Tento údaj je třeba chápat jako zveřejněnou hodnotu, nikoli jako univerzální měření celkové odezvy aplikace od začátku do konce. 35
36
Ve veřejně dostupných zprávách není pro kvalitu generovaného hlasu srovnatelný benchmarkový výsledek. První místo přepisovacího modelu v testu proto nelze považovat za hodnocení hlasových modelů. 32
34
Všechny tři modely jsou podle dostupných informací ve veřejném preview přes Microsoft Foundry. Preview umožňuje vývojářům modely testovat, ale samo o sobě neznamená, že už jsou obecně dostupné jako hotové produkty. 36
Pro vývojáře je podstatné, že Microsoft nabízí vlastní součásti pro rozpoznávání i generování řeči. V rámci svého vývojářského ekosystému tak může usnadnit sestavení hlasové vrstvy asistenta a omezit potřebu shánět právě tyto komponenty jinde. Neznamená to ale, že celý hlasový asistent obejde další poskytovatele: uvažování, koordinace a další funkce mohou stále využívat jiné modely nebo služby. 6
39
Nejkonkrétnější výsledky se týkají streamovaného přepisu: podpora 60 jazyků, průběžné zobrazování textu a uváděné první místo v přesnosti benchmarku Artificial Analysis spolu s konečnou chybovostí 2,5 %. U hlasové dvojice jde hlavně o volbu mezi expresivnějším projevem a rychlejší odezvou; uvádí se 23 jazyků a rozdílné ceny za milion znaků. Před nasazením do ostrého provozu je vhodné ověřit aktuální přístup, ceny i latenci v konkrétním nastavení. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MAI Transcribe 2 Streaming převádí řeč na text průběžně, podporuje 60 jazyků a jeho přesnost se podle zveřejněných výsledků umístila na prvním místě v benchmarku Artificial Analysis.
MAI Transcribe 2 Streaming převádí řeč na text průběžně, podporuje 60 jazyků a jeho přesnost se podle zveřejněných výsledků umístila na prvním místě v benchmarku Artificial Analysis. Dva modely pro převod textu na řeč cílí na různé potřeby: MAI Voice 2.1 na expresivnější projev, varianta Flash na rychlost.
Všechny tři modely jsou ve veřejném preview přes Microsoft Foundry. Mohou pokrýt hlasový vstup a výstup asistenta, samy však nenahrazují další služby potřebné například pro uvažování a koordinaci.