Microsoft के तीन नए MAI मॉडल में MAI Transcribe 2 Streaming लाइव बातचीत को टेक्स्ट में बदलता है; MAI Voice 2.1 और Flash टेक्स्ट से आवाज़ बनाते हैं। ट्रांसक्रिप्शन मॉडल 60 भाषाओं में काम करता है और Artificial Analysis बेंचमार्क पर 38 मॉडलों में पहले स्थान पर रहा—एक रिपोर्ट में इसकी अंतिम Word Error Rate 2.5% बताई गई...
प्रकाशितकर्ताGPT-6 Luna से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoft ने वॉइस एजेंट बनाने वाले डेवलपर्स के लिए तीन नए MAI स्पीच मॉडल पेश किए हैं। MAI-Transcribe-2-Streaming लाइव आवाज़ को बोलते समय ही टेक्स्ट में बदलता है, जबकि MAI-Voice-2.1 और MAI-Voice-2.1-Flash लिखे हुए टेक्स्ट से बोली जाने वाली आवाज़ बनाते हैं। तीनों Microsoft Foundry में पब्लिक प्रीव्यू के तौर पर उपलब्ध बताए गए हैं। 36
39
| मॉडल | मुख्य काम | रिपोर्ट की गई भाषा-क्षमता | रिपोर्टेड कीमत |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | लाइव आवाज़ को टेक्स्ट में बदलना; बोलते समय लगातार ट्रांसक्रिप्ट अपडेट देना | 60 भाषाएँ; भाषा की अपने-आप पहचान | प्रति ऑडियो घंटा $0.54; 2026 के अंत तक शुरुआती दर |
| MAI-Voice-2.1 | टेक्स्ट से अभिव्यक्तिपूर्ण आवाज़ बनाना | 23 भाषाएँ | प्रति दस लाख अक्षर $22 |
| MAI-Voice-2.1-Flash | तेज़ टेक्स्ट-टू-स्पीच, जहाँ कम इंतज़ार अहम हो | वॉइस मॉडल के लिए 23 भाषाएँ रिपोर्ट की गई हैं | प्रति दस लाख अक्षर $15 |
ये उपलब्ध रिपोर्टों में दी गई कीमतें हैं, स्थायी दर या हर जगह उपलब्धता की गारंटी नहीं। खास तौर पर ट्रांसक्रिप्शन मॉडल की कीमत को शुरुआती ऑफर बताया गया है। 4
35
कई ट्रांसक्रिप्शन सिस्टम वक्ता के रुकने या वाक्य पूरा करने के बाद ही टेक्स्ट दिखाते हैं। यह मॉडल इसके बजाय WebSocket के ज़रिये लगातार ऑडियो लेता है और भाषण जारी रहते हुए ट्रांसक्रिप्ट के हिस्से भेजता है। मॉडल की लिस्टिंग पर आधारित रिपोर्ट के मुताबिक, यह 60 भाषाओं में काम करता है और भाषा को अपने-आप पहचान सकता है। 1
इसकी लेटेंसी के बारे में रिपोर्टों में अलग-अलग आंकड़े दिए गए हैं। एक रिपोर्ट के अनुसार, ऑडियो मिलने के बाद शुरुआती अधूरे नतीजे 100 मिलीसेकंड से कुछ ही अधिक समय में आने लगते हैं; दूसरी रिपोर्ट कहती है कि बोले गए शब्द करीब 320 मिलीसेकंड में दिख सकते हैं। इन आंकड़ों में समय गिनने का शुरुआती बिंदु अलग है, इसलिए इन्हें एक ही कसौटी पर सीधे तुलना करना ठीक नहीं होगा। 2
4
Artificial Analysis के स्ट्रीमिंग ट्रांसक्रिप्शन बेंचमार्क पर मॉडल ने शुरुआत में पहला स्थान हासिल किया, ऐसा रिपोर्टों में बताया गया है। एक रिपोर्ट में 38 मॉडलों के बीच इसकी अंतिम Word Error Rate (WER) 2.5% दी गई है। यह बेंचमार्क का रिपोर्टेड नतीजा है—हर भाषा, रिकॉर्डिंग की स्थिति या इस्तेमाल में इतनी ही सटीकता की गारंटी नहीं। 34
रिपोर्टेड शुरुआती दर प्रति ऑडियो घंटा $0.54 है और यह 2026 के अंत तक लागू बताई गई है। मॉडल का मूल्यांकन करते समय डेवलपर्स को ध्यान रखना चाहिए कि यह सीमित अवधि की दर है। 4
35
दोनों वॉइस मॉडल लिखे हुए टेक्स्ट को बोले गए ऑडियो में बदलते हैं, लेकिन उनका ज़ोर अलग-अलग है। MAI-Voice-2.1 को अधिक अभिव्यक्तिपूर्ण विकल्प के रूप में पेश किया गया है; Flash उसका तेज़ संस्करण है, जिसे उन ऐप्स के लिए बनाया गया है जहाँ बातचीत के अगले जवाब तक इंतज़ार कम रखना अहम हो। वॉइस मॉडल के लिए 23 भाषाओं का समर्थन रिपोर्ट किया गया है। 6
35
36
उपलब्ध लिस्टिंग में MAI-Voice-2.1 की कीमत प्रति दस लाख अक्षर $22 और Flash की $15 बताई गई है। एक रिपोर्ट के अनुसार, Flash 150 मिलीसेकंड की लेटेंसी में 45 सेकंड का ऑडियो बना सकता है। इसे रिपोर्टेड आंकड़ा समझें—हर सेटअप में शुरू से अंत तक जवाब मिलने का समय इससे तय नहीं होता। 35
36
उपलब्ध रिपोर्टों में आवाज़ की गुणवत्ता के लिए ऐसा सार्वजनिक बेंचमार्क स्कोर नहीं है जिसकी सीधे तुलना की जा सके। इसलिए ट्रांसक्रिप्शन मॉडल की सटीकता रैंकिंग को इन दोनों आवाज़ बनाने वाले मॉडलों की रैंकिंग नहीं मानना चाहिए। 32
34
तीनों मॉडल Microsoft Foundry में पब्लिक प्रीव्यू में उपलब्ध बताए गए हैं। इसका मतलब है कि डेवलपर्स इन्हें आज़मा सकते हैं; यह अपने-आप में आम उपलब्धता (general availability) की घोषणा नहीं है। 36
डेवलपर्स के लिए अहम बात यह है कि Microsoft अब वॉइस एजेंट के काम आने वाले भाषण-पहचान और आवाज़-निर्माण के अपने घटक दे रहा है। इससे Microsoft के डेवलपर इकोसिस्टम में वॉइस अनुभव का बड़ा हिस्सा बनाना आसान हो सकता है और इन खास स्पीच घटकों के लिए दूसरे प्रदाताओं पर निर्भरता घट सकती है। लेकिन इससे यह साबित नहीं होता कि पूरा वॉइस एजेंट बाहरी सेवाओं के बिना चल सकता है—तर्क-विचार, कामों का समन्वय और दूसरी क्षमताओं के लिए अलग मॉडल या सेवाएँ अब भी लग सकती हैं। 6
39
इन तीनों में सबसे स्पष्ट तुलना ट्रांसक्रिप्शन मॉडल की है: यह 60 भाषाओं में काम करता है, बोलते समय अपडेट देता है और Artificial Analysis पर सटीकता के लिए पहले स्थान पर रहा—एक रिपोर्ट में इसकी अंतिम WER 2.5% बताई गई है। दोनों वॉइस मॉडल 23 भाषाओं के लिए रिपोर्ट किए गए हैं और डेवलपर्स को अभिव्यक्ति बनाम गति का विकल्प देते हैं; उनकी कीमत भी प्रति अक्षर अलग है। किसी प्रोडक्शन ऐप में इस्तेमाल से पहले अपने काम के अनुरूप प्रीव्यू की उपलब्धता, मौजूदा कीमत और लेटेंसी की पुष्टि करना बेहतर होगा। 1
34
35
36
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Microsoft के तीन नए MAI मॉडल में MAI Transcribe 2 Streaming लाइव बातचीत को टेक्स्ट में बदलता है; MAI Voice 2.1 और Flash टेक्स्ट से आवाज़ बनाते हैं।
Microsoft के तीन नए MAI मॉडल में MAI Transcribe 2 Streaming लाइव बातचीत को टेक्स्ट में बदलता है; MAI Voice 2.1 और Flash टेक्स्ट से आवाज़ बनाते हैं। ट्रांसक्रिप्शन मॉडल 60 भाषाओं में काम करता है और Artificial Analysis बेंचमार्क पर 38 मॉडलों में पहले स्थान पर रहा—एक रिपोर्ट में इसकी अंतिम Word Error Rate 2.5% बताई गई है।
रिपोर्टेड कीमतें: ट्रांसक्रिप्शन के लिए $0.54 प्रति ऑडियो घंटा (2026 के अंत तक शुरुआती दर), Voice 2.1 के लिए $22 और Flash के लिए $15 प्रति दस लाख अक्षर।