نماذج MAI الجديدة من مايكروسوفت: تحويل الكلام إلى نص وصوت مولّد
تضم المجموعة نموذجًا للتفريغ النصي المباشر يدعم 60 لغة، ونموذجين لتحويل النص إلى كلام يدعمان 23 لغة بحسب التقارير. يحدّث MAI Transcribe 2 Streaming النص أثناء وصول الصوت.
نشر بواسطةتم التحرير باستخدام GPT-6 Lunaتم إنشاء الصور باستخدام GPT Image 2
تضم المجموعة نموذجًا للتفريغ النصي المباشر يدعم 60 لغة، ونموذجين لتحويل النص إلى كلام يدعمان 23 لغة بحسب التقارير.
يحدّث MAI Transcribe 2 Streaming النص أثناء وصول الصوت. وتختلف الأرقام المنشورة لزمن الاستجابة بحسب نقطة القياس المستخدمة.
تبدأ الأسعار المعلنة من 0.54 دولار لكل ساعة صوت للتفريغ، و15 أو 22 دولارًا لكل مليون حرف لتوليد الكلام؛ وسعر التفريغ تمهيدي حتى نهاية 2026.
النماذج متاحة في معاينة عامة عبر Microsoft Foundry، لكنها توفر مكونات صوتية لوكلاء المحادثة ولا تعني الاستغناء عن خدمات أخرى للاستدلال أو التنسيق.
What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language suppMicrosoft’s MAI lineup combines streaming speech recognition with two text-to-speech models.
موجّه الذكاء الاصطناعي
Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
openai.com
تغطي نماذج MAI الثلاثة من مايكروسوفت جانبي المحادثة الصوتية: يحوّل MAI-Transcribe-2-Streaming الكلام المباشر إلى نص، بينما يحوّل MAI-Voice-2.1 وMAI-Voice-2.1-Flash النص إلى كلام. وتستهدف المجموعة المطورين الذين يبنون وكلاء صوتيين، وهي متاحة في معاينة عامة عبر Microsoft Foundry، منصة مايكروسوفت للمطورين وبناء تطبيقات الذكاء الاصطناعي. 3639
مقارنة سريعة
النموذج
الوظيفة
دعم اللغات المذكور
السعر المذكور
MAI-Transcribe-2-Streaming
تفريغ الكلام المباشر إلى نص مع تحديثات متتابعة
60 لغة مع التعرّف التلقائي على اللغة
0.54 دولار لكل ساعة صوت؛ سعر تمهيدي حتى نهاية 2026 435
هذه أسعار ومعلومات منشورة عن النماذج، وليست ضمانًا لبقاء السعر أو التوفّر على حالهما. وسعر التفريغ، على وجه الخصوص، موصوف بأنه تمهيدي. 435
تفريغ مباشر بدل انتظار نهاية الجملة
لا ينتظر MAI-Transcribe-2-Streaming انتهاء المتحدث حتى يعرض النص؛ بل يستقبل تدفقًا متواصلًا من الصوت عبر اتصال WebSocket ويرسل تحديثات متتابعة للتفريغ. وتذكر التقارير أنه يدعم 60 لغة مع التعرّف التلقائي على اللغة. 1
أما زمن الاستجابة، فتختلف طريقة وصفه بين التقارير: يذكر أحدها أن النموذج يبدأ بإظهار نتائج أولية بعد ما يزيد قليلًا على 100 ميلي ثانية من استقباله الصوت، بينما يذكر آخر ظهور الكلمات بعد نحو 320 ميلي ثانية من نطقها. ولأن كل رقم يبدأ احتسابه من نقطة مختلفة، فلا يصح التعامل معهما على أنهما قياسان متطابقان. 24
وفي معيار التفريغ الصوتي المتدفق من Artificial Analysis، أفادت تقارير بأن النموذج بدأ في المركز الأول من حيث الدقة. ويذكر أحد التقارير معدل خطأ نهائيًا للكلمات يبلغ 2.5% ضمن مقارنة شملت 38 نموذجًا. هذه نتيجة معيار مُعلنة، وليست ضمانًا للدقة في كل لغة أو ظروف تسجيل أو تطبيق. 34
السعر المنشور للتفريغ هو 0.54 دولار لكل ساعة صوت حتى نهاية 2026 كسعر تمهيدي. لذلك ينبغي للمطورين أخذ احتمال تغيّر السعر بعد انتهاء الفترة الترويجية في الحسبان عند تقييم النموذج. 435
نموذجان لتوليد الكلام: التعبير أم السرعة؟
يحوّل النموذجان النص إلى صوت، لكنهما موجهان لأولويات مختلفة: يوصف MAI-Voice-2.1 بأنه الخيار الأكثر تعبيرًا، فيما صُمم Flash للتطبيقات التي تهمها سرعة الاستجابة وتقليل الانتظار بين أدوار المحادثة. وتذكر التقارير أن تغطية نماذج الصوت تبلغ 23 لغة. 63536
تبلغ الأسعار المنشورة 22 دولارًا لكل مليون حرف في MAI-Voice-2.1، و15 دولارًا لكل مليون حرف في MAI-Voice-2.1-Flash. ويذكر أحد التقارير أن إصدار Flash يستطيع توليد 45 ثانية من الصوت مع زمن استجابة يبلغ 150 ميلي ثانية؛ لكن ينبغي فهم ذلك بوصفه رقمًا منقولًا، لا مقياسًا موحدًا لزمن الاستجابة من بداية الطلب إلى نهايته في كل تطبيق. 3536
ولا تعرض التقارير المتاحة نتيجة معيار عامة قابلة للمقارنة مباشرةً لجودة الصوت في النموذجين. لذلك لا ينبغي اعتبار تصنيف دقة نموذج التفريغ ترتيبًا لنماذج توليد الكلام. 3234
ماذا تعني الإتاحة للمطورين؟
تُذكر النماذج الثلاثة على أنها متاحة في معاينة عامة عبر Microsoft Foundry. تتيح المعاينة للمطورين اختبارها، لكنها لا تعني أن النماذج أصبحت متاحة عمومًا بصورتها النهائية. 36
عمليًا، تضيف مايكروسوفت الآن مكونات خاصة بها للتعرّف على الكلام وتوليده ضمن مسار بناء الوكلاء الصوتيين. وقد يسهل ذلك على المطورين إنشاء جزء أكبر من طبقة الصوت داخل منظومة أدوات الشركة، بدل الحصول على هذه المكونات من مزودين آخرين. لكنه لا يثبت أن وكيلًا صوتيًا كاملًا يمكن أن يعمل دون خدمات أخرى؛ فقد تظل مهام مثل الاستدلال وتنسيق خطوات الوكيل معتمدة على نماذج أو خدمات مختلفة. 639
الخلاصة
أوضح عناصر المقارنة هو نموذج التفريغ المباشر: يدعم 60 لغة، ويعرض النص على مراحل، وسُجل له تصنيف متقدم في معيار Artificial Analysis مع معدل خطأ نهائي للكلمات قدره 2.5% في أحد التقارير. أما نموذجا الصوت فيقدمان خيارًا بين التعبير والسرعة، مع تغطية منشورة تبلغ 23 لغة وأسعار مختلفة لكل مليون حرف. وقبل اعتماد أي منها في منتج، من الأفضل التحقق من التوفّر والأسعار وزمن الاستجابة في بيئة الاستخدام المقصودة. 1343536
Studio Global AI
مواصلة البحث الخاص بك
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
ما هي الإجابة المختصرة على "نماذج MAI الجديدة من مايكروسوفت: تحويل الكلام إلى نص وصوت مولّد"؟
تضم المجموعة نموذجًا للتفريغ النصي المباشر يدعم 60 لغة، ونموذجين لتحويل النص إلى كلام يدعمان 23 لغة بحسب التقارير.
ما هي النقاط الأساسية التي يجب التحقق منها أولاً؟
تضم المجموعة نموذجًا للتفريغ النصي المباشر يدعم 60 لغة، ونموذجين لتحويل النص إلى كلام يدعمان 23 لغة بحسب التقارير. يحدّث MAI Transcribe 2 Streaming النص أثناء وصول الصوت. وتختلف الأرقام المنشورة لزمن الاستجابة بحسب نقطة القياس المستخدمة.
ماذا يجب أن أفعل بعد ذلك في الممارسة العملية؟
تبدأ الأسعار المعلنة من 0.54 دولار لكل ساعة صوت للتفريغ، و15 أو 22 دولارًا لكل مليون حرف لتوليد الكلام؛ وسعر التفريغ تمهيدي حتى نهاية 2026.