Luna TTS عائلة نماذج متعددة اللغات لتحويل النص إلى كلام طورتها VUI Labs. تصدر أحد تقارير أغسطس 2026 ترتيب Hugging Face TTS Arena، لكنه جاء في المركز الخامس في لقطة Artificial Analysis بتاريخ 1 سبتمبر 2026، ما يوضح سرع...
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
تقدم Luna-TTS نفسها بوصفها عائلة نماذج متعددة اللغات لتحويل النص إلى كلام طورتها شركة الذكاء الاصطناعي الصوتي الصينية VUI Labs. وتضم العائلة إصداراً قياسياً يركز على جودة الصوت، وإصدار Luna-TTS Realtime المصمم للتفاعل المتدفق منخفض التأخير.
تأسست VUI Labs في أوائل عام 2025، وتشير التقارير المنشورة إلى أن الشركة أسسها الأستاذ في جامعة شنغهاي جياو تونغ تشيان يانمين ورائد الأعمال المتسلسل مي جيه.
لكن سبب الاهتمام بالنموذج لا يقتصر على ظهوره في صدارة أحد الترتيبات. فالفكرة الأساسية مختلفة عن النهج الشائع في توليد الكلام: بدلاً من توقع رموز الصوت بالتتابع، يضغط Luna-TTS الصوت إلى رموز متقطعة، ثم يستخدم آلية أقرب إلى نماذج الانتشار لتوليد عدد كبير من هذه الرموز بالتوازي.1
3
لا يمكن اختزال الإجابة في عبارة «النموذج الأول عالمياً» من دون تحديد لوحة القياس وتاريخها.
هذه النتائج ليست بالضرورة متناقضة. فاختبارات الاستماع الأعمى تتأثر بإصدار النموذج، واللغات المستخدمة، ونوع الصوت، والتعليمات النصية، وحجم العينة، وتوقيت التصويت. والخلاصة الأكثر دقة هي أن Luna-TTS دخل قائمة النماذج المتقدمة في ترتيبات تحويل النص إلى كلام، وحقق المركز الأول أو الثالث خلال فترات معينة، لكن الأدلة المتاحة لا تثبت أنه يتفوق بصورة مستمرة على Cartesia أو ElevenLabs أو Qwen أو جميع المنافسين.
كما لا توفر المصادر الحالية بيانات متجانسة وموثوقة تسمح بتحديد مركز Luna-TTS بدقة أمام نماذج ByteDance Seed أو Zhipu. لذلك لا يصح تحويل العلاقة بين هذه النماذج إلى حكم شامل ونهائي بالفوز أو الخسارة.
بُني Luna-TTS عبر تكييف نموذج اللغة Qwen3-0.6B وتدريبه لمواجهة رموز صوتية بدلاً من النص وحده.2 وعلى خلاف نماذج تحويل النص إلى كلام ذاتية الانحدار، التي تتنبأ بالرمز التالي في كل خطوة، يطبق Luna-TTS أقنعة عشوائية على شبكة رموز RVQ الصوتية ثم يصلح المواقع المقنّعة عبر جولات متعددة ومتوازية.
1
4
يغير هذا التصميم ترتيب التوليد نفسه. فالنموذج لا يعتمد بالكامل على بادئة صوتية مكتملة قبل أن يبدأ بالجزء التالي، بل يستطيع معالجة مواقع عديدة في الجولة ذاتها. ومن الناحية النظرية، يقلل ذلك التأخير الناتج عن التوليد التسلسلي، كما يحد من تراكم الأخطاء على طول السلسلة.1
3
يستخدم النظام مرمّزاً صوتياً طورته الشركة باسم Luna-Codec لتحويل الموجة الصوتية إلى تمثيل رقمي متقطع. وتصف المواد المنشورة تصميماً بمعدل أخذ عينات يبلغ 24 كيلوهرتز، ومعدل إطارات قدره 25 هرتز، وثمانية كتب رموز.8
9
ولا يمثل المرمّز مجرد أداة ضغط. فهو يحدد كمية المعلومات الصوتية التي ينبغي للنموذج توقعها، وعدد الإطارات التي يعالجها في الثانية، ومدى قدرة التوليد المتوازي على الجمع بين جودة الصوت وسرعته. ولهذا صُمم Luna-TTS بوصفه منظومة تجمع نموذج اللغة والمرمّز الصوتي وأخذ العينات القائم على الانتشار، لا كسلسلة وحدات منفصلة تماماً.
يستطيع الإصدار القياسي توليد مقطع كامل بطريقة غير ذاتية الانحدار، لكن المحادثة الفورية تتطلب بدء تشغيل الصوت قبل اكتمال الجملة. لذلك يتبنى إصدار Realtime حلاً وسطاً: التوليد متسلسل بين الكتل، لكنه متوازٍ داخل كل كتلة.1
4
تضم كل كتلة 32 إطاراً من Luna-Codec، أي ما يعادل 1.28 ثانية من الصوت. ويستخدم الإصدار ذاكرة KV Cache للاحتفاظ بالسياق، ثم يرسل الكتل اللاحقة تدريجياً بعد تثبيت الكتلة الأولى.1
وبالتالي، فإن وصف Realtime بأنه «غير ذاتي الانحدار بالكامل» غير دقيق. الوصف الأدق هو أنه يعتمد على علاقات ذاتية الانحدار بين الكتل، بينما ينفذ إزالة الضوضاء والتوليد بالتوازي داخل كل كتلة.
يصف التقرير التقني أيضاً مرحلة تدريب لاحق بالتعلم المعزز باستخدام GRPO، بعد تكييفها مع عملية الانتشار المتقطع المقنّع، إلى جانب أدوات للتحكم في المشاعر والأصوات غير الكلامية.1
5
ولا يقتصر الهدف هنا على إنتاج كلام مفهوم؛ بل يشمل تحسين الطبيعية، والقدرة التعبيرية، وملاءمة الصوت لتفضيلات المستمع. كما تشير المواد المنشورة إلى أن تحرير الكلام واستنساخ الصوت من دون تدريب خاص يمكن التعامل معهما بوصفهما مهمتي ملء أو إعادة كتابة لشبكة الرموز الصوتية.1
4
مع ذلك، لا يمكن استنتاج جودة استنساخ الصوت في كل لغة أو ثباتها في جميع الظروف من البنية المعمارية وحدها. ويتطلب تقييم هذه الجوانب اختباراً عملياً للمنتج، بما في ذلك طول التسجيل المرجعي المطلوب واتساق النبرة.
يورد التقرير التقني لإصدار Luna-TTS Realtime رقمين لافتين: معامل زمن حقيقي RTF يبلغ 0.024، وإرسال أول كتلة صوتية مفكوكة مدتها 1.28 ثانية خلال 41.6 ملي ثانية في اختبار محلي بعد تهيئة الخدمة.1
5
وتذكر تقارير مرتبطة بالنظام أن الإصدار الفوري يستخدم عادة بين 8 و16 خطوة لإزالة الضوضاء، وأن الاختبار أُجري على وحدتي معالجة رسوميتين من نوع H20.7 وإذا نظرنا فقط إلى حدود محرك الاستدلال، فإن هذه الأرقام تشير إلى قدرة عالية على توليد الصوت.
لكنها لا تعني أن كل مستخدم سيحصل على زمن استجابة سحابي مماثل. فقد استخدمت التجربة عتاداً محدداً، وإعداداً متوازياً، وخدمة مهيأة مسبقاً، وبروتوكول نشر محلياً. ويمكن أن تضيف الشبكة، والانتظار في الطوابير، ومعالجة النص، وفك ترميز الصوت، وضغط الإنتاج، وقتاً إضافياً قبل وصول الصوت إلى المستخدم.
لذلك يُفهم رقم 41.6 ملي ثانية على أنه زمن تثبيت أول كتلة في ظروف اختبار مضبوطة، لا كضمان عام لزمن الاستجابة الكامل عبر واجهة API سحابية.
يقول مؤلفو التقرير إن Luna-TTS دُرّب مسبقاً على نحو مليون ساعة من البيانات الصوتية بالصينية والإنجليزية واليابانية والكورية.1
2 ويمكن لمثل هذا الحجم والتنوع أن يوسعا تغطية النطق والتنغيم ونمذجة الصوت بين اللغات.
لكن الملخصات المنشورة لا تقدم تفاصيل كافية للتحقق المستقل من مصادر البيانات، ومعايير التنقية، ونسبة كل لغة، أو الامتثال لحقوق الاستخدام. ومن ثم فإن «مليون ساعة» وصف لحجم التدريب يمكن الاستناد إليه، لكنه لا يثبت أن النموذج متفوق بالقدر نفسه في كل لغة أو لهجة أو سيناريو استخدام.
تشير المواد المتاحة إلى أن VUI Labs لا تتعامل مع Luna-TTS كنموذج تركيب صوتي منفرد، بل تدفع في ثلاثة اتجاهات مترابطة: قدرات النموذج وواجهة API، وأدوات صوتية للمبدعين، وتطبيقات الوكلاء الصوتيين.
هذا يعني أن جودة النموذج ليست سوى حلقة في سلسلة القيمة. فالقيمة التجارية الفعلية تعتمد أيضاً على استنساخ الأصوات، والتحكم في المشاعر، وتنظيم المحادثات، والتأخير، وتكلفة النشر، وسهولة دمج النظام في قطاعات مختلفة.
وتزعم تقارير قطاعية أن VUI Labs طبقت تقنياتها في جدولة الخدمات اللوجستية، والتأمين عبر الإنترنت، وبرمجيات السفر والضيافة، وأن عملاء متعددين أجروا مجتمعين أكثر من مليون محادثة أعمال.6 لكن هذا الرقم يظل ادعاءً من الشركة أو جهات النشر، وليس مؤشراً خضع لتدقيق مستقل. كما لا تكشف المواد المتاحة بالكامل عن أسماء العملاء أو تعريف «المحادثة» أو مدة الاستخدام أو معيار المقارنة مع الموردين الآخرين.
ويبدو أن الفريق المؤسس يجمع بين قيادة أكاديمية تقنية وقيادة للمنتج والتسويق: يتولى تشيان يانمين اتجاهات البحث في الصوت والذكاء الاصطناعي، بينما يوصف مي جيه بأنه رائد أعمال متسلسل. وقد يساعد هذا النوع من الهيكلة على نقل نموذج بحثي سريعاً إلى واجهة API وحلول قطاعية ومنتجات للوكلاء الصوتيين، لكن القدرة التنافسية طويلة الأمد ستعتمد على حلقة البيانات، والاحتفاظ بالعملاء، وتكلفة الاستدلال، والقدرة على التوسع عالمياً.
بجمع ما ورد في التقرير التقني وبيانات الترتيبات، يمكن تلخيص نقاط القوة الأكثر قابلية للدعم في أربعة محاور:
تفسر هذه العناصر كيف تمكن Luna-TTS من الوصول سريعاً إلى مراكز متقدمة في بعض اختبارات الاستماع الأعمى. لكنها لا تثبت تلقائياً تفوقه في السعر، أو استقرار النصوص الطويلة، أو اتساق الصوت، أو سلامة حقوق الاستخدام، أو توافر واجهة API، أو الأداء في جميع اللغات.
القصة التقنية الأساسية لـLuna-TTS تبدو ذات أساس واضح: فقد جمعت VUI Labs نموذجاً لغوياً مشتقاً من Qwen3، ومرمّزاً صوتياً متقطعاً، وتوليداً بالانتشار المقنّع، وتدريباً لاحقاً بالتعلم المعزز، واستدلالاً متدفقاً على مستوى الكتل في منظومة واحدة لتحويل النص إلى كلام.1
وتُظهر النتائج المنشورة أنه تصدر Hugging Face TTS Arena في تقارير أغسطس 2026، واحتل المركز الثالث في تقارير الفترة نفسها عن Artificial Analysis، قبل أن يظهر في المركز الخامس في لقطة 1 سبتمبر 2026.8
لذلك فإن التقييم الأكثر تحفظاً هو أن Luna-TTS أصبح نموذجاً مهماً في الصفوف المتقدمة من المنافسة العالمية في تقنيات تحويل النص إلى كلام، وأن نهج الانتشار المتوازي والتوليد الفوري على مستوى الكتل يستحق المتابعة. أما القول إنه يهزم دائماً Cartesia أو ElevenLabs أو Qwen أو جميع المنافسين، فلا تدعمه البيانات المتاحة.
وبالنسبة إلى المطورين الذين يدرسون اختياره، فإن الخطوة الأهم ليست متابعة ترتيب واحد، بل اختبار اللغة المستهدفة، واستنساخ الصوت، والتحكم في المشاعر، وزمن وصول أول حزمة، واتساق النصوص الطويلة، والتكلفة الفعلية لواجهة API.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
Luna TTS عائلة نماذج متعددة اللغات لتحويل النص إلى كلام طورتها VUI Labs. تصدر أحد تقارير أغسطس 2026 ترتيب Hugging Face TTS Arena، لكنه جاء في المركز الخامس في لقطة Artificial Analysis بتاريخ 1 سبتمبر 2026، ما يوضح سرع...
Luna TTS عائلة نماذج متعددة اللغات لتحويل النص إلى كلام طورتها VUI Labs. تصدر أحد تقارير أغسطس 2026 ترتيب Hugging Face TTS Arena، لكنه جاء في المركز الخامس في لقطة Artificial Analysis بتاريخ 1 سبتمبر 2026، ما يوضح سرع... بدلاً من التنبؤ برموز الصوت واحداً تلو الآخر، يستخدم النموذج انتشاراً مقنّعاً متقطعاً مبنياً على Qwen3 لإصلاح شبكة رموز صوتية كاملة بالتوازي.
أسس VUI Labs الأستاذ في جامعة شنغهاي جياو تونغ تشيان يانمين ورائد الأعمال المتسلسل مي جيه.