يتطلب النموذج بدقة كاملة حوالي 55 جيجابايت من VRAM، لكن ميتا توفره بضغط 4 بت يقلص حجمه إلى أقل من 20 جيجابايت .
لحل مشكلة زمن الاستجابة لتشغيل نموذج بحجم 30 مليار معلمة محلياً، تدمج ميتا مع Muse Glimmer أداة DFlash – وهو مُخطط فك تخميني صغير من 5 طبقات يقترح كتلًا من 16 رمزاً في المرة الواحدة، ثم يتحقق النموذج الرئيسي منها بالتوازي .
| الأجهزة | الإنتاجية الأساسية (رمز/ثانية) | مع DFlash (رمز/ثانية) | التسريع |
|---|---|---|---|
| NVIDIA RTX 5090 | 74.9 | 233.4 | 3.1x |
| Apple M5 Max | 26.6 | 50.2 | 1.9x |
| Apple M4 Max | 23.7 | 37.8 | 1.6x |
أعلن إطار SGLang عن 236.4 رمز/ثانية على نفس الأجهزة في قياس منفصل . أشارت اختبارات مستقلة مبكرة على RTX 5090 مع llama.cpp أحياناً إلى أرقام أقل (مثل ~137 رمز/ثانية)، مما يشير إلى أن الرقم 233+ يتطلب تحسينات محددة
.
Muse Glimmer ليس مجرد روبوت محادثة – إنه وكيل ذكاء اصطناعي محلي مصمم لسير العمل المستقل . قامت ميتا بضبطه خصيصاً لـ التخطيط، واستدعاء الأدوات، والتعافي من أخطائه
. يدعم بروتوكول سياق النموذج (MCP) بشكل أصلي ويتكامل مع أطر العمل الوكيلة الشهيرة
.
تشمل حالات الاستخدام الرئيسية: استدعاء الدوال، البرمجة المحلية، جلسات استخدام الأدوات الطويلة، تقييم LLM كحكم، تحليل المستندات، والمساعدين الشخصيين .
نشرت ميتا مقارنات مباشرة ضد Gemma 4 31B من Google و Qwen 3.6 27B من Alibaba (كلاهما في وضع التفكير/الاستدلال) :
يتفوق Muse Glimmer على معظم معايير القياس الوكيلة، بما في ذلك MCP Atlas (75.5 مقابل 62.5 لـ Qwen) و DeepSearch QA (74.6 مقابل 71.1) . كما حصل على 94.7 في AIME 2026، متقدماً على كلا المنافسين
.
ملاحظة: يشير تحليل طرف ثالث إلى أن Glimmer يتخلف عن Qwen 3.6 27B في TerminalBench 2.1 (51.7 مقابل 60.7) و OSWorld-Verified (65.9 مقابل 75.6)، ولديه ميل لرفض بعض مهام أتمتة نظام التشغيل .
تم اشتقاق Muse Glimmer من نموذج Muse Spark (النموذج الحدودي المغلق الأكبر لميتا) باستخدام تقطير اللوغاريتمات أثناء التدريب المسبق، متبوعاً بضبط دقيق خاضع للإشراف و RLHF . يظل Muse Spark نفسه مغلقاً – متاحاً فقط كواجهة برمجية (API) – مما يجعل Glimmer نسخة مقطرة للمستخدمين الراغبين في النشر المحلي
. أشارت ميتا إلى أن إصداراً مفتوحاً من Muse Spark قد يتبع
.
يمثل Muse Glimmer أوضح تجسيد حتى الآن لرؤية مارك زوكربيرج في "الذكاء الفائق الشخصي" (personal superintelligence) – ذكاء اصطناعي قوي يعمل محلياً على الأجهزة الشخصية، بعيداً عن تكاليف السحابة ورسوم الاشتراك، ودون مغادرة البيانات للجهاز . وصفت TechCrunch هذا النموذج بأنه "أوضح صورة حتى الآن" لتلك الرؤية
.
يأتي هذا الإصدار بعد أشهر من الاضطراب الداخلي إثر إطلاق Llama 4 المخيب في ربيع 2026، حيث بدا أن ميتا تخلت عن الذكاء الاصطناعي مفتوح الوزن. يعيد Muse Glimmer فتح تلك الاستراتيجية .
في يونيو 2025، استثمرت ميتا 14.3 مليار دولار في شركة بيانات التصنيف Scale AI، واستحوذت على حصة ~49% . جلب الصفقة الرئيس التنفيذي لـ Scale، البالغ من العمر 28 عاماً ألكسندر وانغ، لقيادة قسم "الذكاء الفائق" الجديد في ميتا
. كان الهدف من الاستثمار تأمين بيانات تدريب عالية الجودة ومواهب لعائلة نماذج Muse
. ذكرت CNBC في يناير 2026 أن وانغ يقود وحدة الذكاء الاصطناعي الجديدة في ميتا، والتي كانت تختبر نموذجاً جديداً يحمل الاسم الرمزي Avocado كخليفة لـ Llama
.
Muse Glimmer متاح للتحميل من Hugging Face على الرابط meta-models/Muse-Glimmer-30B تحت ترخيص Apache 2.0 . يتمتع بدعم من اليوم الأول في:
تظهر تقارير مجتمعية مبكرة أنه حتى بطاقة RTX 3090 (24 جيجابايت) يمكنها تشغيل النموذج المضغوط Q4_K_XL مع DFlash ونافذة سياق 262 ألف رمز باستخدام حوالي 22-23 جيجابايت من VRAM .