फुल-प्रिसिज़न मॉडल को ~55 GB VRAM की आवश्यकता होती है, लेकिन Meta इसे 4-बिट क्वांटाइज़ेशन के साथ शिप करता है जो मॉडल को 20 GB से कम कर देता है ।
Meta दो क्वांटाइज़्ड कॉन्फ़िगरेशन शिप करता है, जो K-Quant के साथ बनाए गए हैं और 15 बेंचमार्क पर मापे गए हैं :
30B मॉडल को स्थानीय रूप से चलाने की लेटेंसी समस्या को हल करने के लिए, Meta ने Muse Glimmer के साथ DFlash को जोड़ा है — एक छोटा पाँच-लेयर स्पेक्युलेटिव-डिकोडिंग ड्राफ्टर जो एक बार में 16 टोकन के ब्लॉक प्रस्तावित करता है, जिसे मुख्य मॉडल समानांतर में वेरिफाई करता है ।
Meta 17 GB क्वांटाइज़्ड मॉडल पर बैच साइज़ 1 और ग्रीडी डिकोडिंग के साथ निम्नलिखित थ्रूपुट रिपोर्ट करता है :
| हार्डवेयर | बेसलाइन (tok/s) | DFlash के साथ (tok/s) | स्पीडअप |
|---|---|---|---|
| NVIDIA RTX 5090 | 74.9 | 233.4 | 3.1x |
| Apple M5 Max | 26.6 | 50.2 | 1.9x |
| Apple M4 Max | 23.7 | 37.8 | 1.6x |
SGLang ने एक अलग दिन-0 माप में उसी RTX 5090 हार्डवेयर पर 236.4 tok/s रिपोर्ट किया । llama.cpp के साथ RTX 5090 पर शुरुआती स्वतंत्र परीक्षण कभी-कभी कम संख्या दिखाते हैं (जैसे, ~137 tok/s), यह सुझाव देते हुए कि 233+ tok/s के आंकड़े के लिए विशिष्ट ऑप्टिमाइज़ेशन की आवश्यकता होती है
।
Muse Glimmer मुख्य रूप से चैटबॉट नहीं है — यह एक स्थानीय AI एजेंट है जो स्वायत्त वर्कफ़्लो के लिए डिज़ाइन किया गया है । Meta ने इसे प्लान करने, टूल कॉल करने और अपनी गलतियों से उबरने के लिए ट्यून किया है
। यह मूल रूप से Model Context Protocol (MCP) को सपोर्ट करता है और लोकप्रिय एजेंट फ्रेमवर्क के साथ एकीकृत होता है
।
मुख्य उपयोग के मामलों में शामिल हैं: फंक्शन कॉलिंग, स्थानीय कोडिंग, लंबे टूल-उपयोग सत्र, LLM-as-a-judge मूल्यांकन, दस्तावेज़ विश्लेषण और व्यक्तिगत सहायक ।
Meta ने Google के Gemma 4 31B और Alibaba के Qwen 3.6 27B (दोनों थिंकिंग/रीज़निंग मोड में) के खिलाफ सीधी तुलना प्रकाशित की :
Muse Glimmer अधिकांश एजेंटिक बेंचमार्क पर आगे है, जिसमें MCP Atlas (Qwen के 62.5 के मुकाबले 75.5) और DeepSearch QA (71.1 के मुकाबले 74.6) शामिल हैं । यह AIME 2026 में 94.7 स्कोर करता है, जो दोनों प्रतिस्पर्धियों से आगे है
।
सावधानी: एक तृतीय-पक्ष विश्लेषण नोट करता है कि Glimmer, Qwen 3.6 27B से TerminalBench 2.1 (51.7 बनाम 60.7) और OSWorld-Verified (65.9 बनाम 75.6) पर पीछे है, और कुछ OS-स्तरीय ऑटोमेशन कार्यों को अस्वीकार करने की प्रवृत्ति रखता है ।
Muse Glimmer को Muse Spark (Meta के बड़े, क्लोज्ड-सोर्स फ्रंटियर मॉडल) से प्री-ट्रेनिंग के दौरान लॉगिट डिस्टिलेशन का उपयोग करके डिस्टिल किया गया था, इसके बाद सुपरवाइज़्ड फ़ाइन-ट्यूनिंग और RLHF किया गया । Muse Spark स्वयं बंद रहता है — केवल एक होस्टेड API के रूप में उपलब्ध है — जिससे Glimmer उन उपयोगकर्ताओं के लिए ओपन-वेट डिस्टिलेशन बन जाता है जो स्थानीय डिप्लॉयमेंट चाहते हैं
। Meta ने संकेत दिया है कि Muse Spark का एक ओपन रिलीज़ बाद में आ सकता है
।
Muse Glimmer, मार्क जुकरबर्ग के "पर्सनल सुपरइंटेलिजेंस" के विज़न का सबसे स्पष्ट उत्पाद है — शक्तिशाली AI जो स्थानीय रूप से व्यक्तिगत उपकरणों पर चलता है, क्लाउड लागत, सब्सक्रिप्शन शुल्क, या डेटा को डिवाइस छोड़ने से मुक्त । TechCrunch ने इसे उस विज़न की "अब तक की सबसे स्पष्ट तस्वीर" कहा
।
यह रिलीज़ वसंत 2026 में Llama 4 के निराशाजनक लॉन्च के बाद महीनों के आंतरिक उथल-पुथल के बाद आई है, जिसके बाद Meta ने ओपन-वेट AI को छोड़ दिया था। Muse Glimmer उस रणनीति को फिर से खोलता है ।
जून 2025 में, Meta ने डेटा-लेबलिंग फर्म Scale AI में $14.3 बिलियन का निवेश किया, जिससे ~49% हिस्सेदारी हासिल हुई । इस सौदे ने Scale के 28 वर्षीय CEO Alexandr Wang को Meta के नए "Superintelligence" डिवीज़न का नेतृत्व करने के लिए लाया
। यह निवेश Muse मॉडल परिवार के लिए उच्च गुणवत्ता वाले प्रशिक्षण डेटा और प्रतिभा को सुरक्षित करने के उद्देश्य से किया गया था
। CNBC ने जनवरी 2026 में रिपोर्ट किया कि Wang Llama के उत्तराधिकारी, कोड-नेम Avocado, का निर्माण करने वाली Meta की TBD AI यूनिट का नेतृत्व कर रहे थे
।
Muse Glimmer Hugging Face पर meta-models/Muse-Glimmer-30B से Apache 2.0 लाइसेंस के तहत डाउनलोड करने योग्य है । इसे निम्नलिखित में दिन-0 समर्थन प्राप्त है:
शुरुआती समुदाय रिपोर्ट दिखाती हैं कि एक RTX 3090 (24 GB) भी Q4_K_XL क्वांटाइज़्ड मॉडल को DFlash और 262K कॉन्टेक्स्ट विंडो के साथ लगभग 22-23 GB VRAM का उपयोग करके चला सकता है ।