I full precision kräver modellen cirka 55 GB VRAM, men Meta levererar den med 4-bitars kvantisering som komprimerar modellen till under 20 GB .
Meta levererar två kvantiserade konfigurationer, båda byggda med K-Quant och uppmätta mot 15 benchmarktester :
För att lösa latensproblemet med att köra en 30B-modell lokalt, parar Meta Muse Glimmer med DFlash – en liten spekulativ avkodare med fem lager som föreslår block på 16 tokens åt gången, vilka huvudmodellen sedan verifierar parallellt .
Meta rapporterar följande genomströmning för den 17 GB kvantiserade modellen med batchstorlek 1 och girig avkodning :
| Hårdvara | Baslinje (tok/s) | Med DFlash (tok/s) | Hastighetsökning |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 | 233,4 | 3,1x |
| Apple M5 Max | 26,6 | 50,2 | 1,9x |
| Apple M4 Max | 23,7 | 37,8 | 1,6x |
SGLang rapporterade 236,4 tok/s på samma RTX 5090-hårdvara i en separat dag-0-mätning . Tidiga oberoende tester på en RTX 5090 med llama.cpp visar ibland lägre siffror (t.ex. ~137 tok/s), vilket tyder på att siffran 233+ tok/s kräver specifika optimeringar
.
Muse Glimmer är i första hand inte en chatbot – det är en lokal AI-agent designad för autonoma arbetsflöden . Meta har uttryckligen trimmat den för att planera, anropa verktyg och återhämta sig från sina egna fel
. Den stöder Model Context Protocol (MCP) inbyggt och integreras med populära agentramverk
.
Viktiga användningsområden inkluderar: funktionsanrop, lokal kodning, långa verktygssessioner, LLM-som-domare-utvärdering, dokumentanalys och personliga assistenter .
Meta publicerade direkta jämförelser mot Googles Gemma 4 31B och Alibabas Qwen 3.6 27B (båda i tanke-/resonemangsläge) :
Muse Glimmer leder inom de flesta agentiska benchmarks, inklusive MCP Atlas (75,5 vs 62,5 för Qwen) och DeepSearch QA (74,6 vs 71,1) . Den uppnår också 94,7 på AIME 2026, före båda konkurrenterna
.
Varning: En tredjepartsanalys noterar att Glimmer ligger efter Qwen 3.6 27B på TerminalBench 2.1 (51,7 vs 60,7) och OSWorld-Verified (65,9 vs 75,6), och har en tendens att vägra vissa OS-automatiseringsuppgifter .
Muse Glimmer destillerades från Muse Spark (Metas större, stängda frontlinjemodell) med hjälp av logit-destillation under förträning, följt av övervakad finjustering och RLHF . Muse Spark i sig förblir stängd – endast tillgänglig som ett värdbaserat API – vilket gör Glimmer till den öppna destillationen för användare som vill ha lokal driftsättning
. Meta har angett att en öppen release av Muse Spark kan följa
.
Muse Glimmer är den tydligaste produkten hittills av Mark Zuckerbergs vision om "personlig superintelligens" – kraftfull AI som körs lokalt på personliga enheter, fri från molnkostnader, prenumerationsavgifter eller att data lämnar enheten . TechCrunch kallade det "den tydligaste bilden hittills" av den visionen
.
Släppet följer månader av intern turbulens efter Llama 4:s mindre lyckade lansering våren 2026, varefter Meta verkade överge open-weight-AI. Muse Glimmer återupptar den strategin .
I juni 2025 investerade Meta 14,3 miljarder dollar i dataannoteringföretaget Scale AI och förvärvade en andel på cirka 49 % . Affären förde Scales 28-årige VD Alexandr Wang till ledningen för Metas nya "Superintelligence"-division
. Investeringen syftade till att säkra högkvalitativ träningsdata och talang för Muse-modellfamiljen
. CNBC rapporterade i januari 2026 att Wang ledde Metas TBD AI-enhet som bygger en efterföljare till Llama, med kodnamnet Avocado
.
Muse Glimmer kan laddas ner från Hugging Face på meta-models/Muse-Glimmer-30B under Apache 2.0-licensen . Den har dag-0-stöd i:
Tidiga community-rapporter visar att till och med ett RTX 3090 (24 GB) kan köra den Q4_K_XL-kvantiserade modellen med DFlash och ett 262K kontextfönster med cirka 22-23 GB VRAM .