Meta's Muse Glimmer, uitgebracht op 10 augustus 2026, is een open model van 29,6 miljard parameters (Apache 2.0) dat volledig draait op één consumenten GPU — geen cloud vereist. Gedistilleerd van Meta's gesloten model Muse Spark, is Glimmer geoptimaliseerd voor lokale, altijd actieve agent workflows: plannen, toolge...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Meta's Muse Glimmer, a 30-billion-parameter open-weight AI model, and what are its key features, specifications (including offline c. Article summary: I need to verify this information about a model called "Muse Glimmer" from Meta. Let me search for it. Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustra
Op 10 augustus 2026 heeft Meta Superintelligence Labs Muse Glimmer uitgebracht — een open AI-model van ongeveer 29,6 miljard parameters dat volledig draait op één consumenten-GPU, zonder dat er een internetverbinding of cloud nodig is . Het is Meta's eerste open release in meer dan een jaar en markeert een terugkeer naar open AI na de teleurstellende lancering van Llama 4
.
Muse Glimmer is een dense causale transformer (geen Mixture-of-Experts) met een speciale beeldencoder van ongeveer 1,8 miljard parameters voor multimodale invoer . Het model heeft 52 lagen, een verborgen dimensie van 6.656 en 32 query-heads met een 16:1 Grouped Query Attention-patroon
.
Het model op volledige precisie heeft ongeveer 55 GB VRAM nodig, maar Meta levert het met 4-bit kwantisatie die het model comprimeert tot onder de 20 GB .
Meta levert twee varianten, beide gebouwd met K-Quant en getest op 15 benchmarks :
Onafhankelijke laboratoria hebben deze beweringen nog niet gereproduceerd .
Om het snelheidsprobleem van een 30B-model op te lossen, koppelt Meta Muse Glimmer aan DFlash — een kleine speculatieve decoder van vijf lagen die blokken van 16 tokens tegelijk voorstelt, welke het hoofdmodel vervolgens parallel verifieert .
Meta rapporteert de volgende doorvoer op het 17 GB-model bij batchsize 1 met greedy decoding :
| Hardware | Zonder DFlash (tok/s) | Met DFlash (tok/s) | Versnelling |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 | 233,4 | 3,1x |
| Apple M5 Max | 26,6 | 50,2 | 1,9x |
| Apple M4 Max | 23,7 | 37,8 | 1,6x |
SGLang meldde 236,4 tok/s op dezelfde RTX 5090-hardware in een aparte meting . Vroege onafhankelijke tests op een RTX 5090 met llama.cpp laten soms lagere aantallen zien (bijv. ~137 tok/s), wat suggereert dat de 233+ tok/s specifieke optimalisaties vereist
.
Muse Glimmer is niet primair een chatbot — het is een lokale AI-agent ontworpen voor autonome workflows . Meta heeft het expliciet afgesteld om te plannen, tools te gebruiken en te herstellen van eigen fouten
. Het ondersteunt native het Model Context Protocol (MCP) en integreert met populaire agentframeworks
.
Belangrijke toepassingen zijn: functie-aanroepen, lokaal programmeren, lange tool-sessies, LLM-as-a-judge-evaluatie, documentanalyse en persoonlijke assistenten .
Meta heeft directe vergelijkingen gepubliceerd met Google's Gemma 4 31B en Alibaba's Qwen 3.6 27B (beide in denk-/redeneermodus) :
Muse Glimmer leidt op de meeste agentische benchmarks, waaronder MCP Atlas (75,5 vs. 62,5 voor Qwen) en DeepSearch QA (74,6 vs. 71,1) . Het scoort ook 94,7 op AIME 2026, beter dan beide concurrenten
.
Kanttekening: Een analyse van een derde partij merkt op dat Glimmer achterloopt op Qwen 3.6 27B op TerminalBench 2.1 (51,7 vs. 60,7) en OSWorld-Verified (65,9 vs. 75,6), en de neiging heeft om bepaalde OS-automatiseringstaken te weigeren .
Muse Glimmer is gedistilleerd van Muse Spark (Meta's grotere, gesloten topmodel) met behulp van logit-distillatie tijdens de voortraining, gevolgd door supervised fine-tuning en RLHF . Muse Spark zelf blijft gesloten — alleen beschikbaar als een gehoste API — waardoor Glimmer de open distillatie is voor gebruikers die lokale implementatie willen
. Meta heeft aangegeven dat een open release van Muse Spark mogelijk volgt
.
Muse Glimmer is het duidelijkste product tot nu toe van Mark Zuckerbergs visie van "persoonlijke superintelligentie" — krachtige AI die lokaal draait op persoonlijke apparaten, vrij van cloudkosten, abonnementskosten of data die het apparaat verlaat . TechCrunch noemde het "het duidelijkste beeld tot nu toe" van die visie
.
De release volgt op maanden van interne onrust na de teleurstellende lancering van Llama 4 in het voorjaar van 2026, waarna Meta open AI leek te hebben verlaten. Muse Glimmer heropent die strategie .
In juni 2025 investeerde Meta 14,3 miljard dollar in data-labelingsbedrijf Scale AI, waarmee het een belang van ~49% verwierf . De deal bracht Scale's 28-jarige CEO Alexandr Wang naar Meta's nieuwe "Superintelligence"-divisie
. De investering was gericht op het veiligstellen van hoogwaardige trainingsdata en talent voor de Muse-modelfamilie
. CNBC meldde in januari 2026 dat Wang aan het hoofd stond van Meta's TBD AI-eenheid die een opvolger van Llama bouwde, met codenaam Avocado
.
Muse Glimmer is te downloaden van Hugging Face op meta-models/Muse-Glimmer-30B onder de Apache 2.0-licentie . Het heeft dag-0-ondersteuning in:
Vroege community-rapporten tonen aan dat zelfs een RTX 3090 (24 GB) het Q4_K_XL-gekwantiseerde model met DFlash en een 262K-contextvenster kan draaien met ongeveer 22-23 GB VRAM .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Meta's Muse Glimmer, uitgebracht op 10 augustus 2026, is een open model van 29,6 miljard parameters (Apache 2.0) dat volledig draait op één consumenten GPU — geen cloud vereist.
Meta's Muse Glimmer, uitgebracht op 10 augustus 2026, is een open model van 29,6 miljard parameters (Apache 2.0) dat volledig draait op één consumenten GPU — geen cloud vereist. Gedistilleerd van Meta's gesloten model Muse Spark, is Glimmer geoptimaliseerd voor lokale, altijd actieve agent workflows: plannen, toolgebruik, foutherstel en multimodaal (tekst + beeld) begrip.
Meta levert het model met 4 bit compressie (onder 20 GB VRAM) en DFlash speculatieve decodering, waardoor real time inferentie mogelijk is op hardware van een RTX 5090 tot een Apple M5 Max.