Metas Muse Glimmer, udgivet 10. august 2026, er en open weight (29,6 mia. Distilleret fra Metas lukkede Muse Spark model og optimeret til lokale, altid on agentworkflows: planlægning, brug af værktøjer, fejlhåndtering og multimodal (tekst + billeder) forståelse.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Meta's Muse Glimmer, a 30-billion-parameter open-weight AI model, and what are its key features, specifications (including offline c. Article summary: I need to verify this information about a model called "Muse Glimmer" from Meta. Let me search for it. Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustra
On August 10, 2026, Meta Superintelligence Labs released Muse Glimmer — a ~29.6-billion-parameter open-weight AI model that runs entirely on a single consumer GPU, without requiring any cloud connection . It is Meta's first open-weight release in over a year, signaling a return to its open-source AI roots after the disappointing launch of Llama 4
.
Muse Glimmer er en tæt kausal transformer (ikke Mixture-of-Experts) med en dedikeret ~1,8 mia.-parameter ViT-G/14 perceptionskoder til multimodal input . Modellen har 52 lag, en skjult dimension på 6.656 og 32 query-heads med et 16:1 Grouped Query Attention-mønster
.
Full-precision-modellen kræver ~55 GB VRAM, men Meta leverer den med 4-bit kvantisering, der komprimerer modellen til under 20 GB .
Meta leverer to kvantiserede konfigurationer, begge bygget med K-Quant og målt på 15 benchmarks :
Uafhængige laboratorier har endnu ikke reproduceret disse aggregerede forringelsespåstande .
For at løse latency-problemet ved at køre en 30B-model lokalt, parrer Meta Muse Glimmer med DFlash — en lille femlags spekulativ-dekodnings-drafter, der foreslår blokke på 16 tokens ad gangen, som hovedmodellen derefter verificerer parallelt .
Meta rapporterer følgende gennemstrømning på den 17 GB kvantiserede model ved batch-størrelse 1 med greedy decoding :
| Hardware | Baseline (tok/s) | Med DFlash (tok/s) | Speedup |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 | 233,4 | 3,1x |
| Apple M5 Max | 26,6 | 50,2 | 1,9x |
| Apple M4 Max | 23,7 | 37,8 | 1,6x |
SGLang rapporterede 236,4 tok/s på samme RTX 5090-hardware i en separat dag-0-måling . Tidlige uafhængige tests på et RTX 5090 med llama.cpp viser nogle gange lavere tal (f.eks. ~137 tok/s), hvilket tyder på, at de 233+ tok/s kræver specifikke optimeringer
.
Muse Glimmer er primært ikke en chatbot — det er en lokal AI-agent designet til autonome arbejdsflows . Meta har eksplicit tunet den til at planlægge, kalde værktøjer og komme sig over sine egne fejl
. Den understøtter Model Context Protocol (MCP) nativt og integreres med populære agent-rammeværker
.
Centrale anvendelsestilfælde inkluderer: funktionskald, lokal kodning, lange værktøjssessioner, LLM-som-dommer-evaluering, dokumentanalyse og personlige assistenter .
Meta har publiceret direkte sammenligninger mod Googles Gemma 4 31B og Alibabas Qwen 3.6 27B (begge i tænke-/ræsonnement-mode) :
Muse Glimmer fører på de fleste agentbaserede benchmarks, inklusive MCP Atlas (75,5 vs. 62,5 for Qwen) og DeepSearch QA (74,6 vs. 71,1) . Den scorer også 94,7 på AIME 2026 og overgår dermed begge konkurrenter
.
Forbehold: En tredjepartsanalyse bemærker, at Glimmer halter efter Qwen 3.6 27B på TerminalBench 2.1 (51,7 vs. 60,7) og OSWorld-Verificeret (65,9 vs. 75,6) og har en tendens til at afvise visse OS-niveau-automationsopgaver .
Muse Glimmer blev destilleret fra Muse Spark (Metas større, lukkede frontlinjemodel) ved hjælp af logit-destillation under præ-træning, efterfulgt af superviseret finjustering og RLHF . Muse Spark selv forbliver lukket — kun tilgængelig som en hosted API — hvilket gør Glimmer til den open-weight-destillation for brugere, der ønsker lokal implementering
. Meta har indikeret, at en åben udgivelse af Muse Spark kan følge
.
Muse Glimmer er det klareste produkt hidtil af Mark Zuckerbergs vision om "personlig superintelligens" — kraftfuld AI, der kører lokalt på personlige enheder, fri for skyomkostninger, abonnementsgebyrer eller data, der forlader enheden . TechCrunch kaldte det "det klareste billede endnu" af den vision
.
Udgivelsen følger måneders intern uro efter Llama 4's skuffende lancering i foråret 2026, hvorefter Meta så ud til at opgive open-weight-AI. Muse Glimmer genåbner den strategi .
I juni 2025 investerede Meta 14,3 milliarder dollars i data-labelingsfirmaet Scale AI og opnåede en ~49%-andel . Aftalen bragte Scales 28-årige CEO Alexandr Wang til at lede Metas nye "Superintelligence"-division
. Investeringen havde til formål at sikre træningsdata og talent af høj kvalitet til Muse-modelfamilien
. CNBC rapporterede i januar 2026, at Wang ledede Metas TBD AI-enhed, der byggede en efterfølger til Llama, med kodenavnet Avocado
.
Muse Glimmer kan downloades fra Hugging Face på meta-models/Muse-Glimmer-30B under Apache 2.0-licensen . Den har dag-0-support i:
Tidlige community-rapporter viser, at selv et RTX 3090 (24 GB) kan køre den Q4_K_XL-kvantiserede model med DFlash og et 262K kontekstvindue ved hjælp af omkring 22-23 GB VRAM .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Metas Muse Glimmer, udgivet 10. august 2026, er en open weight (29,6 mia.
Metas Muse Glimmer, udgivet 10. august 2026, er en open weight (29,6 mia. Distilleret fra Metas lukkede Muse Spark model og optimeret til lokale, altid on agentworkflows: planlægning, brug af værktøjer, fejlhåndtering og multimodal (tekst + billeder) forståelse.
Meta leverer modellen med 4 bit kvantisering (under 20 GB VRAM) og DFlash blokvis spekulativ dekodning, hvilket giver realtidsinferens på hardware lige fra RTX 5090 fans til en Apple M5 Max.