Meta Muse Glimmer, vydaný 10. srpna 2026, je otevřený model s 29,6 miliardami parametrů (Apache 2.0), který běží zcela na jedné spotřebitelské grafické kartě – bez nutnosti cloudového připojení.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Meta's Muse Glimmer, a 30-billion-parameter open-weight AI model, and what are its key features, specifications (including offline c. Article summary: I need to verify this information about a model called "Muse Glimmer" from Meta. Let me search for it. Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustra
Společnost Meta Superintelligence Labs uvedla 10. srpna 2026 model Muse Glimmer – otevřený model s přibližně 29,6 miliardami parametrů, který je navržen tak, aby běžel zcela na jedné spotřebitelské grafické kartě bez nutnosti jakéhokoli cloudového připojení . Jde o první otevřený model od Mety po více než roce, čímž se firma vrací ke svým kořenům v oblasti otevřené AI po zklamání s modelem Llama 4
.
Muse Glimmer je hustý kauzální transformer (nikoli Mixture-of-Experts) s vyhrazeným percepčním kodérem ViT-G/14 o velikosti ~1,8 miliardy parametrů pro multimodální vstup . Má 52 vrstev, skrytou dimenzi 6 656 a 32 dotazovacích hlav s patternem Grouped Query Attention v poměru 16:1
.
Model v plné přesnosti vyžaduje ~55 GB VRAM, ale Meta jej dodává s 4bitovou kvantizací, která model komprimuje pod 20 GB .
Meta dodává dvě kvantizované konfigurace, obě postavené na K-Quant a měřené proti 15 benchmarkům :
Nezávislé laboratoře zatím tato agregovaná tvrzení o degradaci neověřily .
K vyřešení problému latence při lokálním běhu 30miliardového modelu Meta nasazuje DFlash – malý pětivrstvý spekulativní dekodér, který navrhuje bloky o 16 tokenech najednou, jež hlavní model následně paralelně ověřuje .
Meta uvádí následující propustnost na 17GB kvantizovaném modelu při velikosti dávky 1 a greedy dekódování :
| Hardware | Základ (tok/s) | S DFlash (tok/s) | Zrychlení |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 | 233,4 | 3,1x |
| Apple M5 Max | 26,6 | 50,2 | 1,9x |
| Apple M4 Max | 23,7 | 37,8 | 1,6x |
Společnost SGLang naměřila na stejném hardwaru RTX 5090 v den vydání 236,4 tok/s . První nezávislé testy na RTX 5090 s llama.cpp někdy ukazují nižší hodnoty (např. ~137 tok/s), což naznačuje, že hodnota 233+ tok/s vyžaduje specifické optimalizace
.
Muse Glimmer není primárně chatbot – je to lokální AI agent navržený pro autonomní workflow . Meta jej explicitně vyladila na to, aby plánoval, volal nástroje a sám se zotavoval z vlastních chyb
. Nativně podporuje Model Context Protocol (MCP) a integruje se s populárními frameworky pro agenty
.
Klíčové případy použití zahrnují: volání funkcí, lokální kódování, dlouhé relace s nástroji, vyhodnocování LLM-as-a-judge, analýzu dokumentů a osobní asistenty .
Meta publikovala přímá srovnání s Google Gemma 4 31B a Alibaba Qwen 3.6 27B (oba v režimu myšlení/uvažování) :
Muse Glimmer vede ve většině agentních benchmarků, včetně MCP Atlas (75,5 vs. 62,5 pro Qwen) a DeepSearch QA (74,6 vs. 71,1) . Dosahuje také 94,7 na AIME 2026, čímž poráží oba konkurenty
.
Upozornění: Jedna analýza třetí strany poznamenává, že Glimmer zaostává za Qwen 3.6 27B v TerminalBench 2.1 (51,7 vs. 60,7) a OSWorld-Verified (65,9 vs. 75,6) a má tendenci odmítat některé úlohy automatizace na úrovni OS .
Muse Glimmer byl destilován z Muse Spark (většího, uzavřeného modelu Mety) pomocí logitové destilace během předtréninku, následované supervised fine-tuningem a RLHF . Muse Spark samotný zůstává uzavřený – je dostupný pouze jako hostované API – což z Glimmeru činí otevřenou destilaci pro uživatele, kteří chtějí lokální nasazení
. Meta naznačila, že by otevřené vydání Muse Spark mohlo následovat
.
Muse Glimmer je dosud nejjasnějším produktem vize Marka Zuckerberga o „osobní superinteligenci“ – výkonné AI běžící lokálně na osobních zařízeních, bez nákladů na cloud, předplatného nebo odesílání dat ze zařízení . TechCrunch to označil za „dosud nejjasnější obrázek“ této vize
.
Vydání následuje po měsících interních turbulencí po zklamání s modelem Llama 4 na jaře 2026, po kterém Meta vypadala, že opouští otevřenou AI. Muse Glimmer tuto strategii znovu otevírá .
V červnu 2025 Meta investovala 14,3 miliardy dolarů do firmy Scale AI, která se specializuje na označování dat, a získala tak přibližně 49% podíl . Součástí dohody byl i příchod 28letého CEO Scale Alexandra Wanga, který vede novou divizi Mety pro „superinteligenci“
. Investice byla zaměřena na zajištění kvalitních trénovacích dat a talentu pro modelovou rodinu Muse
. CNBC v lednu 2026 informovala, že Wang vede jednotku TBD AI, která buduje nástupce Llamy s kódovým označením Avocado
.
Muse Glimmer je ke stažení na Hugging Face pod názvem meta-models/Muse-Glimmer-30B pod licencí Apache 2.0 . Má podporu v den vydání v:
První komunitní zprávy ukazují, že i RTX 3090 (24 GB) dokáže provozovat kvantizovaný model Q4_K_XL s DFlash a 262K kontextovým oknem s využitím přibližně 22-23 GB VRAM .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Meta Muse Glimmer, vydaný 10. srpna 2026, je otevřený model s 29,6 miliardami parametrů (Apache 2.0), který běží zcela na jedné spotřebitelské grafické kartě – bez nutnosti cloudového připojení.
Meta Muse Glimmer, vydaný 10. srpna 2026, je otevřený model s 29,6 miliardami parametrů (Apache 2.0), který běží zcela na jedné spotřebitelské grafické kartě – bez nutnosti cloudového připojení. Destilovaný z uzavřeného modelu Muse Spark, Glimmer je optimalizovaný pro lokální a vždy zapnuté agentní workflow: plánování, volání nástrojů, opravu vlastních chyb a multimodální porozumění (text + obrázky).
Meta model doplňuje 4bitovou kvantizací (pod 20 GB VRAM) a DFlash blokovou spekulativní dekódováním, což umožňuje inferenci v reálném čase na hardwaru od RTX 5090 po Apple M5 Max.