Muse Glimmer, rilasciato il 10 agosto 2026 da Meta Superintelligence Labs, è un modello agentico open weight (Apache 2.0) da 29,6 miliardi di parametri che gira interamente su una singola GPU consumer, senza connessio... Derivato dal modello chiuso Muse Spark, Glimmer è ottimizzato per flussi di lavoro agentici loca...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Meta's Muse Glimmer, a 30-billion-parameter open-weight AI model, and what are its key features, specifications (including offline c. Article summary: I need to verify this information about a model called "Muse Glimmer" from Meta. Let me search for it. Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustra
Il 10 agosto 2026, Meta Superintelligence Labs ha rilasciato Muse Glimmer, un modello AI open-weight di circa 29,6 miliardi di parametri, progettato per funzionare interamente su una singola GPU consumer, senza necessità di connessione al cloud . Si tratta della prima release open-weight di Meta dopo oltre un anno, segnando un ritorno alle radici open-source dell'azienda dopo il deludente lancio di Llama 4
.
Muse Glimmer è un transformer causale denso (non Mixture-of-Experts) con un encoder percettivo ViT-G/14 da ~1,8 miliardi di parametri dedicato all'input multimodale (testo e immagini) . La sua architettura prevede 52 layer, una dimensione nascosta di 6.656, 32 query head con un pattern di attenzione GQA 16:1, e una dimensione intermedia FFN SwiGLU di 19.968
.
Il modello a piena precisione richiederebbe circa 55 GB di VRAM, ma Meta lo distribuisce con quantizzazione a 4 bit che lo comprime a meno di 20 GB .
Meta distribuisce due configurazioni quantizzate, entrambe basate su K-Quant e misurate su 15 benchmark :
Laboratori indipendenti non hanno ancora riprodotto queste stime aggregate di degrado .
Per risolvere il problema della latenza nell'esecuzione locale di un modello da 30 miliardi di parametri, Meta affianca a Muse Glimmer DFlash, un piccolo drafter di decodifica speculativa a cinque layer che propone blocchi di 16 token alla volta, che il modello principale verifica poi in parallelo .
Meta riporta i seguenti throughput sulla versione quantizzata da 17 GB con batch size 1 e decodifica greedy :
| Hardware | Baseline (token/s) | Con DFlash (token/s) | Accelerazione |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 | 233,4 | 3,1x |
| Apple M5 Max | 26,6 | 50,2 | 1,9x |
| Apple M4 Max | 23,7 | 37,8 | 1,6x |
SGLang ha riportato 236,4 token/s sullo stesso hardware RTX 5090 in una misurazione separata giorno-zero . Test indipendenti preliminari su RTX 5090 con llama.cpp a volte mostrano valori inferiori (es. ~137 token/s), suggerendo che il dato di 233+ token/s richieda ottimizzazioni specifiche
.
Muse Glimmer non è principalmente un chatbot: è un agente AI locale progettato per flussi di lavoro autonomi . Meta lo ha espressamente ottimizzato per pianificare, chiamare strumenti e recuperare dai propri errori
. Supporta nativamente il Model Context Protocol (MCP) e si integra con i framework agentici più diffusi
.
I casi d'uso chiave includono: chiamate a funzioni, coding locale, sessioni prolungate di uso di strumenti, valutazione LLM-as-a-judge, analisi di documenti e assistenti personali .
Meta ha pubblicato confronti diretti con Gemma 4 31B di Google e Qwen 3.6 27B di Alibaba (entrambi in modalità ragionamento) :
Muse Glimmer è in testa nella maggior parte dei benchmark agentici, inclusi MCP Atlas (75,5 contro 62,5 per Qwen) e DeepSearch QA (74,6 contro 71,1) . Ottiene anche 94,7 su AIME 2026, superando entrambi i concorrenti
.
Avvertenza: Un'analisi di terze parti nota che Glimmer è in ritardo rispetto a Qwen 3.6 27B su TerminalBench 2.1 (51,7 contro 60,7) e OSWorld-Verified (65,9 contro 75,6), e tende a rifiutare alcuni compiti di automazione a livello di sistema operativo .
Muse Glimmer è stato distillato da Muse Spark (il modello frontier più grande e chiuso di Meta) utilizzando distillazione logit durante il pre-training, seguito da supervised fine-tuning e RLHF . Muse Spark stesso rimane chiuso — disponibile solo come API hosted — rendendo Glimmer la distillazione open-weight per gli utenti che desiderano un'implementazione locale
. Meta ha indicato che potrebbe seguire un rilascio open di Muse Spark
.
Muse Glimmer è il prodotto più chiaro finora della visione di Mark Zuckerberg di una "superintelligenza personale" — un'AI potente che funziona localmente sui dispositivi personali, libera da costi cloud, abbonamenti o dalla necessità di inviare dati fuori dal dispositivo . TechCrunch lo ha definito "il quadro più chiaro finora" di quella visione
.
Il rilascio segue mesi di turbolenze interne dopo il deludente lancio di Llama 4 nella primavera del 2026, dopo il quale Meta sembrava aver abbandonato l'AI open-weight. Muse Glimmer riapre quella strategia .
Nel giugno 2025, Meta ha investito 14,3 miliardi di dollari in Scale AI, un'azienda specializzata nell'etichettatura dei dati, acquisendo una partecipazione di circa il 49% . L'accordo ha portato l'amministratore delegato ventottenne di Scale, Alexandr Wang, a guidare la nuova divisione "Superintelligence" di Meta
. L'investimento mirava a garantire dati di training di alta qualità e talento per la famiglia di modelli Muse
. A gennaio 2026, CNBC ha riferito che Wang stava guidando l'unità AI TBD di Meta, impegnata nello sviluppo di un successore di Llama, nome in codice Avocado
.
Muse Glimmer è scaricabile da Hugging Face all'indirizzo meta-models/Muse-Glimmer-30B con licenza Apache 2.0 . Ha supporto giorno zero in:
I primi report della community mostrano che anche una RTX 3090 (24 GB) può eseguire il modello quantizzato Q4_K_XL con DFlash e una finestra di contesto di 262K utilizzando circa 22-23 GB di VRAM .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Muse Glimmer, rilasciato il 10 agosto 2026 da Meta Superintelligence Labs, è un modello agentico open weight (Apache 2.0) da 29,6 miliardi di parametri che gira interamente su una singola GPU consumer, senza connessio...
Muse Glimmer, rilasciato il 10 agosto 2026 da Meta Superintelligence Labs, è un modello agentico open weight (Apache 2.0) da 29,6 miliardi di parametri che gira interamente su una singola GPU consumer, senza connessio... Derivato dal modello chiuso Muse Spark, Glimmer è ottimizzato per flussi di lavoro agentici locali: pianificazione, uso di strumenti, recupero errori e comprensione multimodale (testo+immagini).
Meta lo accompagna con quantizzazione a 4 bit (sotto i 20 GB di VRAM) e decodifica speculativa DFlash a blocchi, raggiungendo fino a 233 token al secondo su una RTX 5090.