Muse Glimmer to gęsty transformator przyczynowy (nie Mixture-of-Experts) z dedykowanym enkoderem percepcyjnym ViT-G/14 o ~1,8 mld parametrów do obsługi wejścia multimodalnego . Model ma 52 warstwy, ukryty wymiar 6 656 i 32 głowy zapytań ze wzorem 16:1 Grouped Query Attention
.
Pełna precyzja modelu wymaga ~55 GB VRAM, ale Meta dostarcza go z kwantyzacją 4-bitową, która kompresuje model do poniżej 20 GB .
Meta udostępnia dwie skwantowane konfiguracje, obie oparte na K-Quant i mierzone na 15 benchmarkach :
Aby rozwiązać problem opóźnień w lokalnym uruchamianiu 30-miliardowego modelu, Meta łączy Muse Glimmer z DFlash – małym, pięciowarstwowym modelem spekulacyjnym (drafter), który proponuje bloki 16 tokenów naraz, a główny model weryfikuje je równolegle .
Meta podaje następującą przepustowość dla skwantowanego modelu 17 GB przy batch size 1 i dekodowaniu zachłannym :
| Sprzęt | Bazowa (tok/s) | Z DFlash (tok/s) | Przyspieszenie |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 | 233,4 | 3,1x |
| Apple M5 Max | 26,6 | 50,2 | 1,9x |
| Apple M4 Max | 23,7 | 37,8 | 1,6x |
SGLang odnotowało 236,4 tok/s na tym samym sprzęcie RTX 5090 w osobnym pomiarze z dnia premiery . Wczesne niezależne testy na RTX 5090 z llama.cpp czasami wykazują niższe wartości (np. ~137 tok/s), co sugeruje, że wynik powyżej 233 tok/s wymaga specyficznych optymalizacji
.
Muse Glimmer nie jest przede wszystkim chatbotem – to lokalny agent AI zaprojektowany do autonomicznych przepływów pracy . Meta celowo dostroiła go do planowania, wywoływania narzędzi i odzyskiwania po własnych błędach
. Natywnie obsługuje Model Context Protocol (MCP) i integruje się z popularnymi frameworkami agentowymi
.
Kluczowe zastosowania obejmują: wywoływanie funkcji, lokalne kodowanie, długie sesje z użyciem narzędzi, ewaluację LLM-jako-sędzia, analizę dokumentów i asystentów osobistych .
Meta opublikowała bezpośrednie porównania z Google Gemma 4 31B i Alibaba Qwen 3.6 27B (oba w trybie myślenia/rozumowania) :
Muse Glimmer prowadzi w większości agentowych benchmarków, w tym MCP Atlas (75,5 vs 62,5 dla Qwen) i DeepSearch QA (74,6 vs 71,1) . Osiąga również 94,7 w AIME 2026, wyprzedzając obu konkurentów
.
Uwaga: Analizy stron trzecich wskazują, że Glimmer ustępuje Qwen 3.6 27B w TerminalBench 2.1 (51,7 vs 60,7) i OSWorld-Verified (65,9 vs 75,6) oraz ma tendencję do odmawiania niektórych zadań automatyzacji na poziomie systemu operacyjnego .
Muse Glimmer został zestyliowany z Muse Spark (większego, zamkniętego modelu Meta) przy użyciu dystylacji logitów podczas pre-treningu, a następnie nadzorowanego dostrajania i RLHF . Sam Muse Spark pozostaje zamknięty – dostępny jedynie jako hostowane API – co czyni Glimmer otwartą wagą dystylowaną dla użytkowników chcących lokalnego wdrożenia
. Meta zasygnalizowała, że otwarte wydanie Muse Spark może nastąpić później
.
Muse Glimmer jest najczystszym jak dotąd produktem wizji Marka Zuckerberga dotyczącej „osobistej superinteligencji” – potężnego AI działającego lokalnie na osobistych urządzeniach, wolnego od kosztów chmury, opłat abonamentowych czy opuszczania danych z urządzenia . TechCrunch nazwał go „najczystszym jak dotąd obrazem” tej wizji
.
Premiera następuje po miesiącach wewnętrznych zawirowań po rozczarowującej premierze Llama 4 wiosną 2026 roku, po której Meta pozornie porzuciła otwartą AI. Muse Glimmer wznawia tę strategię .
W czerwcu 2025 roku Meta zainwestowała 14,3 miliarda dolarów w firmę Scale AI zajmującą się etykietowaniem danych, nabywając ~49% udziałów . Transakcja sprowadziła 28-letniego CEO Scale, Alexandra Wanga, do kierowania nowym działem „Superinteligencji” Meta
. Inwestycja miała na celu zabezpieczenie wysokiej jakości danych treningowych i talentów dla rodziny modeli Muse
. CNBC donosiło w styczniu 2026 roku, że Wang kieruje jednostką AI TBD Meta, budującą następcę Llamy o kryptonimie Avocado
.
Muse Glimmer jest dostępny do pobrania na Hugging Face pod adresem meta-models/Muse-Glimmer-30B na licencji Apache 2.0 . Ma wsparcie od dnia premiery w:
Wczesne doniesienia społeczności pokazują, że nawet RTX 3090 (24 GB) może uruchomić skwantowany model Q4_K_XL z DFlash i oknem kontekstu 262K, używając około 22-23 GB VRAM .