Повна точність моделі потребує ~55 GB VRAM, але Meta постачає її з 4-бітним квантуванням, яке стискає модель до менш ніж 20 GB .
Щоб вирішити проблему затримки при запуску 30B-моделі локально, Meta поєднує Muse Glimmer із DFlash — невеликим п'ятишаровим спекулятивним драфтером, який пропонує блоки з 16 токенів за раз, а основна модель перевіряє їх паралельно .
Meta публікує такі показники пропускної здатності для 17-GB квантованої моделі з розміром пакета 1 і жадібним декодуванням :
| Обладнання | Базове (ток/с) | З DFlash (ток/с) | Прискорення |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 | 233,4 | 3,1x |
| Apple M5 Max | 26,6 | 50,2 | 1,9x |
| Apple M4 Max | 23,7 | 37,8 | 1,6x |
SGLang повідомив про 236,4 ток/с на тому ж RTX 5090 в окремому вимірюванні . Ранні незалежні тести на RTX 5090 з llama.cpp іноді показують нижчі значення (наприклад, ~137 ток/с), що свідчить про необхідність специфічних оптимізацій для досягнення 233+ ток/с
.
Muse Glimmer — це не просто чат-бот, а локальний ШІ-агент, призначений для автономних робочих процесів . Meta навмисно налаштувала її на планування, виклик інструментів і відновлення після власних помилок
. Вона рідно підтримує протокол Model Context Protocol (MCP) та інтегрується з популярними агентними фреймворками
.
Основні сценарії використання: виклик функцій, локальне кодування, тривалі сесії з інструментами, оцінка LLM-as-a-judge, аналіз документів і персональні асистенти .
Meta опублікувала прямі порівняння з Google Gemma 4 31B і Alibaba Qwen 3.6 27B (обидві в режимі міркування) :
Muse Glimmer лідирує на більшості агентних бенчмарків, зокрема MCP Atlas (75,5 проти 62,5 у Qwen) і DeepSearch QA (74,6 проти 71,1) . Вона також набирає 94,7 на AIME 2026, випереджаючи обох конкурентів
.
Застереження: Сторонній аналіз зауважує, що Glimmer поступається Qwen 3.6 27B на TerminalBench 2.1 (51,7 проти 60,7) і OSWorld-Verified (65,9 проти 75,6), а також схильна відмовлятися від певних завдань автоматизації ОС .
Muse Glimmer була дистильована з Muse Spark (більшої, закритої флагманської моделі Meta) за допомогою логітної дистиляції під час попереднього навчання з подальшим контрольним доналаштуванням і RLHF . Сама Muse Spark залишається закритою — доступна лише як API — що робить Glimmer open-weight версією для локального розгортання
. Meta натякнула, що відкритий реліз Muse Spark може відбутися пізніше
.
Muse Glimmer — найчіткіше втілення бачення Марка Цукерберга про «персональний суперінтелект» — потужний ШІ, що працює локально на персональних пристроях, без витрат на хмару, підписок або передачі даних із пристрою . TechCrunch назвав це «найяснішим зображенням» цього бачення
.
Реліз відбувся після місяців внутрішньої турбулентності після невдалого запуску Llama 4 навесні 2026 року, коли Meta, здавалося, відмовилася від відкритих ваг. Muse Glimmer відновлює цю стратегію .
У червні 2025 року Meta інвестувала $14,3 мільярда у фірму з маркування даних Scale AI, отримавши ~49% частки . Угода привела 28-річного генерального директора Scale Александра Вана до керівництва новим підрозділом «Superintelligence» Meta
. Інвестиція мала на меті забезпечити високоякісні тренувальні дані та talent для сімейства моделей Muse
. CNBC повідомляла в січні 2026 року, що Ван очолював підрозділ TBD AI, який будував наступника Llama під кодовою назвою Avocado
.
Muse Glimmer доступна для завантаження з Hugging Face за посиланням meta-models/Muse-Glimmer-30B під ліцензією Apache 2.0 . Вона має підтримку з першого дня в:
Ранні повідомлення спільноти свідчать, що навіть RTX 3090 (24 GB) може запустити квантовану модель Q4_K_XL із DFlash і контекстом 262K, використовуючи приблизно 22-23 GB VRAM .