En pleine précision, le modèle nécessite environ 55 Go de VRAM, mais Meta le fournit avec une quantification 4 bits qui le compresse à moins de 20 Go .
Meta propose deux configurations quantifiées, toutes deux basées sur K-Quant et évaluées sur 15 benchmarks :
Pour résoudre le problème de latence d'un modèle 30B en local, Meta associe Muse Glimmer à DFlash — un petit rédacteur de décodage spéculatif à cinq couches qui propose des blocs de 16 tokens à la fois, que le modèle principal vérifie ensuite en parallèle .
Meta annonce les débits suivants sur le modèle quantifié 17 Go en batch de taille 1 avec décodage glouton :
| Matériel | Référence (tok/s) | Avec DFlash (tok/s) | Accélération |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 | 233,4 | 3,1x |
| Apple M5 Max | 26,6 | 50,2 | 1,9x |
| Apple M4 Max | 23,7 | 37,8 | 1,6x |
SGLang a rapporté 236,4 tok/s sur le même RTX 5090 lors d'une mesure séparée le jour du lancement . Les premiers tests indépendants sur un RTX 5090 avec llama.cpp donnent parfois des résultats inférieurs (environ 137 tok/s), suggérant que le chiffre de 233+ tok/s nécessite des optimisations spécifiques
.
Muse Glimmer n'est pas principalement un chatbot — c'est un agent IA local conçu pour des flux de travail autonomes . Meta l'a explicitement optimisé pour planifier, appeler des outils et se remettre de ses propres erreurs
. Il supporte nativement le Model Context Protocol (MCP) et s'intègre aux frameworks d'agents populaires
.
Les cas d'usage clés incluent : l'appel de fonctions, le codage local, les sessions prolongées d'utilisation d'outils, l'évaluation LLM-as-a-judge, l'analyse de documents et les assistants personnels .
Meta a publié des comparaisons directes avec les Gemma 4 31B de Google et Qwen 3.6 27B d'Alibaba (tous deux en mode raisonnement) :
Muse Glimmer est en tête sur la plupart des benchmarks agentiques, notamment MCP Atlas (75,5 contre 62,5 pour Qwen) et DeepSearch QA (74,6 contre 71,1) . Il atteint également 94,7 sur AIME 2026, devançant ses deux concurrents
.
Nuance importante : Une analyse tierce note que Glimmer est devancé par Qwen 3.6 27B sur TerminalBench 2.1 (51,7 contre 60,7) et OSWorld-Verified (65,9 contre 75,6), et a tendance à refuser certaines tâches d'automatisation au niveau du système d'exploitation .
Muse Glimmer a été distillé depuis Muse Spark (le modèle fermé de pointe de Meta) en utilisant la distillation par logits pendant le pré-entraînement, suivie d'un fine-tuning supervisé et d'un RLHF . Muse Spark reste fermé — disponible uniquement via API hébergée — faisant de Glimmer la version open-weight pour les utilisateurs souhaitant un déploiement local
. Meta a indiqué qu'une version ouverte de Muse Spark pourrait suivre
.
Muse Glimmer est la concrétisation la plus aboutie de la vision de Mark Zuckerberg d'une « superintelligence personnelle » — une IA puissante fonctionnant localement sur les appareils personnels, sans coûts cloud, abonnements ni fuite de données . TechCrunch l'a qualifié de « l'image la plus claire à ce jour » de cette vision
.
Cette publication fait suite à des mois de turbulences internes après le lancement décevant de Llama 4 au printemps 2026, qui avait vu Meta sembler abandonner l'IA open-weight. Muse Glimmer rouvre cette stratégie .
En juin 2025, Meta a investi 14,3 milliards de dollars dans la société d'annotation de données Scale AI, acquérant une participation d'environ 49 % . L'accord a amené le PDG de Scale, Alexandr Wang (28 ans), à diriger la nouvelle division « Superintelligence » de Meta
. Cet investissement visait à sécuriser des données d'entraînement de haute qualité et des talents pour la famille de modèles Muse
. CNBC rapportait en janvier 2026 que Wang dirigeait l'unité TBD d'IA de Meta, développant un successeur à Llama, nom de code Avocado
.
Muse Glimmer est téléchargeable depuis Hugging Face à l'adresse meta-models/Muse-Glimmer-30B sous licence Apache 2.0 . Il bénéficie d'un support dès le premier jour sur :
Les premiers retours de la communauté montrent qu'une RTX 3090 (24 Go) peut exécuter le modèle quantifié Q4_K_XL avec DFlash et une fenêtre de contexte de 262K en utilisant environ 22-23 Go de VRAM .