为了解决在本地运行 300 亿参数模型带来的延迟问题,Meta 为 Muse Glimmer 配备了 DFlash——一个只有 5 层的小型推测解码模型,它能够一次性提出 16 个 token 的块,然后由主模型进行并行验证 。
| 硬件 | 基准速度 (tok/s) | 开启 DFlash 后 (tok/s) | 加速比 |
|---|---|---|---|
| NVIDIA RTX 5090 | 74.9 | 233.4 | 3.1x |
| Apple M5 Max | 26.6 | 50.2 | 1.9x |
| Apple M4 Max | 23.7 | 37.8 | 1.6x |
SGLang 在另一项独立测试中,于相同硬件上报告了 236.4 tok/s 的成绩 。然而,早期的独立测试(如使用 llama.cpp 的 RTX 5090 测试)有时会得到较低的结果(例如约 137 tok/s),这表明要达到 233+ tok/s 需要特定的软件优化
。
Muse Glimmer 并非一个单纯的聊天机器人,而是一个本地化的 AI 智能体,专为自主工作流设计 。Meta 明确将其调优为能够自主规划、调用工具并从自身错误中恢复
。它原生支持模型上下文协议(MCP),并能与主流的智能体框架集成
。
Muse Glimmer 在大多数智能体基准测试中处于领先地位,包括 MCP Atlas(75.5 vs Qwen 的 62.5)和 DeepSearch QA(74.6 vs 71.1)。在 AIME 2026 上获得了 94.7 分,领先所有竞品
。
值得注意的例外: 第三方分析指出,Glimmer 在 TerminalBench 2.1(51.7 vs 60.7)和 OSWorld-Verified(65.9 vs 75.6)上落后于 Qwen 3.6 27B,并且倾向于拒绝某些操作系统级别的自动化任务 。
Muse Glimmer 是从 Meta 更大、且闭源的旗舰模型 Muse Spark 中 蒸馏 而来,在预训练阶段使用了logit 蒸馏技术,随后进行了监督微调和 RLHF 。Muse Spark 本身仍然保持闭源,仅作为托管 API 提供,而 Glimmer 则是面向希望本地部署用户的开源蒸馏版本
。Meta 已暗示未来可能会开源 Muse Spark
。
Muse Glimmer 是马克·扎克伯格 "个人超级智能" 愿景最清晰的体现——即让强大的 AI 在个人设备上本地运行,摆脱云端成本、订阅费和数据离设备的安全担忧 。TechCrunch 称其为该愿景的“迄今为止最清晰的图景”
。
2025 年 6 月,Meta 向数据标注公司 Scale AI 投资了 143 亿美元,获得了约 49% 的股份 。这笔交易将 Scale AI 当时 28 岁的 CEO Alexandr Wang 带到了 Meta,负责领导新成立的“超级智能”部门
。该投资旨在为 Muse 模型系列获取高质量的培训数据和人才
。CNBC 在 2026 年 1 月报道称,Wang 正领导 Meta 的 TBD AI 部门,开发代号为“Avocado”的 Llama 下一代继任者
。
Muse Glimmer 现在可以从 Hugging Face 的 meta-models/Muse-Glimmer-30B 仓库下载,采用 Apache 2.0 许可证 。它获得了多项首日工具支持: