Muse Glimmer 係一個 密集因果轉換器(Dense Causal Transformer),唔係混合專家模型(MoE),佢內置一個約 18 億參數嘅 ViT-G/14 感知編碼器嚟處理圖像輸入 。
| 規格 | 詳細資料 |
|---|---|
| 總參數 | ~29.6B(27.8B 語言模型 + ~1.8B 視覺編碼器) |
| 脈絡長度 | 131,072+ tokens(某啲配置可以上到 262K) |
| 多模態輸入 | 文字 + 圖像(經專用感知編碼器) |
| 授權 | Apache 2.0——可以商業用途、修改同重新發佈 |
| 離線/本地運行 | 完全喺一張消費級顯示卡或 Mac 上面行——唔使連雲端 |
| 知識截止日期 | 2026 年 1 月 4 日 |
| 訓練數據 | 涵蓋超過 100 種語言 |
為咗解決喺本地運行 300 億參數模型嘅 latency 問題,Meta 將 Muse Glimmer 配備咗 DFlash——一個得五層嘅推測解碼器,可以一次過提議 16 個 tokens,然後主模型並行驗證呢啲提議 。
| 硬件 | 基準 (tok/s) | 開 DFlash (tok/s) | 加速倍數 |
|---|---|---|---|
| NVIDIA RTX 5090 | 74.9 | 233.4 | 3.1x |
| Apple M5 Max | 26.6 | 50.2 | 1.9x |
| Apple M4 Max | 23.7 | 37.8 | 1.6x |
SGLang 喺同一張 RTX 5090 上面量度到 236.4 tok/s 。不過,有獨立用家喺 llama.cpp 上面測試 RTX 5090 時,只係得到大約 ~137 tok/s,顯示要達到 233+ tok/s 需要特定嘅優化設定
。
Muse Glimmer 主要唔係用嚟傾偈——佢係一個本地 AI 代理,專為自主工作流程而設 。Meta 特別將佢 tune 到可以計劃、叫工具、同埋從錯誤中自我修正
。佢原生支援 Model Context Protocol (MCP),可以同主流嘅代理框架整合
。
Muse Glimmer 喺大部分代理基準測試上領先,包括 MCP Atlas(75.5 vs Qwen 嘅 62.5)同 DeepSearch QA(74.6 vs 71.1)。喺 AIME 2026 數學推理上佢攞到 94.7,壓過晒兩個對手
。
要留意嘅地方: 有第三方分析指出,Glimmer 喺 TerminalBench 2.1(51.7 vs 60.7)同 OSWorld-Verified(65.9 vs 75.6)上落後 Qwen 3.6 27B,而且佢對某啲 OS 級別嘅自動化任務會有啲抗拒 。
Muse Glimmer 係從 Muse Spark 蒸餾出嚟嘅——用咗預訓練期間嘅 logit 蒸餾,再加監督式微調同 RLHF 。Muse Spark 本身仍然封閉,只得 API 版本,所以 Glimmer 係開放權重嘅版本,畀想本地部署嘅用家
。Meta 話將來可能會開放 Muse Spark
。
Muse Glimmer 係 Mark Zuckerberg 所講嘅 「個人超級智能」 vision 嘅最具體體現——即係強大嘅 AI 可以喺個人裝置上本地運行,唔使交雲端費、唔使畀月費、數據唔會離開部機 。TechCrunch 叫佢做「呢個願景目前最清晰嘅藍圖」
。
呢次發佈係喺 Llama 4 喺 2026 年春天令人失望之後,Meta 內部經歷咗幾個月動盪之後嘅動作。之前 Meta 好似放棄咗開源 AI 路線,而家 Muse Glimmer 重新打開咗呢個策略 。
2025 年 6 月,Meta 投資咗 143 億美元 喺數據標註公司 Scale AI,攞到大概 49% 嘅股份 。呢單交易帶埋 Scale 當時得 28 歲嘅 CEO Alexandr Wang 過檔嚟 Meta,領導新成立嘅「超級智能」部門
。呢筆投資係為咗確保高質素嘅訓練數據同人才,用嚟開發 Muse 模型系列
。CNBC 喺 2026 年 1 月報道,Wang 正領導 Meta 嘅 TBD AI 部門,緊接 Llama 開發代號為 Avocado 嘅新模型
。