Meta 於 2026 年 8 月 10 日發布 Muse Glimmer,這是一款約 296 億參數的開放權重代理模型(Apache 2.0 授權),完全可在單張消費級 GPU 上運行,無需連接雲端。 Muse Glimmer 是從 Meta 的封閉源碼 Muse Spark 模型蒸餾而來,專為本地、常駐運行的代理工作流程進行優化,具備規劃、工具呼叫、錯誤復原及多模態(文字+圖片)理解能力。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Meta's Muse Glimmer, a 30-billion-parameter open-weight AI model, and what are its key features, specifications (including offline c. Article summary: I need to verify this information about a model called "Muse Glimmer" from Meta. Let me search for it. Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustra
在 2026 年 8 月 10 日,Meta 超級智慧實驗室(Meta Superintelligence Labs)發布了 Muse Glimmer——一個約 296 億參數的開放權重 AI 模型,可在單張消費級 GPU 上完全運作,無需任何雲端連線 。這是 Meta 一年多來首次發布開放權重模型,標誌著在令人失望的 Llama 4 推出後,重返其開放原始碼 AI 的路線
。
Muse Glimmer 是密集因果變換器(非專家混合模型),配備一個專用的約 18 億參數 ViT-G/14 感知編碼器,用於多模態輸入 。它擁有 52 層、隱藏維度 6,656、32 個查詢頭,採用 16:1 分組查詢注意力模式
。
| 規格 | 細節 |
|---|---|
| 總參數 | ~296 億(278 億語言模型 + ~18 億視覺編碼器) |
| 脈絡視窗 | 131,072+ tokens(部分配置可達 262K) |
| 多模態輸入 | 文字 + 圖片(經由專用感知編碼器) |
| 授權條款 | Apache 2.0——允許商業使用、修改和再發布 |
| 離線/本地 | 完全在單張消費級 GPU 或 Mac 上運行——無需雲端 |
| 知識截止日 | 2026 年 1 月 4 日 |
| 訓練資料 | 涵蓋超過 100 種語言 |
完整精度模型需要約 55 GB 的 VRAM,但 Meta 提供了4 位元量化版本,將模型壓縮至 20 GB 以下 。
Meta 提供了兩種量化的發布配置,均採用 K-Quant 技術,並在 15 項基準測試中進行了評估 :
為了解決在本地運行 300 億參數模型的延遲問題,Meta 為 Muse Glimmer 搭配了 DFlash——一個小型五層投機解碼草稿模型,可一次提出16 個 tokens 的區塊,再由主模型進行平行驗證 。
Meta 報告了在 17 GB 量化模型、批次大小為 1 且使用貪婪解碼時的吞吐量 :
| 硬體 | 基線 (tok/s) | 搭配 DFlash (tok/s) | 加速倍率 |
|---|---|---|---|
| NVIDIA RTX 5090 | 74.9 | 233.4 | 3.1 倍 |
| Apple M5 Max | 26.6 | 50.2 | 1.9 倍 |
| Apple M4 Max | 23.7 | 37.8 | 1.6 倍 |
SGLang 在另一個針對相同 RTX 5090 硬體的獨立測試中,報告了 236.4 tok/s 的成績 。早期在 RTX 5090 上使用 llama.cpp 的獨立測試有時會得出較低的數字(例如,約 137 tok/s),這表明 233+ tok/s 的數據需要特定的優化才能達成
。
Muse Glimmer 主要不是一個聊天機器人——它是一個本地 AI 代理,專為自主工作流程而設計 。Meta 明確對其進行了調整,使其能夠規劃、呼叫工具,並從自身錯誤中恢復
。它原生支援模型上下文協定(MCP),並可與主流代理框架整合
。
主要應用案例包括:函數呼叫、本地程式碼編寫、長時間工具使用會話、以 LLM 作為評判(LLM-as-a-judge)、文件分析和個人助理 。
Meta 發布了與 Google 的 Gemma 4 31B 和 阿里巴巴的 Qwen 3.6 27B(均處於思考/推理模式)的直接比較結果 :
Muse Glimmer 在大多數代理基準測試中領先,包括 MCP Atlas(75.5 對 Qwen 的 62.5)和 DeepSearch QA(74.6 對 71.1)。它在 AIME 2026 上也獲得 94.7 分,領先所有競爭對手
。
注意事項: 第三方分析指出,Glimmer 在 TerminalBench 2.1(51.7 對 60.7)和 OSWorld-Verified(65.9 對 75.6)上落後於 Qwen 3.6 27B,並且傾向於拒絕某些作業系統層級的自動化任務 。
Muse Glimmer 是從 Muse Spark(Meta 更大、封閉源碼的前沿模型)透過預訓練期間的 logit 蒸餾,再經過監督式微調和 RLHF 而成 。Muse Spark 本身仍保持封閉——僅作為託管 API 提供——這使得 Glimmer 成為希望本地部署的用戶的開放權重蒸餾版
。Meta 已暗示未來可能會開放 Muse Spark
。
Muse Glimmer 是馬克·祖克柏「個人超級智慧」願景最明確的產物——強大的 AI 在個人裝置上本地運行,不受雲端成本、訂閱費用或數據離開裝置的困擾 。TechCrunch 稱其為該願景「迄今為止最清晰的圖景」
。
此次發布是在 Llama 4 於 2026 年春季令人失望的推出後,歷經數月內部動盪之後到來,當時 Meta 似乎已放棄開放權重 AI。Muse Glimmer 重新開啟了這項策略 。
2025 年 6 月,Meta 向數據標註公司 Scale AI 投資了 143 億美元,獲得約 49% 的股份 。這筆交易將 Scale 年僅 28 歲的 CEO 亞歷山大·王 引入 Meta,領導其新的「超級智慧」部門
。該投資旨在為 Muse 模型系列確保高品質的訓練數據和人才
。CNBC 在 2026 年 1 月報導,Wang 正在領導 Meta 的 TBD AI 部門,該部門正在建立一個代號為 Avocado 的 Llama 後繼模型
。
Muse Glimmer 可從 Hugging Face 的 meta-models/Muse-Glimmer-30B 下載,採用 Apache 2.0 授權 。它獲得了以下平台的首日支援:
早期的社群報告顯示,即使是 RTX 3090(24 GB),也能在 Q4_K_XL 量化模型下,搭配 DFlash 和 262K 脈絡視窗運行,僅使用約 22-23 GB 的 VRAM 。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Meta 於 2026 年 8 月 10 日發布 Muse Glimmer,這是一款約 296 億參數的開放權重代理模型(Apache 2.0 授權),完全可在單張消費級 GPU 上運行,無需連接雲端。
Meta 於 2026 年 8 月 10 日發布 Muse Glimmer,這是一款約 296 億參數的開放權重代理模型(Apache 2.0 授權),完全可在單張消費級 GPU 上運行,無需連接雲端。 Muse Glimmer 是從 Meta 的封閉源碼 Muse Spark 模型蒸餾而來,專為本地、常駐運行的代理工作流程進行優化,具備規劃、工具呼叫、錯誤復原及多模態(文字+圖片)理解能力。
Meta 為此模型搭配 4 位元量化(低於 20 GB VRAM)與 DFlash 區塊投機解碼技術,使其能在從 RTX 5090 到 Apple M5 Max 等硬體上實現即時推論。