AMD 公布咗 Muse Glimmer 30B 喺最新硬件上嘅初步效能測試。測試喺 Windows 上用 llama.cpp 配合 Vulkan 後端同 dFlash 推測解碼技術執行 。
留意呢啲只係 AMD 自己量度嘅初期結果,實際表現會因系統配置、散熱同工作負載而有所出入 。
模型採用 4-bit 量化(K-Quant-Dynamic),將記憶體佔用由全精度嘅超過 55 GB 壓縮到大約 18-20 GB 。咁樣就可以將模型權重、KV Cache 同感知編碼器同時載入一張有 24 GB 或 32 GB VRAM 嘅消費級 GPU 。Meta 自己嘅測試顯示,呢個程度嘅量化對 agentic 任務嘅影響「極微甚至冇退化」。
AMD 同合作夥伴確保開發者喺首日就有多條路徑可以用 Muse Glimmer 開工。
LM Studio 直接同 Meta 合作,喺佢哋嘅 LM Studio Bionic 桌面應用程式提供首日支援 。用戶可以喺應用程式目錄入面㩒幾個掣就下載同執行模型。最細嘅 Muse Glimmer 變種最少需要 26 GB RAM 。LM Studio 喺 Windows 同 Linux 都用得,採用 llama.cpp 運行時,係 AMD 本地 AI 生態系統嘅關鍵工具 。
AMD 自家嘅開源本地 AI 伺服器 Lemonade 被定位為主要整合路徑之一 。Lemonade 透過業界標準嘅 OpenAI API 公開本地運行嘅模型,即係任何現有同 OpenAI 相容嘅應用程式都可以即刻用本地嘅 Muse Glimmer 實例 。佢支援文字生成、圖像生成同音訊模型,全部都喺一個輕量級 C++ 套件入面,可以在 Windows、Linux、macOS 同 Docker 上執行 。
除咗 LM Studio 同 Lemonade,Muse Glimmer 仲有廣泛嘅生態系統支援緊隨推出:
meta-models/Muse-Glimmer-30B,採用 Apache 2.0 授權 。呢個咁廣泛嘅工具生態意味住開發者唔會被鎖死喺某一個運行時,可以按自己需要揀最合適嘅方案 。
AMD 明言 Muse Glimmer 配合佢哋嘅硬件係「Agentic PC 嘅下一階段」。呢個戰略論點有三個層面:
完全喺本地硬件上做推理,即係敏感數據——文件、程式碼、個人資料——永遠唔會離開用戶部機。唔會有 API 呼叫去第三方伺服器,唔會有雲端供應商記錄資料,亦唔需要依賴網絡連線 。對於處理機密數據嘅企業應用,呢個係壓倒性嘅優勢。
硬件買咗之後,本地推理係冇 per-token 成本嘅。冇 API 使用費,冇推理端點嘅訂閱費,亦冇變動嘅雲端運算成本 。對於執行持續 AI Agent 循環或者大量批次工作嘅開發者嚟講,呢個徹底改變咗部署 AI Agent 嘅經濟模式。
Meta 決定以寬鬆嘅 Apache 2.0 授權釋出 Muse Glimmer,係呢個賣點嘅關鍵一環 。開發者可以完全檢查、修改、微調同重新發布模型,完全冇限制。咁就消除咗對任何單一模型供應商嘅依賴,同 AMD 建立開放生態系統對抗 Nvidia 專有 CUDA 生態嘅大方向一致 。
正如 AMD 喺官方網誌所講:「開放權重模型好似 Muse Glimmer 咁,配合強大嘅本地硬件,可以令所有推理保持私密、低延遲,而且唔受雲端 API 成本或連線狀況影響」。
雖然呢個宣布好有意義,但有幾點要留意:
AMD 確認本地支援 Meta 嘅 Muse Glimmer 30B,對本地 AI 生態系統嚟講係一個重要里程碑。佢證實咗一個有性能嘅 300 億參數 agentic 模型係可以喺單一張消費級 GPU 上運行,為開發者提供一個成熟嘅開放權重選擇(Apache 2.0),並且透過 LM Studio 同 Lemonade 提供咗清晰、即時嘅整合路徑。呢個宣布強化咗「Agentic PC」嘅論述——即係一個未來,有能力嘅 AI Agent 可以私密、持續同低成本咁喺用戶已經擁有嘅硬件上運行 。