小米推出 MiMo-V2.6,讓開放權重 AI 在代理型(agentic)與多模態開發上的競爭更加激烈。旗艦 Pro 以大型稀疏混合專家(MoE)架構搭配偏低的公開 API 定價,Flash 則主打更低成本的推論服務。
不過,企業採用決策不能只看能力、權重是否可下載或授權條款。Anthropic 指稱小米曾以未獲授權的方式使用 Claude 輸出進行蒸餾,這項尚未釐清的爭議,使訓練資料來源、法律暴險與評測完整性成為不可忽視的問題。
小米釋出了什麼?
小米公開了可下載的 MiMo-V2.6-Pro-RL 與 MiMo-V2.6-Flash-RL 檢查點,相關儲存庫列示為 MIT 授權;同時也推出 MiMo-V2.6-Distill-Qwen-9B,官方描述這是一款以 MiMo 生成資料對 Qwen3.5-9B 進行監督式微調而成的 90 億參數代理模型。
2
4
5
兩款較大型模型被定位為全模態系統,可接受文字、圖片、影片與音訊輸入,宣稱上下文窗口最長可達 100 萬 token。Pro 是稀疏 MoE 模型,總參數為 1.02 兆、每個 token 啟用 420 億參數;Flash 總參數約 3,090 億、每個 token 啟用 150 億參數。
3
MIT 授權確實給予使用者廣泛的使用與修改權利,但它不等於能證明上游訓練資料與合成輸出的完整來源,也無法自動消除第三方智慧財產權或法遵主張所帶來的風險。
效能亮點:要區分外部指標與廠商自述
報導指出,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3 獲得 46.32 分,在該比較中與 Grok 4.7 持平,並居於所引述的開放權重模型排名頂端。這是值得重視的外部訊號,但該指數屬於綜合指標,不能直接證明模型在企業自身資料、語言需求、延遲限制、安全政策或長上下文工作負載上的表現。
23
24
小米的模型資料也公布了不錯的程式設計與代理任務成績。技術報告所列 DeepSWE v1.1 強化學習結果中,Pro 的 average@3 從 58.4 提升至 72.6,Flash 則由 48.7 提升至 65.7。DeepSWE v1.1 包含 113 項程式碼庫工程任務,並以功能驗證器評估;average@3 是三次抽樣嘗試的平均通過率。
10
這些結果有參考價值,但在獨立團隊重現之前,仍應視為廠商提供的證據。部署決策應建立在以私有保留測試集(holdout)與接近實際生產情境的盲測之上,而不是只看排行榜。
Pro 與 Flash:能力與價格的取捨
| 模型 |
架構規模 |
公開 API 每百萬輸入 token 價格 |
公開 API 每百萬輸出 token 價格 |
較適合的角色 |
| MiMo-V2.6-Pro |
1.02 兆總參數/420 億啟用 |
0.435 美元 |
0.87 美元 |
難度較高的代理任務與工程評測 |
| MiMo-V2.6-Flash |
約 3,090 億總參數/150 億啟用 |
0.14 美元 |
0.28 美元 |
高量實驗與成本敏感型工作負載 |
Flash 的公開輸入與輸出 token 價格約為 Pro 的三分之一。
20 對於重視處理量、但不一定需要榨出最後一點基準分數的團隊而言,Flash 是更務實的首測選項。
但若改採自行部署,成本計算會完全不同。開放權重可提升可攜性與資料掌控度,企業卻必須自行承擔 GPU 容量、儲存、推論維運、監控、修補與支援成本。因此,token 單價最低,不必然代表總持有成本最低。
小米揭露的強化學習成本,代表什麼?
此次發布包含公開檢查點與技術報告。根據對小米揭露內容的報導,兩款大型模型各完成 30 個 RL 步驟,合計涉及約 75 萬條軌跡;小米報告 Pro 的 RL 執行成本約 262 萬美元,Flash 約 85 萬美元,合計約 347 萬美元。
18
29
不過,這些數字不應被理解為完整的模型開發成本。所引述的報導指出,該成本只涵蓋強化學習階段,預訓練成本並未公開。
29 因此,這些資料可用來觀察後訓練效率,卻不是打造整個模型所需成本的完整帳本。
為何 Claude 蒸餾指控值得企業在意?
Anthropic 在 9 月 10 日表示,已識別並阻斷其所稱的未授權 Claude 蒸餾行動,涉及 7 家位於中國的實驗室,包括小米。Anthropic 將「非法蒸餾」定義為:在未獲授權下,以工業化規模擷取模型能力並複製到另一模型的隱密行動。
47
關於這項指控的報導稱,小米記錄了涉及自家 MiMo 模型的對話,再提交給 Claude 以建立訓練資料。Anthropic 報告的二手整理指出,小米相關活動超過 40 萬次請求、涉及逾 1,500 個帳戶;同一來源亦稱,Anthropic 未觀察到 Claude 的回覆被直接提供給即時使用者。
44 Anthropic 涉及多項行動的整體數字,常被報導為約 1.9 億或接近 2 億次互動。
33
38
這些說法目前是 Anthropic 的指控,並非司法判決,也不是獨立鑑識稽核的結論。現有資料並未證明某一個特定 MiMo-V2.6 檢查點含有 Claude 衍生內容、某一位特定客戶的資料曾被傳送,或公開基準測試已受到污染。這些區別非常重要。
然而,指控仍帶來實際的盡職調查問題:
- 訓練資料的保管鏈: 企業採購方應要求了解,外部模型輸出、使用者互動或合成推理軌跡是否曾進入任何已發布檢查點的訓練或後訓練流程。
- 資料處理風險: 若客戶或使用者對話曾被轉送給外部服務,問題不僅涉及模型 IP,還可能牽涉同意、保密、保存期限、跨境資料處理與契約上的資料處理義務。
- 基準測試有效性: 若模型接觸過基準題目、解答或高度相似的教師模型衍生版本,公布成績可能被放大。現有來源沒有證明 MiMo-V2.6 基準受到污染,但在這些指控下,獨立的污染評估變得更重要。
- 商業風險分配: 開放授權不會自動提供賠償、保證、事件通知義務,或在第三方提出主張時足夠的法律救濟。
企業採用的務實框架
在資料來源問題仍未獲充分解答前,較適合將 MiMo-V2.6 視為試點候選方案,而非可立即成為企業長期核心基礎的預設選擇。
現階段可考慮的用途
- 以非敏感資料進行內部研究與評估
- 重視可攜性的隔離式自建原型
- 成本敏感的程式設計、檢索、文件處理與多模態實驗
- 具備自行進行紅隊測試、可靠性與資安評估能力的團隊
應待更強保證後再導入的用途
- 受監管或高後果決策
- 涉及高度機密的客戶、醫療、金融、政府或國防資料的工作負載
- 沒有人工覆核與回復機制的高風險程式碼生成
- 必須具備訓練資料保證、賠償條款、稽核權或明確事件應變承諾的部署
上線前的最低盡職調查要求
- 要求書面資料來源揭露。 詢問 Claude 衍生輸出、被轉送的使用者互動,或其他外部模型輸出,是否曾用於模型訓練或後訓練流程。
- 建立契約保障。 釐清賠償責任、資安事件通知、資料保存、次處理者、資料落地,以及特定模型版本與產物的可追溯性。
- 進行獨立評測。 使用私有保留測試集與抗污染任務,測試長上下文檢索、多語言行為、工具使用、幻覺率、提示注入防護與記憶化行為。
- 採取受控部署架構。 自建部署時,限制對外網路存取、實施嚴格的身分與存取控制、記錄模型使用情況,並保留切換回另一個已審核模型的機制。
- 敏感資料不得送往未核准 API。 在資料處理條款與技術控制符合內部要求前,不應將客戶資料傳送至外部端點。
結論
MiMo-V2.6 的組合條件相當吸引人:可下載的 MIT 授權權重、宣稱 100 萬 token 的多模態上下文、亮眼的已報導基準表現,以及偏低的推論定價。若目標是最大化能力,應優先評估 Pro;若要廣泛實驗並控制成本,Flash 更具經濟性。
3
20
23
但「可公開取得」不等於「已具備企業級就緒度」。在小米能提出令人滿意的資料來源、治理與風險分配證據前,企業應把 MiMo-V2.6 視為潛力很高、但必須受控驗證的模型家族;敏感或關鍵業務工作負載,則應在完成獨立驗證後再作承諾。