小米 MiMo-V2.6 對想做智能代理(agent)同多模態應用嘅企業,確實係一個相當吸引嘅開放權重選項:旗艦 Pro 用大型稀疏混合專家(MoE)架構,公布 API 價格亦相當低;Flash 就將成本再壓低,適合大規模試驗。
不過,企業唔應只問「跑分高唔高、牌照開唔開」。Anthropic 指控小米曾以未獲授權方式利用 Claude 輸出作蒸餾,令訓練資料來源、法律責任同評測可信度都出現未解疑問。對企業而言,呢啲並非單純公關風波,而係採購、合規同資訊安全都要過嘅一關。
小米今次開放咗乜嘢?
小米發布咗可下載嘅 MiMo-V2.6-Pro-RL 同 MiMo-V2.6-Flash-RL 權重,相關儲存庫列明採用 MIT 授權;另外亦發布 MiMo-V2.6-Distill-Qwen-9B,稱係用 MiMo 生成嘅資料,對 Qwen3.5-9B 作監督式微調而成嘅 90 億參數智能代理模型。
2
4
5
兩個大型模型都被定位為全模態系統,可處理文字、圖片、影片同聲音,聲稱上下文視窗最長可達 100 萬 token。Pro 屬稀疏 MoE 模型,總參數 1.02 兆,每個 token 啟用 420 億;Flash 總參數約 3,090 億,每個 token 啟用 150 億。
3
MIT 授權大致容許使用者廣泛使用同修改所發布嘅成品,但要留意:MIT 授權本身並唔能夠證明所有上游訓練輸入、合成資料或模型輸出嘅來源都無爭議,亦唔會自動解決第三方知識產權或合規申索。
性能有吸引力,但要分清獨立訊號同廠方成績
報道引述 Artificial Analysis Intelligence Index v4.3,MiMo-V2.6-Pro 得分 46.32,喺該比較中與 Grok 4.7 持平,並位列所引述嘅開放權重排行榜前列。呢個係有意義嘅外部訊號,但始終係綜合指數,唔等於模型必然適合你公司嘅私有資料、粵語/多語言需求、延遲限制、安全政策,或者超長上下文工作負載。
23
24
小米自己嘅技術資料亦列出不俗嘅程式編寫同代理能力。在技術報告所述 DeepSWE v1.1 強化學習結果中,Pro 的 average@3 分數由 58.4 升至 72.6,Flash 則由 48.7 升至 65.7。DeepSWE v1.1 包含 113 項軟件庫工程任務,以功能驗證器評核;average@3 即三次抽樣嘗試嘅平均通過率。
10
呢啲結果值得參考,但喺有獨立複現之前,仍應視為供應商自行報告嘅證據。真正部署決定,應建基於公司自設嘅盲測、私有保留測試集,同接近實際生產環境嘅任務,而唔係單靠排行榜。
Pro 對 Flash:能力與成本點樣揀?
| 模型 |
架構規模 |
已公布 API 價格:每 100 萬輸入 token |
已公布 API 價格:每 100 萬輸出 token |
較實際定位 |
| MiMo-V2.6-Pro |
1.02 兆總參數/420 億啟用 |
US$0.435 |
US$0.87 |
較複雜嘅智能代理、工程任務及能力上限評估 |
| MiMo-V2.6-Flash |
約 3,090 億總參數/150 億啟用 |
US$0.14 |
US$0.28 |
高用量試驗、成本敏感工作負載 |
按已公布價格計,Flash 嘅新輸入同輸出 token 收費都約為 Pro 三分之一。
20 如果你最關心係吞吐量同成本,而唔係追逐排行榜上最後一截性能,Flash 應該係較務實嘅首輪測試對象。
不過,自行部署會改寫條數。開放權重可帶來可攜性同較緊嘅資料控制,但企業同時要承擔 GPU 容量、儲存、推論營運、監察、修補同支援成本。每 token 最平,未必等於總持有成本最低。
小米披露嘅強化學習成本,代表到幾多?
今次發布包括公開 checkpoint 同技術報告。報道指,兩個大型模型嘅強化學習訓練各自完成 30 個 RL 步驟,合共涉及約 75 萬條軌跡;小米報告 Pro 的 RL 訓練成本約 262 萬美元,Flash 約 85 萬美元,合計約 347 萬美元。
18
29
但呢啲數字唔應被當成完整模型研發成本。引述報道指出,費用只涵蓋 RL 階段,預訓練成本並未披露。
29 所以,佢哋可以反映後訓練其中一環嘅效率,唔可以直接當成由零建立整個模型嘅總帳。
點解 Claude 蒸餾指控值得企業認真看待?
Anthropic 在 9 月 10 日表示,已識別並中止多宗針對 Claude、歸因於 7 間中國實驗室嘅涉嫌未授權蒸餾行動,當中包括小米。Anthropic 所稱嘅「非法蒸餾」,係指以工業規模抽取模型能力、未經授權複製到另一模型嘅做法。
47
有關指控嘅報道稱,小米曾記錄涉及其 MiMo 模型嘅對話,再提交予 Claude 以生成訓練資料。另一份對 Anthropic 報告嘅整理稱,小米相關活動超過 40 萬個請求、涉及逾 1,500 個帳戶;同時亦稱 Anthropic 未觀察到 Claude 回覆直接提供予即時用戶。
44 Anthropic 對更廣泛行動嘅統計,常被描述為多宗涉嫌行動合計約 1.9 億或接近 2 億次互動。
33
38
必須講清楚:呢啲係 Anthropic 提出嘅指控,唔係法院裁決,亦唔係獨立法證審計結論。現有資料未能證實某一個 MiMo-V2.6 checkpoint 必然包含 Claude 衍生內容、某個客戶資料曾被傳送,或者已發布基準測試受到污染。呢幾個分別非常重要。
但指控仍然帶出實質嘅盡職審查問題:
- 訓練資料嘅保管鏈: 企業買家需要了解,外部模型輸出、用戶互動或合成推理軌跡,有冇參與某個已發布 checkpoint 嘅訓練或後訓練。
- 資料處理風險: 如果客戶或用戶對話曾被轉送至外部服務,問題就唔止模型 IP;仲涉及同意、保密、保留期限、跨境資料處理同合約上嘅資料處理安排。
- 基準測試可信度: 若模型曾接觸測試題、答案,或者非常相近嘅教師模型生成變體,公布分數有機會被推高。現有來源並無證明 MiMo-V2.6 有基準污染,但考慮到指控,獨立污染評估就更加重要。
- 商業風險由邊個承擔: 開放牌照唔會自動提供賠償保證、品質保證、事故通知,亦未必會喺第三方提出申索時提供足夠法律補救。
企業點樣採用先至務實?
喺資料來源問題未獲充分釐清前,較合理做法係將 MiMo-V2.6 視為 適合試點嘅候選模型,而唔係即刻當成長期核心標準。
現階段較合理嘅用途
- 使用非敏感資料做內部研究及評估
- 在隔離、自行部署環境做原型開發,尤其適合重視可攜性嘅團隊
- 成本敏感嘅編程、檢索、文件處理及多模態實驗
- 本身有能力做紅隊測試、可靠性與安全評估嘅團隊
應等待更強保證先部署嘅用途
- 受監管或高後果決策
- 涉及高度機密客戶、醫療、金融、政府或國防資料嘅工作負載
- 缺乏人工覆核及回退機制嘅高風險程式碼生成
- 必須要求訓練資料保證、賠償保障、審計權或明確事故應變承諾嘅部署
上生產前最低限度要做嘅盡職審查
- 索取書面資料來源披露。 問清楚 Claude 衍生輸出、被轉送嘅用戶互動,或者其他外部模型輸出,有冇用於模型訓練或後訓練流程。
- 確立合約保障。 釐清賠償、資料外洩通知、資料保留、分包處理商、資料駐留地,以及特定版本成品嘅可追溯性。
- 做獨立評估。 用私有保留測試集同較抗污染嘅任務,測試長上下文檢索、多語言表現、工具使用、幻覺率、提示注入抵抗力同記憶化行為。
- 採用受控部署架構。 如自行部署,限制對外網絡連線,採用嚴格身份及存取控制,記錄模型使用情況,並保留切換回另一個已完成審核模型嘅路徑。
- 敏感資料唔好送去未批准 API。 在資料處理條款同技術控制未符合內部要求前,唔好將客戶資料傳送至外部端點。
結論
MiMo-V2.6 的組合確實少見:可下載嘅 MIT 授權權重、聲稱 100 萬 token 多模態上下文、亮眼嘅已報告性能,同埋相當低嘅推論價格。要追求能力上限可先評估 Pro;要大規模試驗又想控制成本,Flash 較實際。
3
20
23
但「可以公開下載」唔等於「已準備好畀企業全面投產」。在小米能夠提供令人滿意嘅資料來源、管治及風險分擔證據前,企業最穩陣嘅定位,係將 MiMo-V2.6 當成高潛力、但必須受控試行嘅模型系列;涉及敏感或關鍵業務工作負載之前,先完成獨立驗證。