MiMo-V2.6-Pro 值得留意,不單因為佢喺一項廣受追蹤的綜合基準上登上開放權重模型首位,更因為小米同時開出相當低的 API 價格,並釋出不少後訓練資產。
不過,最準確的講法係:小米而家喺這項指數的開放權重類別居首,唔等於佢已經追平整個 AI 能力前沿。
成績:開放權重第一,不是全體第一
Artificial Analysis 的 Intelligence Index 將 MiMo-V2.6-Pro 評為 46 分,是目前排名最高的開放權重模型;GLM-5.3 為 45 分,Kimi K3 為 44 分。
31
46 分亦大致與 xAI 的閉源 Grok 4.7 配置相若。但小米自己亦承認,Pro 與最強閉源模型仍有距離:Artificial Analysis 列出的 Claude Fable 5.1 和 GPT-6 Astra 均為 53 分,即比 MiMo 高 7 分。
1
19
所以,呢個里程碑的重點不在於「全面登頂」,而是小米為開放權重模型設下了新的參考標準。
點樣升上去:一次過混合訓練的 RL
小米將後訓練方法命名為 「You Only RL Once」。核心做法係不再為編程、通用代理(agent)、視覺任務和網絡安全各自訓練獨立策略,而是把不同領域的任務,以及多套 agent harness(代理執行框架),混進同一次強化學習訓練。
小米的理據是,這些場景雖然不同,但模型都要學識一些共通決策:知道自己欠咗咩資料、揀邊個工具、判斷工具輸出有冇用,以及失敗後應該點修正和繼續。
5
按小米說法,Pro 和 Flash 各自用了約 6 日以下,完成 30 個 RL steps、約 75 萬條軌跡(trajectories)。公司報稱 Pro 的訓練成本約 262 萬美元,Flash 約 85 萬美元;這些是廠方自行披露的數字,並非獨立審計結果。
10
小米稱 Pro 相比 MiMo-V2.5-Pro 的指數分數提高了 20 分。
14 不過,這應視為發布時的對照成果,而唔應直接引申為佢在每一種實際工作負載都全面勝出。
價格,先係 Pro 最有殺傷力的地方
MiMo-V2.6-Pro 的 API 標價是每 100 萬 input tokens 0.435 美元、每 100 萬 output tokens 0.87 美元。一項按 Artificial Analysis 任務成本所作的比較,估計 Pro 每項 Intelligence Index 任務約需 0.13 美元;Grok 4.7 xHigh 則約為 3.74 美元。
21
當然,基準任務成本不等於實際上線成本。真實帳單會受提示詞與輸出長度、快取命中率、工具調用及推理設定影響。不過,46 分配合這個 token 定價,對要大規模跑推理、編程或 agent 工作流的團隊而言,確實有相當吸引力。
Flash:面向高頻使用的平價版本
MiMo-V2.6-Flash 是系列中偏重效率的型號。它採用稀疏混合專家(MoE)架構,有 3,090 億總參數、150 億活躍參數;Pro 則據報有 1.02 兆總參數及 420 億活躍參數。兩款模型都支援 100 萬 token 上下文窗口,並可接收文字、圖片、影片及聲音輸入。
4
Flash 的定價更低:每 100 萬未快取 input tokens 0.14 美元、每 100 萬 output tokens 0.28 美元;已快取 input 則為每 100 萬 tokens 0.0028 美元。
3
10
小米公布的比較中,Flash 在 DeepSWE v1.1 低過 Pro,但公司的定位很清晰:它是長上下文、多模態及大量調用場景的低成本選項。由於這些比較由廠方發布,部署前仍應按自身任務作獨立測試。
10
有使用者點評,但未算獨立驗證
研究員 Tim Dettmers 形容 Flash 感覺上是「300B 至 550B 級別中最好的模型」,並稱自己使用時覺得佢勝過 DeepSeek V4.1 及 GLM-5.3 Flash。他又讚賞模型的自動上下文壓縮,在超過 300 萬 tokens 的 session 中表現理想,並報告約每秒 250 個 tokens 解碼速度,以及每秒 2,600 個 tokens 預填充速度。
44
這些觀察對長時間編程工作流尤其值得留意,但始終只是單一實務使用者的報告,不能當作獨立 benchmark,也不代表在其他硬件和推理服務架構上必然有同樣表現。
小米實際釋出了甚麼?
這次不只是放出可下載權重。小米表示,Pro 和 Flash 均採用 MIT 授權,並同時公開技術報告、逾 7,000 個 RL 任務環境、端到端 RL 框架和可組合的 mini-harnesses;另有直接取自兩次 RL 訓練器日誌的 dashboard。
46
2
這種後訓練透明度,讓研究人員較容易檢視訓練思路及延伸任務環境。不過,這不等於完整重現整個模型研發流程:目前資料並不能證明所有預訓練數據、基建組件和訓練細節都已公開。
對開放權重競賽意味住甚麼?
MiMo-V2.6-Pro 令一件事更清楚:中國實驗室在開放權重模型競賽中非常有競爭力,並暫時在這項 Intelligence Index 排名領先。Pro 高過 GLM-5.3 和 Kimi K3,而 MIT 授權令它跟只可經 API 使用的閉源模型有實質分別。
31
36
但若因此說中國實驗室整體全面領先美國,就言之尚早。以同一指數計,最高分的閉源模型 Claude Fable 5.1 和 GPT-6 Astra 仍有 53 分。
19
實際結論比較簡單:開放權重 AI 在這個基準上,已經更接近昂貴的專有系統;而對重視可自行部署的權重、低推理成本、多模態輸入和長上下文 agent 工作流的團隊,MiMo-V2.6-Pro 已成為一個不能忽視的選擇。