OpenRouter 在 2026 年 7 月的排行榜,呈現了一個值得注意的訊號:小米 MiMo-V2.5 在 7 月 20 日至 26 日這週,據報處理約 10.5 兆個 Token;同一份排行的前五名均由中國開發的大型語言模型占據。
8
15
這不必然代表 MiMo-V2.5 在所有測試、所有任務上都是最強模型。不過,它確實說明一件更貼近開發現場的事:當模型能力達到可用門檻後,完成一項任務的成本、可否快速串接、能否自行部署,以及是否適合代理型工作流程,往往足以左右大規模實際使用量。
先釐清:這是 OpenRouter 的流量,不是全球 AI 使用普查
報導所指的是經由 OpenRouter 路由的 Token。OpenRouter 是讓開發者可透過單一介面存取多家模型的多模型存取平台,因此這些數字很有參考價值:它反映了平台上的開發者在真實工作負載中,把流量導向哪些模型。
但它不是全世界所有 LLM 推論請求的完整統計。報導稱 MiMo-V2.5 當時的週用量約為 10.5 兆 Token、月用量約 31.2 兆 Token;從 5 月每週 1.46 兆增至 7 月 10.46 兆,約成長 616%。
15
同樣地,常被引用的「中國模型 63.5%、美國模型 35.5%」比較,指的是截至 7 月 26 日前 28 天的 OpenRouter 平台快照,不能延伸解讀為全球所有 AI 推論的市場普查。
15
更重要的是,Token 不等於 API 呼叫次數、獨立使用者數、營收或企業關鍵性。一個處理超長文件、反覆使用工具的 AI 代理,一次任務便可能消耗遠多於簡短聊天問答的 Token。
MiMo-V2.5 為何適合高 Token 工作負載?
小米將 MiMo-V2.5 定位為具備代理(agentic)能力與多模態理解的模型,支援原生視覺及音訊理解,並可處理最長 100 萬 Token 的上下文。
16
這些特性特別適合下列情境:
- 程式開發代理與自動化工作流程
- 需要閱讀大量資料的研究、文件分析與知識整理
- 結合圖片、音訊或影片的內容理解
- 會規劃步驟、呼叫工具、檢查結果再修正答案的助理系統
代理型系統通常不是「問一次、答一次」:它可能反覆讀取上下文、規劃下一步、呼叫外部工具、檢視輸出,再更新策略。這種工作模式本身就很消耗 Token。因此,長上下文與多模態能力不只是規格表上的亮點,也可能直接推高平台觀察到的 Token 用量。
MiMo-V2.5 於 2026 年 4 月 23 日展開公開測試,初期並提供限時免費使用。
3 對開發團隊而言,能否快速試用、調整路由規則並投入實際應用,有時比單一基準測試的排名更能決定採用速度。
價格與部署彈性,讓關注轉化為用量
當多個模型都已達到團隊可接受的品質,決策重點通常會轉向更實際的問題:完成一項工作要花多少錢?服務能否承受流量?是否容易整合既有架構?未來能否保留部署主導權?
小米曾為 MiMo 系列主打 Token 方案定價與 Token 效率。
1 隨後,該公司又以寬鬆的 MIT 授權釋出 V2.5 系列權重,允許商業推論部署、二次訓練與微調,無須額外授權。
2
開放權重不會自動帶來採用,但會增加使用者的選項:團隊可選擇託管 API、自行部署、微調模型,或至少保有替代部署路徑。對高流量產品而言,這種彈性尤其重要,因為單位成本與供應商依賴,會隨用量放大而成為實質問題。
中國模型包辦前五名,真正說明了什麼?
以 7 月 20 日至 26 日為準,根據 OpenRouter 資料的報導,排名依序為 MiMo-V2.5、DeepSeek V4 Flash、騰訊 HY3、智譜 GLM-5.2 與 DeepSeek V4 Pro。
8 其他 7 月報導也指出,中國來源模型在該平台承載超過六成的路由流量。
19
26
最合理的解讀,不是「中國模型已在每一項指標全面超越美國模型」。這份榜單更明確指出:推論層的採用競爭已高度可爭奪。 只要模型夠用、運行成本低、整合門檻小,就有機會吸引極大的生產環境流量;即使誰在前沿能力上領先,仍可能存在爭論。
這股趨勢也不只是單一市場的內部使用。CNBC 報導指出,美國企業經由 OpenRouter 使用中國模型的 Token 占比,自 2 月 8 日以來每週都高於 30%,最高曾達 46%。
23 這使得「全部只是本地需求」的解釋較難成立。
前沿研究領先,與推論採用領先,是兩場不同的比賽
MiMo-V2.5 短暫站上榜首,凸顯 AI 市場中兩個常被混為一談、其實不同的競爭面向:
- 前沿能力:模型在高難度任務與評測中的表現。
- 推論採用:開發者實際把哪些模型大規模導入產品與服務。
後者獎勵的條件更廣:性價比、上下文容量、多模態輸入、整合方式與商業授權條件,都會影響決策。MiMo 將其中多項特性組合在一起;而中國的模型生態也提供多個同樣競爭激烈的替代方案,爭取相近的開發者工作負載。
這並不抹去美國在封閉式前沿模型上的優勢,也不表示 Token 用量能衡量安全性、可靠性、獲利能力或企業任務的重要程度。但它確實顯示:當具競爭力的模型以有利的成本與部署條件提供時,高用量路由推論的重心可以迅速移動。
結論:這是一個「分發與經濟性」的里程碑
MiMo-V2.5 在 7 月的領先地位,較適合被視為分發能力與經濟性共同作用的成果。其據報約 10.5 兆的週 Token 用量,背後是一套面向代理與多模態工作負載的產品組合:100 萬 Token 上下文、較易取得的初期推出方式,以及後續可商用的開放授權。
2
8
16
中國模型包辦前五名,所反映的是現實世界的 LLM 採用愈來愈重視「可部署、可擴展、成本可控」,而不是已經為整體 AI 領導地位下了最終定論。