OpenRouter 在 2026 年 7 月的排行榜,提供了一幅颇具冲击力的应用侧图景:据报道,在 7 月 20 日至 26 日这一周,小米 MiMo-V2.5 以约 10.5 万亿 Token 的用量位列平台第一;榜单前五席则均被中国团队开发的模型占据。
8
15
这并不必然意味着 MiMo 凭某一项单点技术突破“一骑绝尘”。更合理的解释是:它把面向智能体的能力、可获得的调用与部署方式,以及适合高并发场景的经济性组合在了一起。
8
15
先看清这组数据衡量的是什么
这条“登顶”消息的统计对象,是经由 OpenRouter 路由的 Token。OpenRouter 是一个让开发者接入和切换多种大模型的平台;这并不是对全球所有大模型请求的完整普查。
报道显示,MiMo-V2.5 当周约处理 10.5 万亿 Token,月度约为 31.2 万亿 Token;另有报道按其从 5 月的 1.46 万亿周 Token 升至 7 月的 10.46 万亿计算,增幅约为 616%。
15
这些数字的价值在于,它们反映了开发者在一个大型多模型路由平台上的实际选择。但 Token 数不等于 API 请求次数、用户数、收入,也不等于业务关键程度。一个处理超长资料或执行多轮任务的智能体,单次任务消耗的 Token,可能远高于普通短对话。
同样,常被引用的“中国模型 63.5%、美国模型 35.5%”的比例,是截至 7 月 26 日的 28 天内 OpenRouter 平台上的统计快照,而非全球推理市场的普查结果。
15
MiMo-V2.5 为什么适合高 Token 工作负载
小米将 MiMo-V2.5 的定位放在智能体能力与多模态理解上。官方称,该模型具备原生图像和音频理解能力,并支持最高 100 万 Token 的上下文窗口。
16
这类能力尤其适合代码智能体、长文档研究、媒体内容分析和工具调用型助手。此类系统通常不是“一问一答”:它们会反复读取上下文、规划下一步、调用工具、检查结果,再修订答案。工作流本身就会带来更高的 Token 消耗。
MiMo-V2.5 于 2026 年 4 月 23 日开启公测,小米在初期还提供了限时免费使用。
3 对开发者而言,快速可用往往与跑分同样重要:团队可以直接在真实应用中测试模型,调整路由策略并扩大调用,而不必经历漫长的采购流程。
成本和部署选择,决定兴趣能否转化为用量
当多款模型都已达到团队所需的质量门槛时,关键问题会转向运营层面:完成一项任务究竟要花多少钱?服务能否扛住负载?能否接入已有技术栈?企业是否能掌握部署主动权?
小米曾为 MiMo 系列推广 Token 套餐和 Token 效率。
1 更重要的是,MiMo-V2.5 系列后来以宽松的 MIT 许可证开放权重,支持商业推理部署、二次训练和微调,无需额外授权。
2
开放权重并不必然带来大规模采用,但它扩大了用户的选择空间:团队可以使用托管 API,也可以自部署、微调,或保留替代性的部署路径。对于高调用量业务,这种灵活性尤为重要,因为单位成本和对单一供应商的依赖都会逐渐成为实质问题。
“中国模型包揽前五”真正说明了什么
对于 7 月 20 日至 26 日这一统计周期,基于 OpenRouter 数据的报道将前五名列为:小米 MiMo-V2.5、DeepSeek V4 Flash、腾讯 HY3、智谱 GLM-5.2 和 DeepSeek V4 Pro。
8 其他 7 月报道也称,中国来源模型在该平台承载了超过六成的路由流量。
19
26
这组排名最实际的含义,并不是“中国模型已在所有指标上全面超过美国模型”。它更说明:在推理和应用接入这一层,大模型的采用竞争高度开放。只要模型能力足够、运行成本可控、集成足够方便,就能够获得巨大的生产级调用量——即使关于谁在最前沿模型能力上领先的讨论仍未有定论。
跨境需求同样存在。CNBC 报道称,美国企业经 OpenRouter 使用中国模型的 Token 占比,自 2 月 8 日以来每周都高于 30%,最高曾达 46%。
23 这使得上述变化很难仅用中国本土需求来解释。
前沿能力竞赛,不等于推理采用竞赛
MiMo 的短暂登顶,凸显了 AI 市场中两个不同维度的竞争:
- 前沿能力:模型在高难度任务和各类评测中的表现;
- 推理采用:开发者究竟把哪些模型大规模接入实际产品。
后者会奖励更多因素,包括性价比、上下文容量、多模态输入、集成选择以及商业条款。MiMo 同时提供了其中若干项条件,而中国的大模型生态也提供了多种可相互竞争的替代方案。
这并未削弱美国在闭源前沿模型上的实力;Token 用量也不能衡量安全性、可靠性、盈利能力或企业应用的重要程度。但它确实说明,当具备竞争力的模型以有利的成本和部署条件进入市场时,高调用量推理业务的重心可以迅速移动。
结论
MiMo-V2.5 在 7 月的排名,更应被视为一次分发能力与经济性的信号。其约 10.5 万亿周 Token 的表现,来自一个面向智能体和多模态负载、支持 100 万 Token 上下文、快速开放测试,并在后续提供开放商业许可的产品组合。
2
8
16
因此,中国模型占据前五的结果,最能说明的是:大模型的真实落地正越来越奖励那些可部署、重成本控制、易于接入的系统;它并不能单独证明任何一个国家已经终结了更广泛的 AI 领导权竞争。