DeepSeek V4 Flash 0731以极低的路由价格、超长上下文和聚合平台的便捷接入,迅速成为高Token消耗任务的热门测试对象。 OpenRouter周榜的7.22万亿Token统计真实存在,但统计周期覆盖正式版发布前的预览版本,不能全部归因于7月31日的新版本。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731的走红,展示了一个现实:当超低Token价格、超长上下文和模型聚合平台的一键接入同时出现时,开发团队的默认模型选择可以在很短时间内改变。
据报道,DeepSeek V4 Flash在OpenRouter 2026年7月27日至8月2日的周度使用榜上位居第一,处理了7.22万亿Token。5 不过,这一数字需要放在具体背景中理解:它反映了极快的分发和试用速度,并不能直接等同于全部是付费生产流量,更不能说明新正式版在四天内独自创造了全部用量。
7月31日发布的DeepSeek-V4-Flash-0731采用稀疏混合专家(MoE)架构:总参数量为2840亿,但每个Token仅激活130亿参数。OpenRouter页面显示,其上下文窗口达到1,310,720 Token,定位于编程、推理和智能体工作流。1
这套组合对高Token消耗场景尤其有吸引力:
MoE架构本身不等于实际成本必然更低,也不自动代表质量更高。它的经济意义在于:每个Token只激活总参数中的一部分,理论上可在保留较大模型容量的同时,避免同等总规模稠密模型的计算负担。实际收益仍取决于延迟、服务商容量、路由策略、提示词设计和输出长度。
TechNode报道称,DeepSeek V4 Flash在7月27日至8月2日期间于OpenRouter处理了7.22万亿Token;该周榜前四均为中国模型,DeepSeek V4 Flash 0731和V4 Pro也进入前六。5
但该统计周期早于7月31日的公开测试版发布。V4 Flash此前已有预览路由,而0731版本是在deepseek-v4-flash API端点上取代预览版的正式可用版本。3 因此,不能将这周的全部Token都归为新0731版本上线后的用量。
免费访问同样是重要变量。报道称,OpenCode在8月1日为该模型处理了8万亿Token,其中5万亿来自免费试用,开发者付费部分为3万亿。5 免费试用对模型推广很有价值:它降低了开发者评估门槛、扩大了触达范围;但它与长期、稳定的付费生产需求不是同一个概念。
更稳妥的结论是:V4 Flash获得了异常迅速的分发与实验性使用。现有证据尚不足以证明,其早期全部规模都来自付费迁移或长期生产部署。
模型价格会随服务商、路由、折扣、缓存状态和日期而变化。有关7月31日发布的报道提到,官方价格为每百万未缓存输入Token 0.14美元、输出Token 0.28美元;而OpenRouter在8月初列出的路由价格不同。3
OpenRouter随后针对带日期标识的deepseek-v4-flash-0731路由列出:每百万输入Token 0.05美元、输出Token 0.16美元、缓存读取Token 0.013美元。1
按这一OpenRouter标价,与所提供对比来源中的其他模型相比,差距十分明显:
| 模型 | 每百万Token标价(输入/输出) | 相对V4-Flash的价格水平(0.05/0.16美元) |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0.05/0.16美元 |
基准 |
| Kimi K3 | 3/15美元 |
约高60倍/94倍 |
| GPT-5.6 Sol | 5/30美元 |
约高100倍/188倍 |
| Claude Fable 5 | 10/50美元 |
约高200倍/313倍 |
这些只是已公布标价的算术比较,并不能证明几个模型在质量、速度、工具调用可靠性、安全表现或可用性上完全等价。更不能将其直接换算为统一的“单任务成本”:实际账单还受输入输出长度、缓存命中率、重试次数、工具调用、服务商选择,以及是否需要升级到更强模型等因素影响。
Kimi K3、GPT-5.6 Sol和Claude Fable 5虽然都面向高级编程和智能体类需求,但不宜视为可无差别替换的产品。所提供的比较来源将Kimi K3描述为总参数量2.8万亿、上下文窗口100万Token的MoE模型;GPT-5.6 Sol的上下文为105万Token,Claude Fable 5为100万Token。17
从实际选型看,重点应是工作流适配,而不是品牌站队:
公开基准可用于初步筛选,但单一分数无法决定生产环境的默认模型。原说法中的“Agent Ultimate 25.2对25.7”对比,未能从提供的偏一手来源中获得独立证实,因此不宜将其当作模型近乎等效的依据。DeepSeek发布材料列出了Terminal Bench 2.1的82.7分、NL2Repo的54.2分等成绩,但基准结果仍需结合具体业务工作负载验证。10
对中型开发团队来说,决定因素通常不是“哪家模型榜单第一”,而是:它在真实任务中是否可靠到足以承担常规流量,以及节省下来的成本能否覆盖路由、失败和兜底的代价。
一个更可执行的评估框架包括:
这也解释了为何V4-Flash的崛起值得关注,即便其早期Token规模受到试用流量推动。OpenRouter这类多模型聚合平台让开发者能立即试用低成本、长上下文选项;一旦它在生产评测中表现达标,原本流向昂贵默认模型的常规工作负载就可能发生转移。
现有材料支持以下事实:V4 Flash以7.22万亿Token登上OpenRouter周榜第一、统计期与早期预览版存在重叠,以及OpenCode用量中存在显著免费试用部分。3
5
但“九个中国模型进入前十”“中国模型连续14周超过美国调用量”“美欧开发者大规模迁移”“实际推理成本普遍降低60%至85%”,以及“GPT-5.6 Luna被迫降价80%”等说法,未获所提供证据充分支持。
这类结论需要OpenRouter可核验的仪表盘数据、服务商定价记录或可复现的工作负载研究。在此之前,更严谨的判断是:DeepSeek V4-Flash在开发者急于试用更便宜的编程与智能体模型之际,同时提供了极低的路由标价、大上下文容量和广泛接入渠道。这足以引发快速用量增长,但单凭这些数据,还不足以证明市场格局已经永久改写。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
DeepSeek V4 Flash 0731以极低的路由价格、超长上下文和聚合平台的便捷接入,迅速成为高Token消耗任务的热门测试对象。
DeepSeek V4 Flash 0731以极低的路由价格、超长上下文和聚合平台的便捷接入,迅速成为高Token消耗任务的热门测试对象。 OpenRouter周榜的7.22万亿Token统计真实存在,但统计周期覆盖正式版发布前的预览版本,不能全部归因于7月31日的新版本。
免费试用显著放大了早期用量:报道显示,OpenCode在8月1日处理的80亿亿Token中,50亿亿来自免费试用。