DeepSeek V4 Flash 的缓存命中输入价格为每百万 token 0.0028 美元,缓存未命中则为 0.14 美元,相差 50 倍。 第三方平台可能给出更低的输入和输出报价,但模型版本、量化方式、路由、缓存策略和服务质量未必相同。
研究答案

Create a landscape editorial hero image for this Studio Global article: How can DeepSeek V4 Flash remain the cheapest major AI model—and potentially stay cheapest even after a 30× list-price increase—given that t. Article summary: DeepSeek V4 Flash can remain cheapest in effective cost because “price per input token” is the wrong unit for long-running agents. The decisive variable is the share of input that is served from a reusable prefix cache: . Topic tags: general, general web, user generated, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
DeepSeek V4 Flash 的低价优势,常常藏在 headline 报价没有突出说明的地方:缓存命中和缓存未命中的输入,收费完全不同。
按此前公布的价格,V4 Flash 的缓存未命中输入为每百万 token 0.14 美元,缓存命中输入仅为 0.0028 美元,输出为 0.28 美元。12
这对 Coding Agent 尤其重要。一个编码代理在多轮交互中,往往会反复发送相同的系统指令、工具定义、代码仓库背景和长篇提示词前缀。只要这些内容保持不变,后续请求就可能按更低的缓存命中价格计费。
当然,这并不保证它对每位用户、每条供应商路由或每种任务都是最便宜的选择。
对于缓存命中比例为 h 的工作负载,混合输入价格大致可以这样计算:
h × 缓存命中价格 + (1 − h) × 缓存未命中价格
按照原先的价格表,如果 99% 的输入 token 都命中缓存,平均输入价格约为每百万 0.00417 美元。相比每百万 0.14 美元的缓存未命中价格,低了约 34 倍。
这里还没有计入输出 token。对于需要生成大量代码、解释文本或工具调用结果的任务,输出费用可能反而成为主要支出。
因此,同一个 API 可能带来截然不同的账单体验:
DeepSeek 将这一机制描述为自动的前缀缓存:系统会自动识别近期重复的提示词前缀,并按照缓存命中价格计费,无需额外的 SDK 改动或显式开启开关。12
但“自动缓存”不等于“任意相似内容都能命中”。前缀匹配通常要求严格复用;如果提示词开头发生变化,后面的内容也可能无法继续享受缓存价格。
DeepInfra 的价格页面显示,V4 Flash 的不同版本大约为每百万输入 0.08 至 0.09 美元、输出 0.18 美元,并另行列出缓存输入价格。29 OpenRouter 也列出了多个 V4 Flash 快照和供应商,价格会随具体版本和路由变化。
21
22
这些报价未必对应完全相同的产品。比较时至少要确认:
如果工作负载几乎没有缓存复用,第三方的低标价确实可能带来更低账单。但对于长时间运行、且前缀始终稳定的代理,第一方 API 也可能凭借更好的缓存表现胜出。
真正应该问的不是“哪家的输入单价最低”,而是:
哪条路由能以最低且可靠的成本,完成同一个任务?
“涨价 30 倍”更适合作为敏感性测试,而不是预测。
如果把原先每百万 0.0028 美元的缓存命中输入价格提高 30 倍,结果是每百万 0.084 美元。这个数字仍低于原先每百万 0.14 美元的缓存未命中价格。
但这只改变了账单中的一个项目。如果输出价格也同步上涨 30 倍,原先每百万 0.28 美元的输出就会变成 8.40 美元。对于大量生成代码或长篇回答的工作负载,成本可能迅速上升,即使缓存输入仍然便宜。
同理,如果一个代理经常缓存未命中,它会直接感受到更高的输入价格。
所以更准确的结论是:
即使名义价格大幅上涨,DeepSeek V4 Flash 仍可能保留由缓存带来的成本优势;但它不可能在所有缓存命中率、未命中率、输出量和供应商费用组合下都保持最低价。
后来公布的价格机制引入了谷时和峰时费率。V4 Flash 的谷时价格为:缓存未命中输入每百万 0.22 美元、缓存命中输入 0.007 美元、输出 0.66 美元;峰时则分别为 0.44 美元、0.014 美元和 1.32 美元。10
20
这些价格相较此前的 0.14/0.0028/0.28 美元确实明显上涨,但并不是统一上涨 30 倍。
按时段收费可以把可延后的批处理任务引导至低峰期,也可以在高峰时段限制需求、分配稀缺算力。不过,单凭峰时价格本身,无法证明涨价究竟是因为推理成本上升、需求持续过高,还是两者共同作用。
对开发者来说,实际影响更直接:代理运行的时间,也可能成为成本模型的一部分。如果任务可以排程,就应该分别计算峰时和谷时账单,而不是只看一个名义单价。
一项社区报告的 20,000 次请求实验称,在 12 小时窗口内,DeepSeek 达到了 100% 的缓存命中率;相比之下,GLM 在 5 分钟后降至 25%,Kimi 和 GPT 处于两者之间。31
这一观察说明,长时间运行的编码代理,可能会得出与短提示词用户完全不同的供应商排序。但它并不是经过独立复现的跨模型基准测试。
缓存结果会受到多种因素影响,包括:
开发者最好使用自己的代理轨迹重新测试,并分别记录缓存命中和缓存未命中的 token 数量。一个通常更有利的提示词结构是:把固定指令、工具定义和稳定背景放在前面,把不断变化的任务数据放在后面。但最终效果仍应通过实际数据验证,而不是直接假设。
OpenCode Go 是另一种产品形态,不等同于直接调用 DeepSeek API。其文档显示,该服务每月订阅费为 10 美元,并采用按美元计价的滚动额度,包括 5 小时 12 美元、每周 30 美元和每月 60 美元的限制;套餐包含 DeepSeek V4 Flash。1
因此,不能只拿 10 美元月费,或只比较某个平台的 token 单价,就判断 OpenCode Go 与直连 API 谁更划算。OpenCode 会控制模型路由和实际可用额度,而直接 API 则展示更细的 token 计费与缓存行为。相关报道还显示,涨价后 V4 Flash 在 OpenCode Go 中对应的使用价值发生了变化。6
如果要证明 Go 在长时间会话中比直连 API 贵 2 至 10 倍,必须让相同的提示词流量经过两条路线,并同时记录:
在缺少这种受控对比前,更稳妥的说法是:如果订阅服务的路由或缓存保留机制导致可复用上下文频繁丢失,它在长会话中的有效成本可能高于直连 API。但这取决于具体工作负载,不能仅凭 10 美元月费或某个低价标牌得出结论。
最有意义的指标不是“每百万输入 token 多少钱”,而是完成一个任务需要多少钱。
进行供应商比较时,应尽量固定模型快照和提示词序列,并记录:
同时,至少测试两类场景:
第一类场景能展示稳定前缀带来的成本优势,第二类场景则能揭示缓存失效后的真实价格。只有两类结果结合起来,才足以支持生产环境的选型。
DeepSeek V4 Flash 之所以可能在大幅涨价后仍然便宜,核心不是它的名义输入价格有多低,而是前缀缓存改变了重复上下文的计费方式。对于长时间运行的 Coding Agent,只要稳定前缀能够持续命中,输入成本就可能远低于单看缓存未命中价格时的直觉。
第三方平台可能给出更低的 headline 价格,30 倍涨价也可能仍未超过原始缓存未命中价格。但这些事实都不能证明 V4 Flash 对所有用户、所有任务和所有供应商路由都最便宜。
真正决定生产成本的,是缓存命中率、输出量、峰时定价、供应商实现,以及任务能否稳定完成。对开发者而言,记录完整的缓存和输出数据,计算“每个成功任务的总成本”,比比较任何一张静态价格表更重要。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
DeepSeek V4 Flash 的缓存命中输入价格为每百万 token 0.0028 美元,缓存未命中则为 0.14 美元,相差 50 倍。
DeepSeek V4 Flash 的缓存命中输入价格为每百万 token 0.0028 美元,缓存未命中则为 0.14 美元,相差 50 倍。 第三方平台可能给出更低的输入和输出报价,但模型版本、量化方式、路由、缓存策略和服务质量未必相同。
即使将原有缓存命中价格提高 30 倍至每百万 0.084 美元,也仍低于原先每百万 0.14 美元的缓存未命中价格;但这不代表它对所有工作负载都最便宜。