DeepSeek 已将 V4 API 从统一价目表改为按使用时段计费。新规则于2026年8月17日0点(北京时间)生效,对应2026年8月16日16:00(UTC)。非高峰价格正好是高峰价格的一半,但新价格相较此前统一价格,按照模型、Token 类型和使用时段不同,涨幅从50%到1100%不等。
1
2
DeepSeek V4 价格发生了什么变化?
新计费安排适用于 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro。每天的高峰时段为:
- 北京时间9:00—12:00
- 北京时间14:00—18:00
其余时间均属于非高峰时段。单次请求按照平台服务器收到请求的北京时间计费,而不是按照请求最终完成的时间计费。对于在不同时区运营的开发者,这意味着任务调度必须明确换算北京时间。
2
7
这并非一次简单的统一涨价,而是建立了明确的“峰谷”价格关系:同一个模型、同一种 Token,在高峰时段的费用是非高峰时段的两倍。
V4-Flash 与 V4-Pro:每百万 Token 价格
以下金额均为每百万 Token 的人民币价格。“缓存命中”指输入可以复用此前缓存的提示词前缀;“缓存未命中”则按更高的未缓存输入价格计费。
| 模型与 Token 类型 |
此前统一价格 |
非高峰价格 |
较此前涨幅 |
高峰价格 |
较此前涨幅 |
| V4-Flash 缓存命中输入 |
¥0.02 |
¥0.05 |
+150% |
¥0.10 |
+400% |
| V4-Flash 缓存未命中输入 |
¥1.00 |
¥1.50 |
+50% |
¥3.00 |
+200% |
| V4-Flash 输出 |
¥2.00 |
¥4.50 |
+125% |
¥9.00 |
+350% |
| V4-Pro 缓存命中输入 |
¥0.025 |
¥0.15 |
+500% |
¥0.30 |
+1100% |
| V4-Pro 缓存未命中输入 |
¥3.00 |
¥4.50 |
+50% |
¥9.00 |
+200% |
| V4-Pro 输出 |
¥6.00 |
¥13.50 |
+125% |
¥27.00 |
+350% |
官方及相关平台文档分别列出了 Flash 在非高峰时段的缓存命中输入、缓存未命中输入和输出价格:每百万 Token 0.05元、1.50元和4.50元;进入高峰时段后,价格升至0.10元、3元和9元。
2 路透社报道称,此次 V4 调价的整体涨幅介于50%和1100%之间,最高涨幅对应 Pro 的高峰期缓存命中输入。
1
8
哪些应用受到的影响最大?
批处理任务可以挪到低价时段
模型评测、文档索引、历史数据回填、合成数据生成,以及其他不需要即时完成的任务,都可以排到两段高峰期之外执行。由于非高峰价格只有高峰价格的一半,单靠调整任务时间,就可能显著降低弹性工作负载的成本。
2
这也让时区成为 AI 基础设施的新变量。队列系统如果同时知道任务截止时间和北京时间的计费窗口,就可以在不更换模型、不削减 Token 预算的情况下延后处理。
交互式应用很难完全避开高峰价
客服系统、编程助手和实时智能体通常要在用户活跃时工作,无法随意“错峰”。这类应用可能必须承担高峰价格,但仍可以通过复用提示词、提高缓存命中率、缩短输出,以及在 Flash 和 Pro 之间进行路由来控制支出。
缓存尤其重要。两款模型的缓存命中输入都远低于缓存未命中输入。对于反复发送相同系统指令、工具定义或文档上下文的高流量系统,提高缓存命中率的价值可能超过单纯减少少量请求量。
输出较多的应用面临更高的绝对成本
长篇推理过程、自动生成报告和大段代码都会消耗输出 Token。高峰时段,Flash 输出每百万 Token 为9元,Pro 输出为27元。开发者可以设置更严格的输出上限,让 Flash 处理常规请求,并将 Pro 留给确实需要更强能力的任务。
1
2
Pro 的缓存命中价格涨幅最高
V4-Pro 高峰期缓存命中价格是此前统一价格的12倍,属于此次调整中百分比涨幅最高的一项。它的绝对金额仍低于未缓存输入和输出,但对于大量处理重复缓存提示词的应用而言,这一变化仍然值得重点关注。
1
19
8月13日发布的 V4-Pro 有哪些规格?
此次计费调整紧跟 DeepSeek-V4-Pro-0813 的正式可用。该版本通过 deepseek-v4-pro 端点提供。公开规格显示,它是一款文本模型,拥有100万Token上下文窗口,最大输出长度为384,000 Token;其混合专家(MoE)架构包含约1.6万亿总参数,每个 Token 激活约490亿参数。
29
33
DeepSeek 文档中列出的账户级并发限制也区分了两个产品层级:
- V4-Pro:500个并发请求
- V4-Flash:2500个并发请求
一次请求从开始处理到完整响应结束期间都会占用一个并发名额,流式响应也包括在内。
28
综合价格和并发限制来看,Flash 更适合高吞吐量的常规流量,Pro 则更像是面向高难度推理和超长上下文任务、容量更受约束的高阶层级。不过,这是根据公开价格和限制作出的推断,并非 DeepSeek 对所有应用场景的直接定义。
2
28
按时间收费,说明 AI 算力竞争正在变化
DeepSeek 的调整类似于对 GPU 推理需求进行“削峰填谷”。交互式用户集中上线时,推理需求通常更高;而批处理任务往往可以等待。高峰期提高价格、其他时段降低价格,可以鼓励开发者把部分计算需求分散到全天不同时间,从而改善算力利用率。
对开发者来说,成本优化不再只是选择哪个模型、计算多少 Token,还需要回答以下问题:
- 哪些请求对延迟最敏感?
- 哪些任务可以进入非高峰队列?
- 有多少提示词内容可以通过缓存复用?
- 什么时候应当使用 Flash,而不是 Pro?
- 应用实际需要生成多少输出内容?
更广泛地看,这代表大模型价格竞争正从单一的低价竞争,转向围绕稀缺算力进行分层定价。DeepSeek 仍为可延迟需求保留了更便宜的使用通道,但也在提高高端推理对使用时段的敏感度。路透社将这次调整描述为一次因模型、Token 类别和使用时段而异的大幅涨价,而不是统一幅度的全面加价。
1
对于正在使用 DeepSeek V4 的团队,最实际的结论是:应把任务调度、提示词缓存、模型路由和输出控制一并纳入 API 成本模型。不能错峰的工作负载,可能需要改用其他模型或收紧 Token 预算;可以等待的任务,则有机会通过非高峰运行保留更多成本优势。