OpenCode 报告的“单日 8 万亿 Token”,重点并不只是某一款模型突然走红,而是 AI 的工作单位正在改变。开发者越来越多地购买的,不再是一条聊天回复,而是一个 Agent 循环:读取代码仓库、制定计划、修改文件、运行程序、检查报错,再继续修正。
据 OpenCode 报告,DeepSeek V4 Flash 在 8 月 1 日通过该平台处理了 8 万亿 Token,其中 5 万亿来自免费试用额度,3 万亿来自付费 Go 服务。作为对照,OpenRouter 在 7 月 27 日至 8 月 2 日的周榜中显示,V4 Flash 在该平台全周处理量为 7.22 万亿 Token。这些都是平台自行披露的数据,并非对全部模型使用量的独立审计;但两组数字足以显示,Agent 工作流可以把调用规模推到极高水平。
20
23
29
为什么 Agent 会消耗如此多 Token
一次性聊天通常只有较短的提示词和有限的回复;编码 Agent 的“工作台”却大得多:源文件、终端输出、测试失败信息、此前的决策、生成的补丁,以及连续的工具调用。它在尝试完成任务时,往往会反复读取和带回其中的大量上下文。
OpenCode 公布的 V4 Flash 数据显示,平均每个会话约消耗 1200 万 Token,输入缓存比例为 95%。这些数据不能证明每一轮会话都是完全自主的编程任务,但与普通短对话相比,它们更符合长上下文、反复迭代的工作模式。
25
关键在于,用户真正需要的不是更多 Token,而是一个能合并的代码变更、通过的测试套件、可运行的原型,或被正确完成的业务流程。因此,更实用的评估方式是:
单个合格任务的成本 = 模型与工具循环总成本 ÷ 任务达到要求的概率
这里的总成本还包括失败尝试、重试、人工审核、等待时间,以及修复错误的代价,而不只是 API 标价中的输入和输出单价。
低 Token 单价,让“多试几次”变得划算
围绕 V4 Flash 的公开报道援引其第一方定价:每百万输入 Token 为 0.14 美元,每百万输出 Token 为 0.28 美元。
12 对开发者而言,这意味着可以以更低成本保留更多上下文、进行更多轮迭代,并让 Agent 自动运行更多测试。
这并不意味着便宜模型总是更好。真正的逻辑是:当 Agent 为完成一项常规工作需要很多轮交互时,如果能力差距较小、成本差距却很大,低价模型可能更有优势。
例如,一项比较称,Artificial Analysis Intelligence Index v4.1 中,V4 Flash Max 得分为 50,Claude Opus 4.8 Max 为 56;但跑完整套评测的模型调用成本分别约为 72.02 美元和 3752.55 美元。六分差距对应巨大的成本差异,但这只是评测比较,不能据此推断两者在真实任务中的可靠性完全相同。
16
对于高难度、高风险任务,如果高端模型能显著减少失败部署、人工监督或返工,它的“每个合格结果成本”依然可能更低。结论并非“所有任务都选最便宜的模型”,而是应按实现可接受结果的总成本来分配任务。
所谓“斩杀线”,压力主要落在中间档
“DeepSeek 斩杀线”更适合作为市场隐喻来理解:一款低价、接近前沿的模型,会挤压那些价格高得多,却无法提供明显更优任务结果的产品。
不同层级受到的影响并不相同:
- 低价路由模型仍适合分类、信息抽取、短文本转换和大规模初筛。这类场景优先看速度与最低单位成本,对高阶推理的要求较低。
- 顶级旗舰模型仍有其位置,特别是在长程推理、极高可靠性、多模态任务、治理合规要求严格,或人工复核成本很高的场景。
- 中间档模型面临的考验最严峻。如果其价格明显高于 Flash,就需要拿出更高完成率、更低延迟、更好的工具调用、集成能力、支持服务或企业管控能力,而不能只依靠小幅基准领先。
换句话说,低价 Agent 模型可能成为大多数重复性工作的默认“执行者”,高端模型则更像处理棘手问题的升级专家;中间档必须证明,它确实能降低任务总成本。
V4 Flash 为什么能瞄准 Agent 级成本结构
DeepSeek V4 Flash 是一款混合专家(MoE)模型:总参数量 2840 亿,但每生成一个 Token 约激活 130 亿参数,并支持 100 万 Token 上下文窗口。
17 这种设计将模型的总体容量,与单个 Token 实际需要的计算量分开。
其效率策略主要包括:
- 混合专家路由: 每个 Token 只激活部分专家,相比每次都运行全部参数的稠密模型,可降低活跃计算量。
17
- 混合注意力: V4 系列结合压缩稀疏注意力(CSA)和重度压缩注意力(HCA),以降低超长上下文带来的注意力计算与内存压力。
17
33
- 更低的缓存负担: NVIDIA 对 V4 系列的介绍称,在所引用的与 DeepSeek-V3.2 的比较中,这些注意力创新旨在将单 Token 推理 FLOPs 降低 73%,并将 KV Cache 内存负担降低 90%。
33
- 面向缓存的工作流: Agent 会反复提交高度重叠的代码仓库和工具上下文,因此缓存复用会直接影响实际成本。OpenCode 报告的 95% 缓存比例,说明这一运营指标的重要性。
25
这些并不只是参数表上的技术名词。它们决定了让一个 Agent 检查大型代码库、调用工具,并在多次出错后继续恢复和修正,在财务上是否可承受。
Agent 时代的前沿:能力、可靠性与追加一轮的成本
基准能力仍然重要,但对 Agent 而言,它不再是唯一的前沿指标。更有用的比较框架是三项权衡:
- 能力: 模型能否解决这类任务?
- 可靠性: 它有多大概率能在少量昂贵干预下交付合格结果?
- 边际迭代成本: 再多一次工具调用、一次修改、一次测试或一次失败恢复,要花多少钱?
这次被报告的单日 8 万亿 Token,让第三项变得格外直观。当 Agent 替代一次性问答时,Token 消耗可以成数量级增长。能够让长上下文和多次重试保持低成本的模型,有机会成为广泛、重复性 Agent 工作负载的默认选择;而能力更强的旗舰模型,仍可能是最困难任务的更优选项。
20
25
33