OpenCode 报告称,DeepSeek V4 Flash 在 8 月 1 日处理了 8 万亿 Token,其中 5 万亿来自免费试用、3 万亿来自付费 Go 服务,反映出 AI 使用正转向高频迭代的 Agent 工作流。 OpenCode 当前数据列出,V4 Flash 平均每个会话约消耗 1200 万 Token,输入缓存命中比例为 95%;这与需要反复携带代码库和工具输出的长上下文任务相吻合。
研究答案

Create a landscape editorial hero image for this Studio Global article: How does DeepSeek V4 Flash’s reported 8 trillion tokens of single-day usage on OpenCode—5 trillion free and 3 trillion paid, above OpenRoute. Article summary: The reported usage suggests that the economically important unit is no longer a chat response but an agentic work loop: inspect context, plan, edit files, execute tools, observe failures, and retry. In that loop, token c. Topic tags: general, documentation, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
OpenCode 报告的“单日 8 万亿 Token”,重点并不只是某一款模型突然走红,而是 AI 的工作单位正在改变。开发者越来越多地购买的,不再是一条聊天回复,而是一个 Agent 循环:读取代码仓库、制定计划、修改文件、运行程序、检查报错,再继续修正。
据 OpenCode 报告,DeepSeek V4 Flash 在 8 月 1 日通过该平台处理了 8 万亿 Token,其中 5 万亿来自免费试用额度,3 万亿来自付费 Go 服务。作为对照,OpenRouter 在 7 月 27 日至 8 月 2 日的周榜中显示,V4 Flash 在该平台全周处理量为 7.22 万亿 Token。这些都是平台自行披露的数据,并非对全部模型使用量的独立审计;但两组数字足以显示,Agent 工作流可以把调用规模推到极高水平。20
23
29
一次性聊天通常只有较短的提示词和有限的回复;编码 Agent 的“工作台”却大得多:源文件、终端输出、测试失败信息、此前的决策、生成的补丁,以及连续的工具调用。它在尝试完成任务时,往往会反复读取和带回其中的大量上下文。
OpenCode 公布的 V4 Flash 数据显示,平均每个会话约消耗 1200 万 Token,输入缓存比例为 95%。这些数据不能证明每一轮会话都是完全自主的编程任务,但与普通短对话相比,它们更符合长上下文、反复迭代的工作模式。25
关键在于,用户真正需要的不是更多 Token,而是一个能合并的代码变更、通过的测试套件、可运行的原型,或被正确完成的业务流程。因此,更实用的评估方式是:
单个合格任务的成本 = 模型与工具循环总成本 ÷ 任务达到要求的概率
这里的总成本还包括失败尝试、重试、人工审核、等待时间,以及修复错误的代价,而不只是 API 标价中的输入和输出单价。
围绕 V4 Flash 的公开报道援引其第一方定价:每百万输入 Token 为 0.14 美元,每百万输出 Token 为 0.28 美元。12 对开发者而言,这意味着可以以更低成本保留更多上下文、进行更多轮迭代,并让 Agent 自动运行更多测试。
这并不意味着便宜模型总是更好。真正的逻辑是:当 Agent 为完成一项常规工作需要很多轮交互时,如果能力差距较小、成本差距却很大,低价模型可能更有优势。
例如,一项比较称,Artificial Analysis Intelligence Index v4.1 中,V4 Flash Max 得分为 50,Claude Opus 4.8 Max 为 56;但跑完整套评测的模型调用成本分别约为 72.02 美元和 3752.55 美元。六分差距对应巨大的成本差异,但这只是评测比较,不能据此推断两者在真实任务中的可靠性完全相同。16
对于高难度、高风险任务,如果高端模型能显著减少失败部署、人工监督或返工,它的“每个合格结果成本”依然可能更低。结论并非“所有任务都选最便宜的模型”,而是应按实现可接受结果的总成本来分配任务。
“DeepSeek 斩杀线”更适合作为市场隐喻来理解:一款低价、接近前沿的模型,会挤压那些价格高得多,却无法提供明显更优任务结果的产品。
不同层级受到的影响并不相同:
换句话说,低价 Agent 模型可能成为大多数重复性工作的默认“执行者”,高端模型则更像处理棘手问题的升级专家;中间档必须证明,它确实能降低任务总成本。
DeepSeek V4 Flash 是一款混合专家(MoE)模型:总参数量 2840 亿,但每生成一个 Token 约激活 130 亿参数,并支持 100 万 Token 上下文窗口。17 这种设计将模型的总体容量,与单个 Token 实际需要的计算量分开。
其效率策略主要包括:
这些并不只是参数表上的技术名词。它们决定了让一个 Agent 检查大型代码库、调用工具,并在多次出错后继续恢复和修正,在财务上是否可承受。
基准能力仍然重要,但对 Agent 而言,它不再是唯一的前沿指标。更有用的比较框架是三项权衡:
这次被报告的单日 8 万亿 Token,让第三项变得格外直观。当 Agent 替代一次性问答时,Token 消耗可以成数量级增长。能够让长上下文和多次重试保持低成本的模型,有机会成为广泛、重复性 Agent 工作负载的默认选择;而能力更强的旗舰模型,仍可能是最困难任务的更优选项。20
25
33
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
OpenCode 报告称,DeepSeek V4 Flash 在 8 月 1 日处理了 8 万亿 Token,其中 5 万亿来自免费试用、3 万亿来自付费 Go 服务,反映出 AI 使用正转向高频迭代的 Agent 工作流。
OpenCode 报告称,DeepSeek V4 Flash 在 8 月 1 日处理了 8 万亿 Token,其中 5 万亿来自免费试用、3 万亿来自付费 Go 服务,反映出 AI 使用正转向高频迭代的 Agent 工作流。 OpenCode 当前数据列出,V4 Flash 平均每个会话约消耗 1200 万 Token,输入缓存命中比例为 95%;这与需要反复携带代码库和工具输出的长上下文任务相吻合。
V4 Flash 的公开价格为每百万输入 Token 0.14 美元、每百万输出 Token 0.28 美元。低价并不天然代表更优,但它让更多轮尝试、测试与修复在经济上变得可行。