DeepSeek 声称,V4 Pro 0813 在 Terminal Bench 2.1、CyberGym 和 DeepSWE 上较 4 月预览版分别提升 15.8、30.6 和 49.9 分;但这些成绩主要来自厂商自报,尚未得到充分独立复现。 开源的 MIT 许可 Harness 将 DeepSeek 的竞争范围从模型 API 延伸至智能体运行时和开发者工作流;其 GitHub 仓库在约一小时内获得超过 2 万颗星,但项目仍处于开发者预览阶段。
研究答案

Create a landscape editorial hero image for this Studio Global article: What does DeepSeek’s move to general availability for its 1.6-trillion-parameter V4 Pro 0813 flagship model—released through the app’s Exper. Article summary: DeepSeek’s GA release appears to be a strategic pivot from a low-cost model vendor toward an integrated agent platform: a stronger flagship model, an open developer runtime, demand-shaping pricing, and capital-intensive . Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek V4 Pro 0813 的正式可用版本,释放出的信号不只是“模型变强了”。DeepSeek 同时推出了开源智能体运行时、按照需求波动调整的 API 定价,以及规模足以支撑长期扩张的基础设施计划。
换句话说,DeepSeek 正在把竞争目标从“提供一个便宜的模型”,扩大到“覆盖智能体技术栈”。不过,最亮眼的能力数据仍主要是 DeepSeek 自己公布的结果。更稳妥的结论不是断言它已经全面击败竞争对手,而是:这家公司正试图在模型、开发工具、算力供给和商业化定价等多个层面同时展开竞争。
DeepSeek 发布的对比数据显示,V4 Pro 0813 相比 4 月预览版,在软件工程和智能体任务评测中取得明显提升:
这些数字来自 DeepSeek 公布的对比表,并被发布报道引用。 在 Terminal-Bench 2.1 上,V4 Pro 0813 的 87.9 分仅比同一对比表中归于 Anthropic Fable 5 的 88.0 分低 0.1 分。
如果这些结果能够在独立环境中复现,V4 Pro 0813 将接近智能体编程任务的前沿水平。这类任务通常要求模型浏览代码仓库、调用工具、执行命令,并完成多步骤的软件工作。
但这里必须加上一个重要限定:上述成绩由厂商报告,现有报道并没有证明它们已经在统一、独立的评测框架中得到复核。DeepSWE 从 12.8 分跃升至 62.7 分确实值得关注,但单凭这一项数据,还不能证明模型在真实生产环境中具备同等可靠性。
从战略角度看,DeepSeek Harness 或许是这次发布中更重要的一步。这是一套以 MIT 许可证发布的开源智能体运行时,位于语言模型和用户开发环境之间,负责协调工具、文件、命令、会话以及多步骤工作流。DeepSeek 的代码仓库将其定义为开源智能体 Harness,并公开了第三方依赖及其许可证信息。
这改变了 DeepSeek 的竞争对象。它不再只是与其他模型供应商争夺 API 调用,也开始进入 Claude Code 和 Codex 所处的工作流层:开发者可以在这一层决定智能体如何运行、能访问哪些工具,以及自己对运行环境保留多少控制权。
Harness 获得了异常迅速的关注。第三方追踪数据显示,该项目发布约一小时后 GitHub star 数就超过 2 万,截至 8 月 17 日已超过 14.1 万。 这说明开发者兴趣很高,但 GitHub star 并不等于生产部署、长期留存用户或经过安全审计的企业集成。
实际使用时仍需保持谨慎。Harness v0.1 目前是开发者预览版,相关报道提醒,未来预计会出现破坏兼容性的变化。 “一切皆插件”的架构有利于定制,却也可能增加运维复杂度。每增加一个工具或插件,就会带来权限管理、维护、故障处理和数据访问等问题。
此外,多步骤编排和冗长的工具描述可能推高 token 消耗。这意味着,模型本身的标价并不一定能代表完整自主工作流的实际成本。超过 2,000 个插件提案说明生态参与度很高,但并不意味着插件市场已经成熟、可信。
因此,评估 Harness 的团队应在隔离环境中测试插件,审查其权限,并计算完成一项任务的总成本,而不是只根据代码仓库的 star 数判断项目价值。
DeepSeek 的 API 定价改革之所以重要,是因为它结束了此前的统一费率,转而采用与时间相关的峰谷计费。已公布的方案曾以北京时间描述高峰时段,后续价格追踪页面则列出了对应的 UTC 时间。由于不同报道对具体时段的表述并不完全一致,开发者在安排任务前应以 DeepSeek 官方定价文档中的当前时间为准。
虽然具体时段需要核对,但价格变化方向很清晰。据新费率报道,V4 Pro 输出 token 的价格从每百万 0.87 美元升至:
视模型、token 类型和计费时段而定,V4 系列部分 token 类别的价格涨幅超过 1,100%。
对开发者而言,实际影响主要有四点:
这不只是一次简单的涨价,也可以被视为容量管理工具。峰谷定价会鼓励具有时间弹性的任务避开需求最高的时段,说明 DeepSeek 开始把推理能力视为稀缺的基础设施资源,而不再把低价作为唯一的增长手段。
即使按照高峰时段每百万输出 token 3.96 美元计算,V4 Pro 仍明显低于发布报道中引用的 Fable 5 每百万输出 token 50 美元的价格。 对于高频编码和智能体工作负载,DeepSeek 依旧保有明显的价格优势。
但这种经济性已经不能简单概括为“几乎免费”。与此前 0.87 美元的价格相比,高峰时段上涨 355%,会改变大量生成输出的生产系统的成本测算。
企业需要比较的是一次成功任务的完整成本,包括重试、工具调用、上下文、延迟以及峰谷时段,而不是只看宣传页面上的每百万 token 费率。
因此,DeepSeek 的价值主张正在变得更传统:它可能仍然提供很强的价格与能力组合,但也越来越要求客户为更高能力付费,并围绕其算力容量安排工作负载。
DeepSeek 的融资和基础设施计划,与上述战略变化相互呼应。据路透社报道,该公司在首轮融资中筹集了超过 500 亿元人民币,约合 74 亿美元。 彭博社另有报道称,DeepSeek 计划在内蒙古乌兰察布建设数据中心,目标是新增约 1GW 算力容量。
这些报道并不能证明战略的每个环节都会成功,也不能证明计划中的设施一定会按时交付。但它们确实显示出 DeepSeek 正走向一种资本投入更重的运营模式。
将模型升级、开源运行时、差异化定价、外部融资和新增算力放在一起看,可以看到四个相互连接的目标:
这与单纯依靠“成为最便宜的可用模型供应商”是完全不同的姿态。
V4 Pro 0813 值得测试,尤其适合用于编码、代码仓库自动化以及工具调用工作流。但组织在正式采用前,应独立验证以下四项:
这次发布最值得关注的地方,最终不是某个单独的分数,而是其背后的战略方向。DeepSeek 正试图从低成本模型供应商,升级为一体化智能体平台:V4 Pro 0813 提供能力叙事,Harness 提供开发者入口,峰谷定价负责调节需求,新的融资和算力计划则支撑基础设施扩张。
这套模式能否形成持久优势,仍取决于几个关键问题:智能体性能能否被独立验证,Harness 能否稳定下来,插件生态是否安全可控,以及在价格上涨之后,开发者是否仍然认为它物有所值。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
DeepSeek 声称,V4 Pro 0813 在 Terminal Bench 2.1、CyberGym 和 DeepSWE 上较 4 月预览版分别提升 15.8、30.6 和 49.9 分;但这些成绩主要来自厂商自报,尚未得到充分独立复现。
DeepSeek 声称,V4 Pro 0813 在 Terminal Bench 2.1、CyberGym 和 DeepSWE 上较 4 月预览版分别提升 15.8、30.6 和 49.9 分;但这些成绩主要来自厂商自报,尚未得到充分独立复现。 开源的 MIT 许可 Harness 将 DeepSeek 的竞争范围从模型 API 延伸至智能体运行时和开发者工作流;其 GitHub 仓库在约一小时内获得超过 2 万颗星,但项目仍处于开发者预览阶段。
API 改为峰谷定价后,V4 Pro 输出 token 价格从每百万 0.87 美元升至非高峰时段 1.98 美元、高峰时段 3.96 美元;DeepSeek 仍然便宜,但过去“几乎免费”的颠覆性叙事正在减弱。