这使它更适合 Agent 场景,而不只是传统的“看图问答”。例如,Agent 可以先读取一张网页截图、扫描文档或数据图表,再决定下一步是否调用搜索、代码执行或其他工具。DeepSeek 还提供了 Codex 接入方式,并将 Vision Exp 列为支持图片输入的模型选项。
DeepSeek 的发布说明称,DeepSeek Harness 0.1.1 已加入该模型的开箱即用支持,为 Agent 工作流提供了另一条接入路径。不过,DeepSeek 关于 GitHub Copilot 的文档目前明确列出的模型仍是 V4 Pro 和 V4 Flash;其中的图片处理由另一个已安装的 Copilot 模型代理完成,因此现有资料并不能证明 Vision Exp 已直接出现在该模型选择器中。
DeepSeek 的核心性能宣传可以概括为两点:文本能力保持 V4-Flash 水平;在依赖视觉输入的多模态 Agent 基准测试中大幅提升,并接近 Claude Opus 4.8。
部分报道转述了具体分数,包括 Chartography 64.3、ApexBench Pass@1 36.5、Agents’ Last Exam 27.3 和 ZeroBench Pass@5 35.0。这些数字主要来自对 DeepSeek 发布信息的二次报道,而不是一份包含统一提示词、工具环境和可复现实验细节的跨厂商评测报告。
这里的区别很重要。“接近 Opus 4.8”并不等于全面击败 Claude,也不等于在每类任务上持平,更不代表两者在生产环境中拥有相同的稳定性。现有资料没有提供一项中立测试,同时比较 DeepSeek 与 Anthropic 在相同提示词、工具环境、延迟、失败率和成本下的表现。
因此,目前最稳妥的结论是:DeepSeek 确实发布了一款有文档支持、能够处理图片的 API 模型;其官方数据表明,相比纯文本版 V4-Flash,它在需要视觉输入的 Agent 任务上可能有明显进步。但它相对于 Claude、OpenAI、Google 或其他中国 AI 模型的准确排名,尚未得到独立证实。
现有模型目录显示,Vision Exp 的价格为每百万输入 token 0.22 美元、每百万输出 token 0.66 美元,上下文长度为 100 万 token。DeepSeek 官方价格文档确认,API 按每百万 token 计费,并将
deepseek-v4-flash-vision-exp 列入模型价格表。
图片也会被转换为 token 并计入 API 费用。援引 DeepSeek 发布说明的报道表示,单张图片最多可能占用 384 个 token,且计费结构沿用 V4-Flash。因此,视觉工作流的实际成本不仅取决于文本输入和输出,还取决于图片数量与尺寸、上下文长度、输出长度以及是否反复发送相同内容。
Anthropic 公布的 Claude Opus 4.8 标准价格为每百万基础输入 token 5 美元、每百万输出 token 25 美元;缓存和快速模式另有价格。
只看公开标价,DeepSeek 的确便宜得多。这是值得测试它的重要理由,但还不能直接等同于更低的完整使用成本。如果一个更便宜的模型需要更多重试,工具调用错误更多,或需要额外的图片预处理,那么整个工作流的成本优势可能会缩小。
两者虽然都面向 Agent 和多模态任务,但定位并不相同:
DeepSeek 的战略意图很清晰:把视觉能力带入更经济的 Flash 模型,并宣称其在多模态 Agent 任务上接近高价前沿模型。基于现有证据,Claude 的优势并不能简单概括为“所有基准都更强”,但它在产品成熟度、工具生态和长期生产定位方面有更充分的公开支撑。
实际选择应按任务拆分。对于截图读取、图表提取或批量文档初筛,Vision Exp 可能以更低 token 成本提供足够的质量;而对于高风险的自主工作流,更应关注输出一致性、工具调用准确率、拒答行为、可观测性、技术支持和错误恢复能力。
这次更新的重要性,不只是“文本模型终于能看图”,而是视觉理解正在成为 Agent 工作的一部分。编程 Agent 可能需要读取报错截图,浏览器 Agent 需要理解网页界面,企业自动化系统则可能要同时处理文档、图表和结构化工具调用。
DeepSeek V4 家族此前就强调百万 token 长上下文和 Agent 工作负载,其文档将 Flash 定位为家族中更快、更经济的选项。Vision Exp 延续了这一思路:它不是单独推出一个只负责图像问答的模型,而是把视觉输入直接带入 V4-Flash 的 Agent 方向。
不过,现有材料还不足以宣称 DeepSeek 已经领先 Anthropic、OpenAI、Google 或其他中国 AI 实验室。原因很简单:目前没有可供核验的、真正“同题同环境”的独立跨厂商测试,而实验性 API 版本也不能与经过长期验证的旗舰产品画等号。
值得,但应当进行受控测试,而不是直接迁移生产流量。
一套有参考价值的试用方案,可以让 Vision Exp、Claude Opus 4.8 和当前生产模型在完全相同的图片加工具任务上接受测试,并记录以下指标:
在这些数据积累之前,对 DeepSeek V4 Flash Vision Exp 最合适的评价是:它是一款可信、价格有吸引力、开发者接口较完整的新多模态 API 实验,值得立即验证;但“多模态 Agent 能力接近 Claude Opus 4.8”目前仍应被视为待测试的官方主张,而不是已经独立确立的事实。