对于文本密集型应用,DeepSeek最明确的说法是“保持原有能力”,而不是宣称全面领先。Vision-Exp被定位为V4-Flash的视觉扩展,因此开发者无需为了获得图片输入,就放弃V4-Flash已经具备的推理和智能体行为。
这一区别对选型很重要:
图片有三种传入方式:
file_id。与此次发布相关的V4-Flash公开费率为:
384 token的上限让单张图片带来的费用相对可预测。不过,它只限制图片部分,不包括随图片发送的文字、工具调用以及模型生成的输出。因此,一次完整的智能体交互的总token消耗,仍可能明显高于图片本身。
DeepSeek在发布模型的同时推出Harness 0.1.1,并提供对Vision-Exp的开箱即用支持。 对于正在开发工具调用型智能体的团队来说,这比单独测试一个图片问答接口更有实际意义,因为Vision-Exp本身就是为视觉与工具协作的工作流设计的。
此次发布还带来了免费的Files API。开发者可以先上传一张图片,之后在请求中通过file_id重复引用,而不必每次重新发送同一份图片数据。DeepSeek文档显示,文件引用采用file-api-...形式。
这种机制适合需要在多轮对话中反复查看同一张截图、文档页面或视觉素材的场景。需要注意的是,Files API本身免费,并不意味着模型推理和token使用不收费。
Vision-Exp显示,模型竞争正在从单纯比较参数规模或单项能力,转向比较完整的开发者产品:多模态支持、API兼容性、价格、文件复用和智能体工具链。DeepSeek以V4-Flash公开费率提供Flash系列的视觉扩展,而Anthropic的Opus 4.8则成为其公开报告中的高端对比对象。
不过,它目前仍应被视为一个中端、实验性的产品发布,而不是对旗舰模型地位的明确宣告。“Flash”和“Exp”这两个产品标识,都提示开发者不要仅凭一张基准测试表就做出生产决策。
它最终能否产生更大影响,取决于开发者在真实场景中是否认为它足够稳定,尤其是在基于截图的编程、文档分析、界面智能体和视觉工具调用等任务上。低token价格可能降低视觉推理的使用门槛,但可靠性、延迟、错误恢复和长期运行表现同样重要。
更稳妥的结论是:DeepSeek已经通过现有API生态,以较低成本开放了视觉推理能力;其早期基准结果显示,它在部分多模态测试中对Anthropic构成了有分量的挑战。但Vision-Exp究竟会成为可持续的替代方案,还是停留在引人关注的实验性版本,仍要等待独立评测、真实业务表现和持续的开发者采用来回答。