DeepSeek在2026年8月21日上线实验性多模态模型deepseek-v4-flash-vision-exp,为V4-Flash API补上了图像理解能力。开发者现在可以把截图、网页界面、图表或游戏画面与文字一起交给模型,让Agent先“看见”当前状态,再决定是否调用工具或采取下一步行动。114
这次发布最受关注的并不是一个单独的图片描述功能,而是视觉能力的计费方式:DeepSeek称,每张图片最多折算384个输入Token,并按照V4-Flash的普通输入价格计费,不额外收取视觉模型溢价。314
V4-Flash-Vision-Exp带来了什么
该模型的API标识为deepseek-v4-flash-vision-exp。它在V4-Flash原有的文本生成、推理和工具调用基础上,加入了图文混合输入能力,并支持Chat Completions、Messages和Responses三种调用形式。412
因此,模型可以被放进更完整的视觉Agent循环中:读取当前界面截图,判断下一步操作,调用工具,再观察工具执行后的新画面。已有演示包括根据截图生成可执行代码,以及将视觉输入用于游戏制作等场景。510
三种图片传入方式
开发者可以选择以下方式提交图片:
- 内联Base64:将本地图片编码为数据URL,直接嵌入请求。
- 外部URL:传入API可以访问的公开HTTP(S)图片地址。
- Files API:先上传图片,再在后续请求中通过返回的
file_id引用。6714
Files API免费使用。对于需要反复调用同一张截图、产品界面或参考图片的应用,先上传、后复用通常更实用,也能避免每次请求都重复上传相同的图片数据,减少带宽开销。112
每张图片最多384个Token,价格与Flash一致
DeepSeek表示,图片在计费时最多转换为384个输入Token,这些Token按照V4-Flash的输入价格计算,不会进入单独的视觉高级价位。3614
一份公开价格表显示,该视觉模型在高峰时段的价格为:每百万个未缓存输入Token 0.44美元,每百万个输出Token 1.32美元;同时列出的上下文窗口为100万Token,最大输出为38.4万个Token。1
部分报道将384个Token的上限与GPT、Claude的图像处理开销进行了比较,称其不到一些对比模型的一半。但现有材料没有证明这些比较使用了完全相同的模型版本、图片分辨率和计费口径,因此更适合作为方向性参考,而不是严格统一的横向基准。327
对开发者而言,更确定的意义在于成本可预测:如果一个视觉Agent需要频繁检查截图或界面状态,每次观察的图像输入都能按相对有限的Token量、以Flash价格计费,而不必为每一轮感知都切换到更昂贵的多模态模型。
“接近Claude Opus 4.8”仍是厂商测试结论
DeepSeek表示,V4-Flash-Vision-Exp保留了V4-Flash在文本任务中的能力,包括推理、世界知识和Agent功能,同时新增视觉输入。626
公司还称,新模型在多模态Agent基准测试上实现明显提升,表现接近Anthropic的Claude Opus 4.8。部分公开对比确实显示其在特定任务上接近Opus 4.8,但不同基准之间仍存在明显波动。4192123
这里需要区分两件事: “接近Opus 4.8”目前是对DeepSeek自有评测结果的概括,并不等于两款模型已经在所有真实视觉Agent任务中表现相当。后续仍需要独立测试来检验模型在视觉识别准确率、长期可靠性、工具调用和复杂界面操作方面的实际表现。
接入时要小心:thinking可能耗尽输出预算
开发者在把模型放进生产环境的视觉循环前,应重点测试推理设置。一份实测报告发现,开启thinking模式后,推理Token可能消耗完整的completion预算,最终没有留下可见回答。该报告建议针对相关视觉任务关闭thinking,或提高max_tokens,确保模型有足够空间返回结果。27
这属于接入层面的注意事项,并不能直接代表模型的整体能力。如果应用启用了推理,最好为内部推理和最终答复预留足够的输出额度;在不需要复杂推理的视觉任务中,也可以考虑使用非思考模式。具体参数名称和当前行为仍应以DeepSeek最新API文档为准。
为什么视觉能力要放在Flash模型上
现有证据没有显示DeepSeek给出正式的战略说明,但从产品设计看,核心方向相当明确:让视觉感知便宜到足以支持高频Agent操作。截图、仪表盘、网页界面和游戏画面,只有在模型能够持续观察而不会让每一轮循环成本过高时,才真正适合用于Agent工作流。356
将视觉能力作为实验性的Flash版本推出,也意味着开发者可以在原有的低成本模型、工具调用和API流程上增加图像输入,而不必把整套应用迁移到独立的高价多模态产品上。对于屏幕驱动型Agent、截图转代码工具,以及需要持续视觉反馈的应用,这种设计尤其值得关注。
总体来看,DeepSeek V4-Flash-Vision-Exp给出了一个很有吸引力的组合:单张图片最多384个输入Token、三种灵活的图片接入方式,以及与Flash一致的计费方式。与此同时,其基准领先程度和生产环境表现仍需验证。更稳妥的做法是使用真实截图进行小规模测试,同时明确设置输出预算,并通过独立质量检查评估视觉准确性和工具调用稳定性。