DeepSeek V4 Flash Vision Exp 於 2026 年 8 月 21 日推出,是在 V4 Flash 文字、推理與 Agent 能力上加入圖片理解的實驗性 API 模型。 模型可接受 JPEG、PNG、GIF 與 WebP,並透過 Chat Completions、Responses 等 API 處理截圖、文件、圖表及圖文混合的工具工作流程。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4-Flash-Vision-Exp, the experimental multimodal variant of DeepSeek’s V4-Flash text model, and how does its claimed perfor. Article summary: DeepSeek-V4-Flash-Vision-Exp is a newly released, API-only experimental multimodal version of DeepSeek V4-Flash: it retains the base model’s text/agent, reasoning, and world-knowledge functions while adding image underst. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4-Flash API 系列首款加入視覺能力的模型。它保留 V4-Flash 原有的文字理解、推理、Agent 與世界知識能力,新增圖片輸入,讓模型可以處理更完整的多模態工作流程。DeepSeek 將它定位為實驗性模型,並宣稱其多模態 Agent 表現已接近 Claude Opus 4.8;不過,目前仍沒有足夠的獨立證據,能把這項說法視為已確立的排行榜結果。
開發者可在 DeepSeek API 中使用模型識別碼 deepseek-v4-flash-vision-exp。DeepSeek 的發布說明指出,新模型在文字能力上與 V4-Flash 相當,涵蓋 Agent、推理與世界知識;在需要視覺理解的基準測試上,則有明顯提升。
最大的變化是輸入方式。模型可以同時處理文字與 JPEG、PNG、GIF 或 WebP 圖片,適合用於描述影像、讀取截圖中的文字、回答視覺問題,以及分析圖表等任務。
但模型名稱末尾的「Exp」值得留意。這代表它目前更適合拿來測試、驗證與受控部署,而不是直接取代已在正式環境中運作的成熟模型。它首先是 API 產品的新增選項,並不等於一款已經完成全面打磨的消費者產品。
DeepSeek 文件顯示,deepseek-v4-flash-vision-exp 可透過 Chat Completions 與 Responses 介面呼叫,並支援圖文混合請求。
圖片可依照官方視覺指南,透過多種方式傳入,包括 Base64 內嵌資料、外部 URL 與 Files API。Responses API 文件也明確說明了如何使用此模型傳送圖片。
這使它特別適合 Agent 開發:Agent 可以先讀取螢幕截圖、圖表、掃描文件或網頁畫面,再決定下一步要呼叫哪個工具。DeepSeek 的 Codex 整合文件也把 Vision Exp 列為可選模型,並註明它額外支援圖片輸入。
DeepSeek 表示,DeepSeek Harness 0.1.1 已加入對此模型的支援,為現有 Agent 工作流程提供另一條接入路徑。至於 GitHub Copilot,DeepSeek 目前文件列出的模型選擇器是 V4 Pro 與 V4 Flash;該文件描述的圖片處理方式,是交由另一個已安裝的 Copilot 模型代為理解,因此不能據此認定 Vision Exp 已直接出現在該選擇器中。
DeepSeek 的核心說法有兩層:第一,Vision Exp 的純文字能力維持 V4-Flash 水準;第二,它在多模態 Agent 基準測試上大幅進步,整體能力接近 Claude Opus 4.8。
部分報導引述了個別測試數字,包括 Chartography 64.3、ApexBench Pass@1 36.5、Agents’ Last Exam 27.3,以及 ZeroBench Pass@5 35.0。但這些數字目前主要是透過二手報導轉述 DeepSeek 的發布內容,並非一份涵蓋相同提示、工具環境、延遲、失敗率與成本的獨立跨廠商評測。
因此,「接近 Opus 4.8」不代表 Vision Exp 在整體表現上擊敗 Claude,也不代表它在每一類任務或正式生產環境中都具備同等可靠度。現有資料不足以公平比較 DeepSeek、Anthropic、OpenAI、Google 或其他中國 AI 實驗室的模型。
較穩妥的結論是:DeepSeek 確實推出了一款有文件支援、能理解圖片的 API 模型;官方數據則顯示,在需要視覺輸入的任務上,它相較於純文字 V4-Flash 有實質進步。至於它在整個模型市場中的位置,仍有待獨立測試確認。
目前可查到的模型列表顯示,Vision Exp 的價格為每百萬輸入 tokens 0.22 美元、每百萬輸出 tokens 0.66 美元,上下文長度為 100 萬 tokens。DeepSeek 官方價格文件也確認 API 以每百萬 tokens 為單位計費,並將
deepseek-v4-flash-vision-exp 列入模型表格。
圖片會先轉換成 tokens,再納入 API 計費。引述 DeepSeek 公開指引的報導指出,單張圖片最多可能佔用 384 tokens,且採用 V4-Flash 的計費結構。因此,實際的視覺工作流程成本不只取決於文字 token 單價,也會受到圖片數量與尺寸、附帶文字長度、輸出長度,以及是否重複傳送上下文等因素影響。
Anthropic 公布的 Claude Opus 4.8 標準價格則是每百萬基礎輸入 tokens 5 美元、每百萬輸出 tokens 25 美元,另有快取與 Fast mode 等不同費率。
若只看牌價,DeepSeek 的確便宜許多,這是值得開發者進行測試的理由。但低單價不等於完整工作流程的總成本一定較低。如果模型需要更多重試、工具呼叫錯誤較多,或必須額外進行圖片前處理,最終成本仍可能上升。
兩者雖然都適合多模態與 Agent 任務,但產品定位並不相同:
DeepSeek 的策略相當清楚:在 Flash 級別的成本定位中加入視覺能力,同時挑戰高階模型在多模態 Agent 任務上的表現。不過,現有證據並未證明 Claude 在所有基準測試上都必然勝出;較能確認的是,Opus 4.8 擁有更成熟、較完整的產品表面與工具生態,而 Vision Exp 仍處於實驗階段。
實際比較應該以任務為單位。若是讀取截圖、擷取圖表資料或分類文件,Vision Exp 可能以更低的 token 成本提供足夠品質。若是高風險的自主工作流程,則應優先檢查一致性、工具使用準確度、拒答行為、可觀測性、技術支援與錯誤復原能力。
這次更新的重要性,不只是「模型現在會看圖」,而是視覺理解正逐漸成為 Agent 工作的一部分。程式設計 Agent 可能需要讀取錯誤截圖,瀏覽器 Agent 需要理解網頁畫面,企業自動化系統則可能要同時處理文件、表格、圖表與工具呼叫。
DeepSeek V4 系列本身已把長上下文與 Agent 工作負載列為重點,官方文件也將 Flash 定位為系列中速度較快、成本較低的選項。Vision Exp 延續了這個方向,將圖片理解整合進多模態 Agent,而不是另做一款只回答圖片問題的模型。
但目前資料仍不足以宣稱 DeepSeek 已經全面領先 Anthropic、OpenAI、Google 或其他中國 AI 團隊。現有來源沒有提供獨立、同條件的跨模型評測,而實驗性 API 版本也不能直接等同於經過長期驗證的旗艦產品。
值得,但必須進行受控測試。
一個有參考價值的試用方案,是讓 Vision Exp、Claude Opus 4.8 與目前正式使用的模型,在完全相同的圖片加工具任務上接受比較,並追蹤以下指標:
在這些結果出來之前,最合理的評價是審慎但正面:DeepSeek V4 Flash Vision Exp 是一款可信、價格具吸引力、開發者介面完整的新多模態 API 實驗。它「接近 Claude Opus 4.8」的宣稱值得親自測試,但目前還不能當成已獲獨立證實的事實。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
DeepSeek V4 Flash Vision Exp 於 2026 年 8 月 21 日推出,是在 V4 Flash 文字、推理與 Agent 能力上加入圖片理解的實驗性 API 模型。
DeepSeek V4 Flash Vision Exp 於 2026 年 8 月 21 日推出,是在 V4 Flash 文字、推理與 Agent 能力上加入圖片理解的實驗性 API 模型。 模型可接受 JPEG、PNG、GIF 與 WebP,並透過 Chat Completions、Responses 等 API 處理截圖、文件、圖表及圖文混合的工具工作流程。
目前可見的模型列表顯示,其價格為每百萬輸入 tokens 0.22 美元、輸出 0.66 美元;Claude Opus 4.8 則為 5 美元與 25 美元。