DeepSeek 於 2026 年 8 月 21 日推出 V4 Flash Vision Exp,為 V4 Flash 加入圖片理解;官方比較表顯示,它在 11 項比較中的 3 項勝過 Claude Opus 4.8,但結果仍未經獨立驗證。 API 模型識別碼是 deepseek v4 flash vision exp;圖片會按 input tokens 計費,每張最多 384 tokens,可透過 base64、公開網址或 Files API 的 file id 傳入。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek’s experimental DeepSeek-V4-Flash-Vision-Exp model, released on August 21, 2026, how does it extend the existing V4-Flash te. Article summary: DeepSeek-V4-Flash-Vision-Exp is an experimental, API-only multimodal extension of DeepSeek’s V4-Flash model: it retains the base model’s text, reasoning, agent, and world-knowledge capabilities while adding image underst. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4-Flash 的實驗型多模態版本,於 2026 年 8 月 21 日正式登上 DeepSeek API 平台。它最核心的改變,是在原有文字、推理及 Agent 工作流程之上加入圖片理解能力。開發者可以將文字同圖片一齊交畀模型處理,再由模型回答問題、分析畫面,或者呼叫工具完成任務。
DeepSeek 將佢定位成一個相對平價、適合實際 AI Agent 使用的視覺模型。佢同 Anthropic Claude Opus 4.8 的比較就相當吸睛,但目前公開證據主要仍然係 DeepSeek 自己的測試報告。因此,呢次發布對開發者同模型競爭有一定意義,卻未足以證明它已經全面追上 Anthropic 的旗艦模型。
最直接的答案係:模型而家識「睇圖」。開發者可以一併提交文字及圖片,讓 Agent 分析以下類型的視覺內容:
API 要使用的模型名稱係:
deepseek-v4-flash-vision-expDeepSeek 表示,Vision-Exp 保留 V4-Flash 系列原有的文字能力,包括推理、Agent 及世界知識。官方更新紀錄列出的相關分數包括 Terminal Bench 2.1 的 83.9、DeepSWE 的 59.3,以及 DSBench-Hard 的 63.6。
換句話講,佢唔係一個只負責替圖片加 caption 的獨立視覺模型,而係想將原本處理文字同工具的模型,延伸至「要先睇明白畫面,先可以採取行動」的工作流程。
DeepSeek 聲稱,Vision-Exp 在多模態 Agent benchmark 上已經接近 Claude Opus 4.8,同時維持 V4-Flash 的文字表現。The Next Web 引述 DeepSeek 公開的比較表指出,Vision-Exp 在 11 項列出的 benchmark 中,有 3 項得分高過 Opus 4.8。
但呢個結論要睇得窄啲。所謂「接近 Opus 4.8」,只代表它在 DeepSeek 選取及公布的測試組合中表現接近,並唔等於所有視覺任務、寫程式工作,或者長時間運行的 Agent 都有相同質素。
DeepSeek 官方紀錄亦列出多項 Vision-Exp 分數,包括:
單靠呢幾個數字,仍然未能回答生產環境最關心的問題,例如實際延遲、工具環境兼容性、出錯後能否自行修正、長流程穩定性,以及面對不同提示寫法時會唔會大幅走樣。Benchmark 結果亦會受到提示詞、工具設定、任務選擇、評測方法及延遲要求影響。
所以,現階段較準確的講法係:DeepSeek 的數據顯示 Vision-Exp 在部分多模態測試具備挑戰 Opus 4.8 的實力,但尚未有足夠獨立證據,證明它已經全面達到同等水平。
對於文字為主的應用,Vision-Exp 最強的賣點係延續性,而唔係明確稱霸。DeepSeek 將佢描述成保留 V4-Flash 既有文字能力,換言之,開發者唔需要為咗加入圖片輸入,就放棄原本的推理及 Agent 行為。
實際揀模型時,可以咁樣理解:
DeepSeek 已經透過 API 平台提供 Vision-Exp,支援 Chat Completions、Messages 及 Responses,亦支援文字加圖片的混合輸入。
圖片有 3 種提交方式:
file_id 引用。官方文件列出的支援格式包括 JPEG、PNG、GIF 及 WebP。 Responses API 就使用
input_image 內容部分,圖片可以透過 image_url、base64 data URL 或已上載檔案的 file_id 提供。
其中,Files API 的檔案識別碼格式為 file-api-...。
圖片輸入會先轉換成可計費的 input tokens。DeepSeek 表示,每張圖片最多計 384 input tokens,並沿用 V4-Flash 的收費結構。
今次發布相關的 V4-Flash 公開價格如下:
384-token 上限令圖片部分的成本相對容易預算。不過,呢個上限只適用於圖片本身;同一個 Agent 對話內的文字、工具呼叫及模型輸出,仍然會另外消耗 tokens,完整一次任務的總成本可以遠高過圖片輸入本身。
DeepSeek 同時發布 Harness 0.1.1,並提供對 Vision-Exp 的開箱即用支援。 對於要建立會呼叫工具、執行多步驟工作的 Agent 開發者來講,呢點比單次問模型「張圖有咩」更加實際。
此外,官方亦推出免費 Files API。開發者可以先上載一張圖片,之後在不同請求中以 file_id 重複引用,而唔使每一輪都重新傳送相同的圖片資料。
例如 Agent 要在多輪對話中反覆檢查同一張介面截圖、文件頁面或設計稿,呢種「上載一次、之後引用」的方式可以減少重複傳輸。要留意的是,Files API 本身免費,並唔代表模型推理或 tokens 使用都免費;相關請求仍然會按模型用量計費。
Vision-Exp 反映 AI 競爭已經唔再只係鬥模型分數,亦包括 API 價格、格式兼容性、檔案管理及 Agent 工具。DeepSeek 以 V4-Flash 的公開 token 費率提供視覺擴充功能,再以 Anthropic 的 Opus 4.8 作為高階比較對象,正好顯示視覺推理正逐步由高價功能變成開發者可以更容易試用的基礎能力。
不過,呢次仍然係一個標明 Experimental 的 Flash 系列版本,而唔係宣布取代旗艦模型。佢最後能否站穩陣腳,關鍵未必係一張 benchmark 表,而係開發者實際使用時,能否穩定處理以下工作:
最穩陣的結論係:DeepSeek 令低成本視覺推理更容易經由現有 API 生態接入,而早期數據亦顯示它在部分多模態測試中具備實質競爭力。但在將佢用於關鍵生產流程之前,仍然應該先做獨立評測;最終它會成為長期替代方案,定係只係一個幾有睇頭的實驗版本,還要睇真實可靠性及開發者採用情況。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
DeepSeek 於 2026 年 8 月 21 日推出 V4 Flash Vision Exp,為 V4 Flash 加入圖片理解;官方比較表顯示,它在 11 項比較中的 3 項勝過 Claude Opus 4.8,但結果仍未經獨立驗證。
DeepSeek 於 2026 年 8 月 21 日推出 V4 Flash Vision Exp,為 V4 Flash 加入圖片理解;官方比較表顯示,它在 11 項比較中的 3 項勝過 Claude Opus 4.8,但結果仍未經獨立驗證。 API 模型識別碼是 deepseek v4 flash vision exp;圖片會按 input tokens 計費,每張最多 384 tokens,可透過 base64、公開網址或 Files API 的 file id 傳入。
發布同日亦有 Harness 0.1.1 及免費 Files API,方便開發者建立分析截圖、文件及其他視覺素材的多輪 Agent。