DeepSeek 於 2026 年 8 月 21 日推出 V4 Flash Vision Exp,為 V4 Flash 加入圖片理解能力;每張圖片最多計 384 個輸入 tokens,收費跟 V4 Flash 看齊。 開發者可以透過內嵌 Base64、公開圖片網址,或者免費 Files API 傳送圖片;Files API 支援上載一次,再用 file id 在多次請求中重用。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek 於 2026 年 8 月 21 日推出實驗性多模態模型 deepseek-v4-flash-vision-exp,正式為 V4-Flash API 加入圖片理解能力。開發者而家可以將文字同圖片放入同一個提示,讓 AI Agent 分析截圖、網頁介面、圖表、遊戲畫面及其他視覺狀態。 114
今次更新最吸引人的地方,未必係跑分,而係收費方式:每張圖片最多會轉換成 384 個輸入 tokens,並按 V4-Flash 的一般輸入價格計算,沒有另外收取視覺模型附加費。DeepSeek 又聲稱,模型在視覺 Agent 表現上已經接近 Claude Opus 4.8;不過,相關結果主要來自公司自行公布的測試,暫時未有獨立測試證實。 319
模型要用的 API identifier 是 deepseek-v4-flash-vision-exp。它以 V4-Flash 原有的文字生成、推理及工具使用能力為基礎,再加入圖像輸入,並支援 Chat Completions、Messages 及 Responses 三種 API 介面。 412
換句話講,佢唔只係一個「幫你描述圖片」的功能。Agent 可以將截圖放入一個循環流程:先睇目前畫面,決定下一步要做甚麼,呼叫工具執行操作,再分析新畫面,繼續完成任務。
目前公開示範包括由截圖生成可執行程式碼,以及將視覺輸入應用於製作遊戲等工作流程。 510
開發者可以用以下三種方法傳送圖片:
file_id 引用圖片。 6714Files API 免費使用。如果應用程式需要反覆分析同一張截圖、同一個介面狀態或者固定素材,先上載一次、之後重用 file_id 會較實際,亦可以避免每次請求都重新上載相同圖片,減少傳輸量。 112
DeepSeek 表示,每張圖片在計費時最多會被轉換成 384 個輸入 tokens,而相關 tokens 會按 V4-Flash 的正常輸入價格收費。換句話講,圖片理解不會自動跳入另一個更貴的 Vision 價格層。 3614
其中一份公開價格表列出的高峰時段價格為:每百萬個未快取輸入 tokens 0.44 美元、每百萬個輸出 tokens 1.32 美元。該模型亦列出 100 萬 tokens 上下文窗口,以及最多 384,000 個輸出 tokens。 1
有報道指,384-token 上限少於部分 GPT 及 Claude 對同類圖片的 token 用量一半。不過,現有資料未能確認比較時所用的完整模型版本、圖片解像度及計費假設是否一致,因此這只能視為方向性參考,未可以當成完全公平的跨平台基準測試。 327
對開發者來講,較實際的重點係:一個需要頻繁檢查大量截圖的視覺 Agent,可以用相對可預測的成本反覆「睇畫面」,未必要每次都動用高價多模態模型。
DeepSeek 表示,新模型在加入視覺輸入之後,仍然保留 V4-Flash 的文字能力,包括推理、世界知識及 Agent 功能。 626
公司亦公布,模型在多模態 Agent 基準測試上有大幅進步,表現接近 Claude Opus 4.8。部分公開比較確實顯示它在指定任務上貼近 Opus 4.8,但不同基準測試之間亦存在差異。 4192123
所以,「接近 Opus 4.8」現階段應該理解為 DeepSeek 根據自己評測結果提出的說法,而唔係兩個模型已經在所有實際視覺 Agent 工作中等價。要判斷模型在真實環境的可靠性、視覺準確度及工具操作能力,仍然需要獨立測試,尤其要用各種實際截圖和長時間 Agent 流程驗證。
如果要將模型放入生產環境的視覺 Agent 循環,開發者應該先測試 reasoning 或 thinking 設定。一項實測報告指出,thinking tokens 有機會耗盡整個 completion budget,結果模型沒有留下任何可見答案。報告建議,相關視覺任務可以關閉 thinking,或者提高 max_tokens,確保模型有足夠空間輸出回應。 27
這是整合層面的注意事項,唔代表模型整體能力一定有問題。如果開啟推理,應用程式就要預留足夠輸出額度,同時容納內部推理及最後給使用者看的答案。正式部署前,亦應以 DeepSeek 最新 API 文件確認目前的參數名稱及實際行為,唔好單靠第三方實測設定照搬。
現有資料未有提供 DeepSeek 對整體策略的正式解釋,但產品設計已經指向一個清晰用途:將視覺感知的成本壓低,令 Agent 可以更頻密地觀察和行動。
對於螢幕操作 Agent、截圖轉程式碼工具、遊戲製作流程,以及需要不斷讀取儀表板或應用程式狀態的系統來講,AI 唔係睇一次圖就完事,而係要反覆檢查畫面。如果每次觀察都要支付高昂的多模態模型費用,整個循環就容易變得唔划算。
以實驗性 Flash 版本推出 Vision,亦讓開發者可以在原有低成本 Agent、工具呼叫及 API 工作流程上加上圖片輸入,而唔需要將整個應用搬到另一個高價多模態平台。 356
總結而言,DeepSeek V4-Flash-Vision-Exp 的賣點相當直接:每張圖片最多 384 個輸入 tokens、按 Flash 價格收費,並提供三種圖片傳入方式及免費 Files API。至於它是否真的能在實際視覺 Agent 工作中追上 Opus 4.8,仍然要等更多獨立測試。對有意試用的團隊,較穩陣的做法係先用真實截圖進行小規模測試,預留足夠輸出預算,並自行檢查答案質素及工具操作結果。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
DeepSeek 於 2026 年 8 月 21 日推出 V4 Flash Vision Exp,為 V4 Flash 加入圖片理解能力;每張圖片最多計 384 個輸入 tokens,收費跟 V4 Flash 看齊。
DeepSeek 於 2026 年 8 月 21 日推出 V4 Flash Vision Exp,為 V4 Flash 加入圖片理解能力;每張圖片最多計 384 個輸入 tokens,收費跟 V4 Flash 看齊。 開發者可以透過內嵌 Base64、公開圖片網址,或者免費 Files API 傳送圖片;Files API 支援上載一次,再用 file id 在多次請求中重用。
模型保留 V4 Flash 的文字、推理及 Agent 能力,但視覺工作流程要小心設定輸出額度,因為有測試發現 thinking tokens 可能耗盡整個回應預算。