DeepSeek 於 2026 年 8 月 21 日推出 deepseek-v4-flash-vision-exp,把圖片理解能力加入 V4-Flash API。這款實驗性模型能接收文字與圖片混合提示,讓開發者以相對低的成本打造可分析截圖、使用者介面、圖表及其他視覺狀態的 Agent。 114
這次發布最受關注的並不只是「讓模型看得見」,而是圖片輸入的計價方式:每張圖片最多折算 384 個輸入 Token,並按照 V4-Flash 的一般輸入價格計費,不另收視覺處理附加費。DeepSeek 也表示,模型的視覺 Agent 表現已接近 Claude Opus 4.8;不過這項比較來自公司公布的測試,目前尚未獲得獨立驗證。 319
V4-Flash-Vision-Exp 帶來什麼
模型在 API 中的識別名稱是 deepseek-v4-flash-vision-exp。它在保留 V4-Flash 文字生成、推理與工具使用基礎的同時,加入圖像與文字混合輸入,並可透過 Chat Completions、Messages 及 Responses 介面呼叫。 412
因此,它不只是用來「描述一張圖片」的視覺模型。Agent 可以把截圖放進一個持續運作的工作流程:先檢查目前畫面,判斷下一步,再呼叫工具,最後重新分析操作後的畫面。公開示範包括根據截圖產生可執行程式碼,以及在遊戲製作流程中使用視覺輸入。 510
三種圖片輸入方式
開發者可選擇以下三種方式傳送圖片:
- 內嵌 Base64: 將本機圖片編碼後,以 data URL 直接放入請求。
- 外部 URL: 提供 API 可存取的公開 HTTP(S) 圖片網址。
- Files API: 先上傳圖片,再於後續請求中使用回傳的
file_id 引用。 6714
Files API 免費使用,對需要反覆檢查同一張截圖或同一組視覺資料的應用尤其實用。圖片只需上傳一次,之後便能以檔案參照重複呼叫,避免每次請求重新傳送相同的圖片資料,也可降低循環式 Agent 的傳輸負擔。 112
每張圖片最多 384 個 Token,價格跟隨 V4-Flash
DeepSeek 表示,每張圖片在計費時最多會被轉換為 384 個輸入 Token,並按照 V4-Flash 的正常輸入費率收費,因此圖片理解不會被放進另一個更昂貴的視覺模型價格層級。 3614
一份公開價格表列出的尖峰價格為:每百萬個未快取輸入 Token 0.44 美元,每百萬個輸出 Token 1.32 美元。該模型的上下文視窗為 100 萬 Token,最大輸出則為 384,000 Token。 1
部分報導形容,384 Token 的圖片上限不到部分 GPT 與 Claude 比較對象圖片 Token 用量的一半。不過,現有資料未能證明比較採用完全相同的模型版本、圖片解析度與計費條件,因此這只能視為方向性的效率比較,不能直接當成標準化基準測試。 327
比較明確的實際意義是:需要頻繁讀取截圖的視覺 Agent,可以在 Flash 輸入費率下,以較容易預估的成本觀察畫面,而不必每一次狀態更新都使用高價的多模態模型。
表現亮眼,但目前仍是供應商數據
DeepSeek 表示,新模型在加入視覺輸入後,仍保留 V4-Flash 的文字能力,包括推理、世界知識與 Agent 功能。 626
公司同時公布,多模態 Agent 基準測試的表現大幅提升,已接近 Claude Opus 4.8。部分公開比較確實顯示,模型在特定任務上接近 Opus 4.8;但不同基準之間仍可看到表現差異。 4192123
這裡需要分清楚兩件事:「接近 Opus 4.8」目前代表的是 DeepSeek 自行評估所得的主張,並不等於兩款模型在所有真實視覺 Agent 工作負載中已經具備相同能力。模型的可靠性、視覺辨識準確度,以及工具呼叫表現,仍需要第三方在不同情境下測試。
整合時的關鍵提醒:預留足夠輸出額度
開發者在把模型放進正式的視覺循環前,應先測試推理設定。有實測指出,thinking 模式可能消耗整個 completion 預算,最後沒有留下任何可見答案;相關報導建議在適合的視覺任務中關閉 thinking,或提高 max_tokens,讓模型有足夠空間回傳結果。 27
這是整合層面的注意事項,不代表模型整體能力不足。若啟用推理,應為內部推理與面向使用者的最終回答預留足夠輸出容量;同時也應在正式依賴特定參數前,確認 DeepSeek 最新 API 文件中的設定名稱與行為。
為什麼把視覺能力放在 Flash 上很重要
現有資料沒有顯示 DeepSeek 曾提出正式的產品策略說明,但這項設計指向一個清楚的使用情境:讓視覺感知便宜到足以支援反覆執行的 Agent 行動。
對螢幕操作 Agent 來說,截圖、遊戲畫面、儀表板與應用程式狀態只有在模型能夠經常檢查時才真正有用。如果每次觀察都產生高昂的多模態費用,Agent 循環便很難擴大部署。以實驗性 Flash 版本推出視覺能力,也讓開發者能在原有的低成本 Agent 與工具呼叫流程上加上圖片輸入,而不必整套遷移到另一個高價多模態服務。
對正在打造螢幕驅動 Agent、截圖轉程式碼工具,或需要持續視覺回饋的應用團隊而言,這是本次發布最值得注意的地方。
整體來看,DeepSeek V4-Flash-Vision-Exp 提供了相當低的圖片 Token 上限,以及 Base64、URL 和 Files API 等彈性輸入方式;至於其基準測試領先幅度與正式環境表現,仍有待驗證。較穩妥的做法,是先使用真實截圖進行受控測試,明確設定輸出額度,並以獨立的品質檢查確認結果。