這些分數仍無法回答許多與正式上線有關的問題,例如:
目前可取得的資料中,獨立評測證據仍不足。因此,更穩妥的結論是:DeepSeek 展示了在部分多模態測試中縮小差距的潛力,但還不能把這次發布視為已證明的全面競爭力或旗艦級超越。
對文字密集型應用而言,DeepSeek 最強調的是延續性,而非明確稱霸。官方定位是讓 Vision-Exp 保留 V4-Flash 原有的文字、推理與 Agent 能力,開發者不必為了加入圖片輸入,就完全改用另一套模型。
這對選型有幾個實際意義:
圖片有三種提供方式:
file_id。支援的圖片格式包括 JPEG、PNG、GIF 與 WebP。 在 Responses API 中,圖片則以
input_image 內容區塊傳入,可以搭配圖片網址、Base64 data URL 或已上傳檔案的參照。
目前與發布相關的 V4-Flash 價格如下:
384 token 的上限,讓單張圖片的成本相對容易估算。不過,這個上限只適用於圖片部分;同一輪互動中的文字、工具呼叫與模型輸出仍會另外計費。若是多輪 Agent 工作流程,總 token 使用量仍可能遠高於圖片本身。
DeepSeek 隨模型推出支援 Vision-Exp 的 Harness 0.1.1,開箱即可使用。 對正在打造工具型 Agent 的開發者來說,這比單次圖片問答更重要,因為 Vision-Exp 本身就是為需要觀察內容、作出判斷並呼叫工具的流程而設計。
同時推出的免費 Files API,則允許開發者先上傳圖片,再於後續請求中透過 file_id 重複引用,而不必每次重新傳送相同的圖片資料。DeepSeek 文件中的檔案參照格式為 file-api-...。
如果 Agent 需要在多輪對話中反覆檢查同一張螢幕截圖、文件頁面或視覺素材,這種做法可以減少重複上傳。Files API 本身免費,但模型推論與 token 使用量仍然會產生費用。
Vision-Exp 顯示,模型競爭的焦點正從單一的基準分數,擴展到完整的開發者體驗:多模態能力、API 相容性、價格、可重複使用的檔案,以及 Agent 工具鏈。DeepSeek 以 V4-Flash 的公開 token 價格提供 Flash 系列的視覺擴充版,並在自家報告中以 Anthropic 的 Opus 4.8 作為高階比較對象。
這也是一個偏務實的發布:它不是明確宣告旗艦模型領先,而是以「Flash」和「Exp」的定位,先把視覺推理帶進較容易接入、成本相對可控的 API 工作流程。其真正影響力,將取決於開發者是否認為它足夠可靠,能用於螢幕截圖程式設計、文件分析、介面 Agent 與視覺工具操作。
因此,目前最合理的結論仍然保守:DeepSeek 已透過既有 API 生態,降低開發者使用視覺推理的門檻;早期基準測試也顯示它在部分多模態評測中具備挑戰 Opus 4.8 的潛力。但在把它用於關鍵正式環境前,仍應等待更多獨立測試,並以真實工作流程驗證穩定性、延遲與失敗率。最終,Vision-Exp 能否成為長期替代方案,仍要看開發者採用情況,以及市場是否持續轉向更平價的視覺推理模型。