對做 Agent 的團隊嚟講,呢個改動幾實用:Agent 可以先讀取瀏覽器截圖、圖表、掃描文件或其他視覺資料,再決定下一步要呼叫邊個工具。DeepSeek 亦提供 Codex 接入方式,並將 Vision Exp 列為支援圖片輸入的選項。
DeepSeek 表示,DeepSeek Harness 0.1.1 已經加入對呢款模型的支援,令佢可以更直接接入 Agent 工作流程。 至於 GitHub Copilot,DeepSeek 的官方文件目前只列出 V4 Pro 及 V4 Flash 作為 Copilot Chat 的模型選項;文件所講的圖片處理,係由另一個已安裝的 Copilot 模型代為描述,因此未能證明 Vision Exp 已直接出現在該模型選單之中。
DeepSeek 最核心的宣傳係:Vision Exp 保持 V4-Flash 的文字表現,同時喺需要視覺理解的多模態 Agent 基準測試中大幅進步,表現「接近 Claude Opus 4.8」。
部分報道引述過幾個單項分數,包括 Chartography 64.3、ApexBench Pass@1 36.5、Agents’ Last Exam 27.3,以及 ZeroBench Pass@5 35.0。不過,呢啲數字主要來自二手報道轉述 DeepSeek 的發布資料,未有附上足夠詳細、可由外部重現的跨供應商評測方法。
所以,「接近 Opus 4.8」唔等於:
現有資料亦未提供一套中立測試,確保 DeepSeek 同 Anthropic 使用完全相同的提示、工具環境、延遲條件、失敗率及成本計算。比較時一定要留返幾分,唔好將官方宣傳句式當成定論。
目前最穩妥的結論係:DeepSeek 確實推出咗一款有文件支持、能夠處理圖片的 API 模型;而官方數據就顯示,佢喺需要視覺輸入的任務上,較純文字版 V4-Flash 有明顯進步。至於佢同 Claude、OpenAI、Google 或其他中國 AI 實驗室的實際位置,仍然未經獨立測試確認。
現有模型列表顯示,Vision Exp 的輸入價格為每 100 萬 tokens 0.22 美元,輸出價格為每 100 萬 tokens 0.66 美元,內容長度為 100 萬 tokens。 DeepSeek 官方價格文件確認 API 以每 100 萬 tokens 計價,並將
deepseek-v4-flash-vision-exp 列入模型表。
圖片亦會轉換成 tokens,再計入 API 費用。有報道引述 DeepSeek 公布的指引指,一張圖片最多可佔 384 tokens,而 Vision Exp 沿用 V4-Flash 的計價結構。 因此,實際視覺工作流程要幾錢,唔可以只睇文字 token 價格,仲要睇:
Anthropic 列出的 Claude Opus 4.8 標準價格,係每 100 萬個基本輸入 tokens 5 美元、輸出 tokens 25 美元,另外仲有快模式及快取相關收費。
單睇牌面 token 價格,DeepSeek 明顯平好多,係值得開發者試用的理由。但平價唔等於整個項目一定慳錢。如果模型較常出錯、需要重試、工具呼叫失準,或者要額外做圖片預處理,完整工作流程的總成本未必如表面咁低。
兩款模型雖然都有多模態 Agent 使用場景,但定位其實唔同:
DeepSeek 的策略訊息相當清楚:以 Flash 級別的成本加入視覺能力,再聲稱喺多模態 Agent 任務上接近高價前沿模型。Claude 喺呢個比較中的優勢,唔係現有資料已經證明佢喺每個基準都勝出,而係佢的產品成熟度、工具配套及市場定位已經較為確立。
實際選擇應該逐個任務比較。例如,純粹讀取截圖文字或抽取圖表資料,Vision Exp 可能已經提供足夠質素,同時大幅降低 token 成本。但如果係高風險的自主 Agent 工作流程,就要更加關心一致性、工具使用準確度、拒答行為、監察能力、支援,以及出錯後的復原能力。
視覺能力已經唔再只係「問圖片問題」咁簡單,而係逐漸成為 Agent 工作的一部分。寫程式的 Agent 可能要讀取錯誤截圖;瀏覽器 Agent 可能要理解網頁畫面;企業系統亦可能要將文件、圖表及工具呼叫放喺同一個流程之中。
DeepSeek V4 家族本身已經主打長上下文及 Agent 工作負載,而 V4 文件就將 Flash 描述為系列中更快、更經濟的選項。 Vision Exp 延續呢條路線,將圖片理解直接加到多模態 Agent,而唔係另起一款只做圖像問答的模型。
不過,現有證據仍不足以宣告 DeepSeek 已經領先 Anthropic、OpenAI、Google,或者其他中國 AI 實驗室。原因好簡單:目前冇一套獨立、同條件、可公平比較的跨供應商測試,而實驗性 API 版本亦唔等於已經驗證成熟的生產旗艦。
值得,但最好用受控測試方式進行。
可以將 Vision Exp、Claude Opus 4.8 及現時生產模型,放喺完全相同的「圖片+工具」任務中比較,並記錄以下項目:
總結嚟講,DeepSeek V4 Flash Vision Exp 係一個可信、價錢吸引,而且開發者介面相對完整的新多模態 API 實驗。佢聲稱多模態 Agent 表現接近 Claude Opus 4.8,確實值得親自測試;但喺有更多獨立結果之前,仍然應該當係一個有潛力的初步訊號,而唔係已經坐實的業界結論。