對開發者而言,實際意義係更加容易接入以 Agent 為核心嘅應用,而唔係只用作一般文字生成。Responses API 同 Codex 整合,較適合需要將模型輸出同工具、程式碼執行、反覆操作連埋一齊嘅系統。
DeepSeek 公布嘅結果顯示,V4 Pro 正式版喺多項 Agent 及編程測試中,較預覽版有明顯進步。
其他公布結果包括:
發布報道指,V4 Pro 喺 CyberGym 同 AutomationBench 超過 Fable 5,而 Terminal-Bench 就以些微差距落後。 不過,呢啲比較主要建基於 DeepSeek 自行公布嘅評測表及發布相關報道,並唔係由單一獨立機構統一主持嘅測試,因此唔應該直接當成全面、獨立驗證嘅結論。
整體睇,DeepSeek 今次將火力集中喺軟件工程 Agent、終端機任務、網絡安全相關工作,以及需要模型連續採取多個行動嘅流程,而唔係只係回答一條問題。
但要留意,現有資料喺貨幣及文件版本方面並唔完全一致。另一份引用 DeepSeek API 文件嘅報道列出:每百萬輸入 tokens 收費 3 元人民幣、輸出 6 元人民幣,而快取命中輸入就係每百萬 0.025 元人民幣。
所以,如果要為正式生產環境預算,唔好只依賴二手報道或第三方價格表,應該直接核對 DeepSeek 當時 API 文件上顯示嘅費率、貨幣同繁忙時段定義。
今次更新最適合關注編程 Agent 同工具型 AI 系統嘅團隊。現有用戶可以繼續保留 deepseek-v4-pro,而 Responses API 及 Codex 相容性,亦可能減少接入現有 Agent 工具鏈所需嘅改動。
基準測試結果顯示,V4 Pro 喺自主軟件工作流程相關任務上,較預覽版更具競爭力。不過,單一測試接近甚至超越對手,並唔代表模型喺所有編程、推理或實際生產工作負載都會有相同表現。現階段相關數字主要應視為 DeepSeek 公布嘅評測結果,仍有待獨立重現。
簡單講,DeepSeek V4 Pro 今次唔只係一次模型更新,亦係一次 API 同 Agent 平台升級:模型名稱照舊、整合介面擴闊,而官方公布嘅 Agent 基準分數,就由預覽版大幅推高。