DeepSeek 於 2026 年 8 月 13 日推出官方 V4 Pro,並同步開放 MIT 授權嘅 Harness v0.1 開發者預覽版;後者係建構 Agent 運行環境嘅基礎設施,唔係一個已經成熟嘅終端產品。 Composio 將同一個 DeepSeek V4 Flash 放入 8 個 Harness,進行 240 次測試,合共 129 次成功,成功率為 53.8%;30 個工作流程入面,只有 6 個係所有 Harness 都完成到。[3] Harness 建基於 Cordis,採用「所有嘢都係 Plugin」嘅模組化設計,模型、工具、Session、儲存、Sandbox、Agent Loop、排程同介面都可以替換或擴...
研究答案

Create a landscape editorial hero image for this Studio Global article: What were DeepSeek’s August 13, 2026 announcements of the official DeepSeek V4 Pro and the MIT-licensed developer preview of DeepSeek Harnes. Article summary: On August 13, DeepSeek paired the official release of DeepSeek V4 Pro—its agent-work-oriented flagship—with Harness v0.1, an MIT-licensed, source-available developer preview for people building agent runtimes rather than. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek 喺 2026 年 8 月 13 日做咗一個幾有策略意味嘅發布:一邊推出主打 Agent 工作負載嘅官方 DeepSeek V4 Pro,另一邊就開放 DeepSeek Harness v0.1 開發者預覽版。Harness 以 dsh 形式提供,採用 MIT 授權,對象主要係想自己打造、修改 Agent 運行環境嘅開發者,而唔係一般用家即刻用嚟取代 Claude Code 或 Codex 嘅成熟產品。32
20
表面上係一次模型更新加一個開源項目,實際上反映出 AI Agent 競爭嘅焦點可能已經由「邊個模型最勁」,轉向「模型加咩運行系統先至做得成件事」。一個 Agent 唔係淨係靠模型回答問題,仲要依賴上下文管理、工具權限、記憶、執行政策、錯誤復原同評估機制。Composio 嘅測試就顯示,包住同一個模型嗰層系統,可以實質改變成功率同成本。3
DeepSeek 同日推出 V4 Pro 同 Harness v0.1。前者係模型層嘅旗艦版本;後者就係模型之上、工作環境之下嘅 Agent Runtime——即係負責將模型回應變成一個可以持續執行多步任務嘅系統。32
20
Harness 目前係開發者預覽版,並非一個包辦所有事情、已經打磨完成嘅 Coding Agent。MIT 授權就令開發者可以閱讀、修改同延伸程式碼;官方文件亦描述咗一個唔綁死單一模型供應商嘅架構,開發者可以接駁唔同模型提供者。22
28
Composio 將同一個 DeepSeek V4 Flash,放入 8 個 Agent Harness,針對 30 個多步驟任務進行測試。240 次執行之中,有 129 次成功,整體成功率為 53.8%;而 30 個工作流程入面,只有 6 個係 8 個 Harness 全部都成功完成。3
各個 Harness 嘅結果差距相當明顯:
成本方面亦唔係一樣。Composio 估算,每個成功任務嘅成本約為:Claude Code 0.195 美元、Codex 0.081 美元、DeepAgents 0.045 美元;Pi Agent 就報告約 0.028 美元。不過,呢啲數字要連同測試方法,以及每個 Runtime 本身唔同嘅操作方式一齊理解,唔應該直接當成所有產品嘅永久排名。3
重點唔係話某一個 Harness 永遠最好,而係:模型排行榜未必足以預測 Agent 喺真實多步驟工作入面嘅表現。對 Agent 而言,越來越有用嘅比較單位,可能係 「模型 + Harness 配置」,而唔係模型本身。
Harness 建基於 Cordis。根據 DeepSeek 嘅架構文件,模型 Adapter、工具 Registry、Session Log 同 Agent Loop 都係可以替換嘅組件。17
其他 Plugin 邊界包括:
簡單講,DeepSeek 唔想將 Agent 寫成一件由模型、工具同控制流程焊死埋一齊嘅產品。開發者可以獨立改動 Agent 點樣組合上下文、呼叫工具、保存狀態、重試失敗操作,或者向用家展示執行結果,而唔需要由頭改寫成個 Runtime。17
20
「所有嘢都係 Plugin」唔只係一個方便包裝嘅口號。佢其實將 Harness 放到模型同工作環境之間最關鍵嘅位置,亦即係最適合做實驗、換組件同比較策略嗰一層。
DeepSeek 表示,Harness 會用追加式 Session Log 記錄模型見到同做過嘅內容,包括 System Prompt、推理、工具呼叫及結果、Subagent 排程,以及每次上下文注入。Trajectory View 就可以按來源檢查事件流;恢復、分支、搜尋同回放,都係基於同一份紀錄。22
對開發者嚟講,呢種設計有幾個實際用途:
理論上,呢套機制可以形成一個循環:先執行任務,再檢查 Trajectory,搵出失敗原因,修改 Plugin,重新測試,最後保留新舊結果作比較。
但要留意,可以記錄同回放 Trajectory,唔代表系統已經係自我學習系統。現有證據支持 Harness 作為一個可審計、可反覆試驗嘅開發底座;未足以證明佢可以可靠咁自主持續改進。22
Harness 生態入面已經有第三方項目,聲稱提供跨 Session 長期記憶、背景自我演化、技能管理同自我檢討等功能。18
19
呢啲項目顯示,Plugin 架構可以容納持久記憶、項目歷史、自我審視同技能管理。不過,佢哋唔能夠證明 Harness v0.1 核心本身已經安全、穩定,或者普遍做到持續自我改進。
呢個分別好重要:可選 Plugin、實驗性整合,同核心產品能力,唔可以混為一談。真係要放入生產環境,團隊仍然要評估資料保留、權限管理、Sandbox 隔離、憑證處理、回滾機制,以及自動系統自行改動工具或程序所帶來嘅風險。
DeepSeek 可以喺模型層用 V4 Pro 同 V4 Flash 競爭,但 Harness 就畀佢一個機會,進入開發者決定「模型應該點樣被使用」嗰一層。
呢一層可以控制:
開放 Runtime,會鼓勵外部開發者圍繞 DeepSeek 架構建立 Adapter、工具、記憶系統同工作流程。即使 Harness 支援多個模型供應商,DeepSeek 仍然可以透過自己定義嘅架構,影響開發者接入同組裝 Agent 嘅方式。
從策略角度睇,呢個位置可能比單純鬥模型權重或者 API 價格更加耐用。模型可以換,供應商可以換,但一旦團隊嘅工具鏈、權限設計、評估資料同工作流程都建喺某個 Harness 上,轉走嘅成本就會提高。
如果 Runtime 有模組化 Plugin 同可追蹤 Trajectory,Agent 理論上可以協助:
呢個方向可以理解為 AI 輔助 AI 工程:由 AI 幫手縮短「發現問題—修改—測試—比較」嘅循環。現階段較穩妥嘅講法,係 Harness 為呢種工程反饋循環提供基礎設施,而唔係已經完成一個可以放心交俾佢自行進化嘅 Agent。20
22
Harness 係 Developer Preview,呢點係理解今次發布嘅關鍵。佢代表 DeepSeek 邀請開發者試用、修改同一齊發展項目,但亦同時表示 API、整合方式、安全控制同實際運作表現仍然可能變動。20
所以,現階段應該將 Harness 當成開放框架同研究平台去評估,而唔好假設佢已經具備成熟 Coding Agent 產品嗰種可靠性、完成度同安全防護。
DeepSeek 8 月 13 日嘅發布,將模型戰略同基礎設施戰略扣埋一齊:V4 Pro 負責提供旗艦模型,Harness 就公開決定模型點樣處理工具、上下文、記憶同長時間任務嘅運行層。32
20
Composio 嘅結果正好解釋點解呢個分別重要:同一個 V4 Flash,喺測試入面配唔同 Harness,可以完成 14 至 20 個任務,成功任務成本亦有明顯差距。3
Harness 嘅 Plugin 架構同可追蹤 Trajectory,令 DeepSeek 擁有一個具可信度嘅實驗、評估同 AI 輔助工程底座。佢暫時未足以證明可靠嘅持續學習已經解決,但就有機會令 Harness 呢一層,成為下一階段 Agent 發展真正嘅主戰場。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
DeepSeek 於 2026 年 8 月 13 日推出官方 V4 Pro,並同步開放 MIT 授權嘅 Harness v0.1 開發者預覽版;後者係建構 Agent 運行環境嘅基礎設施,唔係一個已經成熟嘅終端產品。
DeepSeek 於 2026 年 8 月 13 日推出官方 V4 Pro,並同步開放 MIT 授權嘅 Harness v0.1 開發者預覽版;後者係建構 Agent 運行環境嘅基礎設施,唔係一個已經成熟嘅終端產品。 Composio 將同一個 DeepSeek V4 Flash 放入 8 個 Harness,進行 240 次測試,合共 129 次成功,成功率為 53.8%;30 個工作流程入面,只有 6 個係所有 Harness 都完成到。[3]
Harness 建基於 Cordis,採用「所有嘢都係 Plugin」嘅模組化設計,模型、工具、Session、儲存、Sandbox、Agent Loop、排程同介面都可以替換或擴充。[17][20]