DeepSeek Harness最應該理解成一套用嚟建立及運行Agent嘅基礎設施,而唔係一個獨立AI模型。呢個以dsh命令列工具推出、採用MIT授權嘅開發者預覽,核心概念可以濃縮成一句:Model + Harness = Agent。模型負責推理;Harness就提供實際執行嗰一層,將推理接駁到檔案、終端機、工具、工作階段同執行環境。
6
9
8月21日嘅實測評測,最重要嘅發現正正係呢個定位分野:DeepSeek今次押注嘅,唔係推出一款即開即用、包辦一切嘅編程助手,而係將Agent背後嗰套機械拆開,變成可以配置、延伸同替換嘅運行時環境。
「Model + Harness = Agent」即係咩?
語言模型可以分析問題、訂立計劃同生成指令,但佢唔會單靠自己就能夠檢查本機項目、修改檔案、執行指令、保留操作歷史,或者重複協調多次工具調用。Harness就係圍繞模型提供呢啲能力嘅執行層。
喺DeepSeek Harness入面,模型適配器、工具註冊表、工作階段記錄同Agent循環本身,全部都係可以替換嘅插件。呢套架構建基於Cordis;插件會向共享運行環境提供服務、具型別事件同可逆效果。
17
呢種分離帶來兩個重要結果:
- 模型唔等於完整Agent。 模型負責作決定,並產生推理或行動;但真正讀寫檔案、叫用工具同執行任務,係由Harness配合完成。
- Harness概念上唔綁死單一模型。 運行時可以按需要配置唔同模型適配器同能力組合,而唔係將模型同Agent應用綁成一個無法拆開嘅產品。
1
6
所以,將DeepSeek Harness叫做「新AI模型」,其實就捉錯重點。佢係一個將推理模型變成「可以採取行動嘅系統」嘅執行框架。
開發者預覽點樣開始?
實測採用嘅快速啟動方法係:
npx @deepseek-ai/dsh web
本機網頁介面會喺localhost:3080提供服務;另一份實測報告就以127.0.0.1:3080描述同一個本機網址。
6
4
評測亦提到,使用者需要輸入DeepSeek API key,介面就以**「Exploring the Uncharted」**作品牌。不過,呢啲係實測時見到嘅介面同設定流程,唔代表每次安裝都一定會顯示完全相同嘅畫面。
7
對一般用家嚟講,最實際嘅結論係:呢套預覽版係寫畀熟悉本機運行環境、願意自行設定,同埋有模型API存取權嘅開發者;佢唔係一款零設定、下載完就可以取代現有編程Agent嘅成熟產品。
四種工作模式,其實係四套插件組合
DeepSeek Harness唔係將四種模式當成四個互不相干嘅產品,而係為唔同工作情境預先準備嘅運行時組合:每種模式會載入一套唔同嘅預設插件。
18
23
Standard:最完整嘅Agent體驗
Standard係一般用途嘅預設模式。DeepSeek形容佢係一個功能完整嘅編程Agent,支援檔案編輯、Shell、檔案及網頁搜尋、Skills、計劃、目標、子Agent同工作流程。
20
如果你想做日常開發或者執行多步驟任務,Standard係最接近一般使用情境嘅選擇。不過,預覽版目前仍有唔少粗糙位,較適合用嚟試驗,而唔係直接當成成熟編程Agent嘅替代品。
PTC:用程式化方式調用工具
PTC即係Programmatic Tool Calling,針對模型需要協調多個工具調用嘅工作流程。模型唔需要逐次提出每一個工具操作,而係可以寫一段生成程式,按次序統籌一連串動作。
20
呢種做法主要面向能力較強嘅模型同進階使用者,特別適合多步驟、工具密集嘅任務。好處係流程可以更有組織;但同時,使用者亦更加需要檢查模型生成嘅程式究竟會執行啲乜。
Minimal:受控測試環境
Minimal會將運行環境削減到只剩Shell工具同檔案編輯器。DeepSeek將佢定位成一個刻意受限制嘅環境,用嚟測試或者研究模型,減少完整Harness提供嘅額外協助。
20
呢個模式適合做評估多過追求方便:佢可以幫助開發者分辨,某項表現究竟來自模型本身,定係來自完整Agent堆疊提供嘅能力。
Creation:用嚟創作新模式
Creation係畀想修改或延伸Harness嘅開發者使用。佢支援檢查目前運行環境、喺記憶體內試驗Cordis插件,以及組合自訂預設模式。
20
一個有文件記錄嘅Creation模式插件,亦加入Cordis自我檢查、動態插件實驗同預設模式撰寫指引。
22 Creation最能夠表現DeepSeek更大嘅野心:系統唔只係用嚟運行Agent,亦容許開發者重新塑造Agent所依賴嘅運行環境。
Cordis與「一切皆插件」架構
DeepSeek Harness最有特色嘅地方,係佢嘅架構理念。佢唔係將模型、工具、歷史記錄同控制循環全部鎖死喺一個龐大核心入面,而係透過Cordis插件系統公開呢啲組件。
官方架構文件明確列出以下可替換插件:
- 模型適配器;
- 工具註冊表;
- 工作階段記錄;以及
- Agent循環本身。
17
實測報告所描述嘅更闊願景,仲包括Skills、工作階段、沙盒、儲存、排程同使用者介面。不過,提供嘅官方架構節錄未有逐項獨立確認呢啲更廣泛例子,因此較穩妥嘅理解係:呢啲代表項目所展示嘅發展方向,而唔係每一項都已經得到同等程度嘅實作驗證。
1
17
呢個設計亦解釋咗點解四種模式可以有截然不同嘅體驗,卻唔需要變成四個獨立應用程式。每個Profile都可以喺啟動時按次序組合插件層,為一般編程、受控評估、程式化工具調用或者插件開發,砌出唔同嘅運行環境。
17
23
唔只睇結果:執行過程可以追蹤
如果Agent系統只展示最後答案,出錯時往往好難追查。DeepSeek Harness就比較重視執行路徑:工作階段同執行軌跡屬於運行時架構一部分,而工作階段記錄亦可以好似其他插件一樣被替換。
17
另一份實測報告形容,Trajectory檢視畫面會將執行過程寫成儲存在磁碟上、只可追加嘅JSONL事件流,並用呢份記錄快速找出設定問題。
4 不過,官方架構節錄只確認工作階段記錄係插件,未能單靠該節錄證實只可追加格式嘅每一項實作細節。
對開發者而言,呢種可追蹤性可能同模型原始能力一樣重要。當任務行到一半出現偏差,你至少可以回頭睇清楚:Agent叫用咗邊個工具、嘗試做過乜,以及究竟由邊一步開始失控。
早期測試反映:有能力,但未必快
目前嘅測試顯示系統確實可以完成具規模嘅工作,但未足以建立一個適用於所有情況嘅性能基準。8月21日其中一次以DeepSeek V4 Flash 0731進行嘅測試,Agent用咗46分鐘、109個步驟去建立一個插件,消耗約890萬個輸入Token。
1 另一項實測就喺大約35分鐘內、兩輪操作之間使用約2,000萬個Token,建立國際太空站追蹤器。
2
較保守嘅結論係:開發者預覽版可以處理長時間自主任務,但速度可能較慢,成本亦可能較高;實際表現會受模型、任務內容、快取同工作量影響。呢啲數字唔應該當成每次DeepSeek Harness執行都會遇到嘅固定上限。
同一批證據亦揭示產品現階段嘅取捨:DeepSeek先提供一套相當可配置嘅基礎設施,但使用體驗仍未完全打磨。項目被形容為有潛力成為受控工程試點嘅基礎,但目前未適合直接當成生產環境控制平面。
5
6
最終定位:平台野心大過產品外殼
目前最準確嘅講法,唔係「DeepSeek做咗最好用嘅編程Agent介面」,而係DeepSeek開源咗一套範圍廣泛嘅Agent運行時:模型、工具、執行循環同其他能力,都可以自由組合及替換。
因此,DeepSeek Harness特別適合以下幾類人:
- 想建立自訂Agent嘅開發者;
- 想喺唔同程度Harness協助下評估模型嘅研究者;
- 需要檢查執行歷史嘅團隊;以及
- 想試驗插件同運行時組合嘅開源貢獻者。
至於只係想搵一款介面成熟、延遲穩定、設定步驟少嘅編程Agent,現階段未必會覺得佢特別吸引。v0.1產品外殼仍然早期,而長任務測試亦顯示,有能力完成工作,唔代表速度或者生產就緒程度已經足夠。
5
6
簡單講,「Model + Harness = Agent」既係產品解釋,亦係策略宣言。DeepSeek正嘗試將「智慧」同「令智慧可以採取行動嘅機械」分開,並押注一套可延伸嘅插件運行時,長遠價值可能高過一個固定不變嘅Agent應用程式。