DeepSeek Harness 最適合被理解為受控遞迴自我改進的基礎設施,而不是 DeepSeek 已實現自主 RSI 或 AGI 的證明。 Cordis 將時間可組合性與空間可組合性分開處理:前者撤銷元件管理的執行時效果,後者則協調元件在出現、消失或替換時的依賴關係。
研究答案

Create a landscape editorial hero image for this Studio Global article: How does DeepSeek Harness (DSH)—through its Cordis framework for temporally and spatially composable, reversible, failure-tolerant self-modi. Article summary: DSH is best understood as RSI-enabling infrastructure, not evidence that DeepSeek has achieved autonomous recursive self-improvement or AGI. Its core idea is to make an agent’s own runtime—tools, model adapters, memory/s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
DeepSeek Harness(DSH)並沒有證明 DeepSeek 已建立自主遞迴自我改進系統,也沒有證明其已達到通用人工智慧(AGI)。更穩妥的解讀是:DSH 提供了一種新的代理執行環境,讓工具、模型介面、工作階段管理機制,甚至代理本身的運作迴圈,都能被視為可替換元件。這使反覆試驗變得更安全、更實際——而這正是受控自我改進所需要的基礎。 2526
「遞迴自我改進」(Recursive Self-Improvement,RSI)可以指向不同層次。系統可能改良某項成果,例如演算法;也可能協助研究人員打造更強的後繼模型;又或者修改決定代理如何運作的可重用框架。相關研究將這種以固定、外部評估器檢驗的受控自我精煉,與更開放式的 RSI 區分開來。後者甚至會改動用來產生改進的機制或評準本身。 1
DSH 最明確瞄準的是「框架」這一層。它不要求代理重寫神經網路權重,而是讓系統可以試驗模型周邊的元件,包括提示詞、工具、記憶、政策、協調機制與執行迴圈。更好的元件可以被安裝、測試並保留;表現不佳的版本則可以移除。
這是朝工程導向 RSI 邁出的重要一步,但它並不等同於代理能夠獨立設計更強的後繼者、自行決定目標,或啟動不受控制的智能爆炸。
DSH 建立在 Cordis 之上。Cordis 是一套外掛式執行環境,其文件以「時空可組合性」(spatiotemporal composability)描述這種設計。當軟體在運作期間持續載入或移除元件時,系統會同時面對兩類問題:元件在時間上的加入與撤除,以及它們在當前系統中彼此如何互動。 1718
外掛可能透過註冊資源、事件監聽器、服務或其他狀態,改變共享的執行環境。在一般外掛系統中,移除元件往往依賴開發者手動撰寫清理程式,因此容易留下資源洩漏或「幽靈狀態」。
Cordis 則將執行時變更與可逆效果配對。當元件被移除時,執行環境能依適當順序執行相應的逆操作。這不是讓外掛「倒帶執行」,也不是撤銷代理已經對外做出的每一個動作,而是嘗試把相關的執行時結構恢復到有效的先前配置。 2024
這個區別非常重要。外掛註冊的回滾機制,無法自動撤回已寄出的電郵、已刪除的檔案、以受污染資料訓練的模型,或現實世界中的不可逆行動。因此,Cordis 的可逆性是一項有邊界的軟體屬性,並非普遍適用的安全保證。
元件之間同樣存在依賴關係。例如,工具可能需要註冊表;記憶模組可能需要工作階段管理器;代理迴圈則可能需要模型介面與工具介面。
空間可組合性讓元件可以宣告這些關係,令執行環境在提供者或依賴項發生變化時,協調啟用、停用、替換和復原。如此一來,模組化代理便能重新配置,而不必把整個系統視為一個脆弱的單一區塊。 1820
可逆效果加上依賴感知的組合機制,能支援更安全的試驗、元件替換、故障復原與交易式執行時更新。對自我改進而言,這些能力尤其重要,因為它們降低了嘗試候選變更、並在失敗時將其淘汰的成本。
這套設計透露出一條偏向系統工程的路線:讓執行環境足夠靈活,使代理不只完成工作,也能改進自己用來完成工作的機制。
這種思路把焦點從模型本身移開。即使模型權重固定,只要搭配更好的工具、記憶、規劃、評估與復原機制,實際能力仍可能提升。如果代理能提出這些機制的變更,依照外部標準測試結果,並只保留成功版本,改進就能在相對受控的迴圈中持續發生。
然而,架構本身並不能證明 DSH 已經自主執行遞迴自我改進。目前可取得的證據描述的是一套執行環境與開源代理框架,而不是一個已被展示的端到端迴圈:由 DSH 自行產生、評估、挑選並部署愈來愈強的自身版本。 2526
RSI 討論中的各項系統,往往針對改進流程的不同層次。若把它們當成直接競品,反而會掩蓋重要的技術差異。
AlphaEvolve 更接近一個直接的最佳化迴圈:由 Gemini 驅動的代理提出程式碼變更,自動評估器為結果打分,再透過演化流程推進有潛力的候選方案。Google 表示,該系統已用於演算法發現與最佳化,包括數學問題及計算基礎設施。 2314
它的關鍵優勢在於回饋:候選方案可以根據機器可檢驗的目標進行測試。相較之下,DSH 主要是讓元件能安全組合與替換的執行時架構;AlphaEvolve 著重於演化解法,Cordis 則著重於讓運作中的系統可安全重新配置。
目前提供的公開資料將 RSI Index 描述為多項 AI 研究評估的綜合指標。按此理解,它是追蹤能力的測量工具,不是會自行修改模型或執行改進迴圈的引擎。分數可以反映系統在特定自我改進相關任務上的表現,但不能單憑分數證明系統在部署後正自主改進自身。 3435
因此,RSI Index 應與 DSH 的測量層比較,而不是被視為 DSH 的架構競爭者。就目前提供的公開證據而言,尚不足以獨立評估 RSI Index 的建構方式,或判斷分數變化究竟代表什麼。
Anthropic 的自動化對齊研究員,瞄準的是另一個瓶頸:如何利用較弱的監督訊號,訓練或引導更強的模型。其代理能提出想法、執行實驗,並在弱到強監督研究上反覆迭代。 4958
這項工作更接近 AI 研究與對齊評估的自動化,而不是 DSH 在執行時層級進行元件替換。兩種方向日後可以互相補足:研究代理負責發現更好的元件,可逆的代理框架則負責在受控條件下測試、部署並回滾這些元件。
Anthropic 更廣泛的公開討論也提出重要限定:該公司表示,目前尚未達到完全自主的遞迴自我改進,RSI 也不是必然會發生。 59
現有來源沒有提供足夠可靠、且能獨立驗證的 Tencent Hyra-1.0 或 MiniMax M2.7 技術文件。因此,若直接替這兩個系統指定某種 RSI 架構,或把它們與 DSH、AlphaEvolve 及 Anthropic 已公開的工作放在同一證據層級,會造成誤導。
AI 產業的關鍵資產,愈來愈不是單一基礎模型,而是圍繞模型建立的完整系統。以下四項能力尤其重要:
這也解釋了為何一個基準測試表現稍弱的模型,仍可能在更好的環境中具備競爭力:它擁有更強的工具、更有效的回饋與更完整的復原機制。未來真正被競爭的,可能不只是模型檢查點,而是整個改進迴圈。
可恢復性可以降低風險,卻不能消除風險。回滾按鈕無法保證代理行動造成的每個後果都已被觀察,或都能被逆轉。變更可能影響資料、憑證、外部服務、安全邊界,甚至執行環境之外的人類決策。
更快的迭代也可能放大錯誤目標、規格鑽漏洞、隱藏迴歸問題與不透明依賴。人類控制不會因為系統多了一個回滾功能就自然獲得保障;相關變更仍必須在整個系統中保持可觀察、可獨立評估、具備權限控管、可追溯,並且真正能夠回復,而不只是停留在外掛圖內。
因此,最有力也最審慎的結論是:DSH 與 Cordis 展示了如何設計支援受控、可恢復自我修改的代理基礎設施;AlphaEvolve 展示評估器驅動演化的力量;Anthropic 的研究則顯示 AI 正逐步參與 AI 研究。這些努力共同指向 AI 輔助改進迴圈的進展,但仍不足以證明完全自主、開放式的 RSI 或 AGI 已經實現。 14959
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
DeepSeek Harness 最適合被理解為受控遞迴自我改進的基礎設施,而不是 DeepSeek 已實現自主 RSI 或 AGI 的證明。
DeepSeek Harness 最適合被理解為受控遞迴自我改進的基礎設施,而不是 DeepSeek 已實現自主 RSI 或 AGI 的證明。 Cordis 將時間可組合性與空間可組合性分開處理:前者撤銷元件管理的執行時效果,後者則協調元件在出現、消失或替換時的依賴關係。
相較於 DSH 的執行環境設計,AlphaEvolve 著重以評估器驅動演化來最佳化程式碼;Anthropic 著重自動化 AI 研究與弱到強監督;OpenAI 的 RSI Index 則屬於能力測量框架。