DeepSeek Harness(DSH)較合理的定位,是支援「有界遞迴自我改良」的基礎設施,而不是 DeepSeek 已實現自主 RSI 或 AGI 的證據。 Cordis 分開處理兩件事:時間可組合性負責撤銷元件在執行時留下的受管理變更;空間可組合性則負責協調元件之間的依賴關係。
研究答案

Create a landscape editorial hero image for this Studio Global article: How does DeepSeek Harness (DSH)—through its Cordis framework for temporally and spatially composable, reversible, failure-tolerant self-modi. Article summary: DSH is best understood as RSI-enabling infrastructure, not evidence that DeepSeek has achieved autonomous recursive self-improvement or AGI. Its core idea is to make an agent’s own runtime—tools, model adapters, memory/s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
DeepSeek Harness(DSH)並沒有證明 DeepSeek 已經建立自主遞迴自我改良(Recursive Self-Improvement,RSI)系統,更不代表 AGI 已經出現。較穩妥的理解是:DSH 提供了一個 AI 代理執行環境,讓工具、模型介面、工作階段管理,甚至代理本身的運作循環,都可以視為可替換元件。這令反覆試驗變得更安全、成本更低,亦正是有界自我改良需要的基礎。 2526
「遞迴自我改良」其實可以指幾種不同事情。系統可以改良某件具體產物,例如演算法;可以協助研究人員建立更強的後繼模型;亦可以修改決定代理如何運作的共用支架,包括提示詞、工具、記憶、政策及協調流程。
相關研究將這種以固定、外部評估器驗證的受限制自我改良,與開放式 RSI 分開。前者仍然有清晰的評分標準,較容易測試及收斂;後者則可能連改良所用的機制,甚至評價標準本身都一併修改,因而欠缺固定的外部錨點。 1
DSH 最明顯針對的是「支架」這一層。它不要求代理直接重寫神經網絡權重,而是容許系統在模型周邊試驗不同元件:提示詞、工具、記憶、政策、協調方式及執行循環。新元件可以安裝、測試及保留;如果表現欠佳,也可以移除。
這對工程角度的 RSI 來說是重要一步,但仍然不等於代理能夠獨立設計更強的後繼者、自行決定目標,或者引發不受控制的智能爆發。
DSH 建基於 Cordis。Cordis 的文件以「時空可組合性」描述這套插件執行時,主要處理軟件在運行期間動態改變時的兩個問題:元件隨時間載入、移除或替換會發生甚麼,以及目前系統內不同元件如何互相配合。 1718
插件加入共享執行環境後,可能會註冊資源、事件監聽器、服務或其他狀態。一般插件系統往往依賴開發者手寫清理程式;一旦清理不完整,便可能留下資源洩漏或「幽靈狀態」。
Cordis 的做法,是將執行時變更同可逆效應配對。當元件被移除,執行時可以按適當次序執行相應的逆操作,目標是把相關的執行時結構恢復至有效的較早配置。這不是將插件「倒帶播放」,亦不是自動逆轉代理曾經作出的所有外部行動。 2024
這個分別非常關鍵。插件註冊的回復機制,不能自動撤回已經發出的電郵、已刪除的檔案、以受污染資料訓練的模型,亦不能逆轉現實世界的不可逆行動。換句話說,Cordis 的可逆性是有界的軟件屬性,不是全面的安全保證。
系統內的元件同樣會互相依賴。例如,工具可能需要工具註冊表;記憶模組可能需要工作階段管理器;代理循環可能需要模型介面及工具接口。
空間可組合性容許元件聲明這些關係,讓執行時在提供者或依賴出現、消失或改變時,協調元件的啟用、停用、替換及復原。這令模組化代理可以重新配置,而不用將整個系統當成一個脆弱的大黑盒。 1820
將可逆效應及依賴感知的組合方式放在一起,便能支援較安全的試驗、元件替換、故障復原及交易式執行時更新。對自我改良而言,重點在於:試一個候選改動,以及在效果不好時把它剔除,成本都會降低。
這套設計反映一條偏系統工程的路線:令代理的執行環境足夠靈活,讓代理不只完成工作,還可以改良自己用來完成工作的機制。
這種思路將焦點由單一模型移向整個系統。一個固定的模型,只要配合更好的工具、記憶、規劃、評估及復原機制,實際能力也可以提升。如果代理能提出這些機制的改動,按外部標準測試,再只保留成功版本,改良便可以在受控循環內進行。
不過,架構本身並不足以證明 DSH 已經自主進行遞迴自我改良。目前可見證據主要描述一個開源 Harness 及其執行時,而不是一個已展示的端到端循環:由 DSH 自己生成、評估、選擇並部署愈來愈強的自身版本。 2526
RSI 討論中出現的系統,其實針對改良流程的不同層次。若將它們當成直接競爭、互相取代的方案,反而會掩蓋技術上的分別。
AlphaEvolve 更接近一個直接的優化循環。由 Gemini 系列模型的代理提出程式碼改動,再由自動評估器評分,最後以演化方式保留較有潛力的候選方案。Google 表示,AlphaEvolve 用於演算法發現及優化,涵蓋數學問題及計算基礎設施等工作。 2314
它最重要的優勢是回饋:候選方案可以按機器可檢查的目標進行測試。相較之下,DSH 主要是讓元件能夠安全組合及替換的執行時架構。簡單講,AlphaEvolve 著重「演化出更好的解決方案」,Cordis 則著重「令正在運行的系統可以安全重新配置」。
目前提供的公開資料將 RSI Index 描述為一組 AI 研究評估的綜合指標。按這個定位,它是追蹤能力的量度工具,而不是會自行修改模型或運行改良循環的引擎。
分數可以反映模型在部分與自我改良相關的任務上的表現,但單靠分數,不能證明系統在部署期間已經自主改良自己。現有公開證據亦不足以獨立判斷該指標的構成,或分數變化代表甚麼。 3435
因此,RSI Index 應該視為 DSH 的「量度層」,而不是架構上的對手。
Anthropic 的自動化對齊研究,針對的是另一個瓶頸:如何利用較弱的監督,訓練或引導更強的模型。相關代理會提出研究想法、進行實驗,並就弱至強監督這個問題反覆迭代。 4958
這項工作較接近自動化 AI 研究及對齊評估的一部分,而 DSH 則集中於執行時的元件替換。兩者將來可以互相配合:研究代理負責發現更好的元件,可逆 Harness 則負責在受控環境內測試及部署,並在需要時回復。
Anthropic 的公開討論也提出重要限定:公司表示目前仍未達到完全自主的遞迴自我改良,而且 RSI 並非必然發生。 59
現有資料沒有提供足夠可靠、可獨立驗證的 Tencent Hyra-1.0 或 MiniMax M2.7 技術文件。因此,若直接為兩個系統指定某種 RSI 架構,或者將它們與 DSH、AlphaEvolve 及 Anthropic 已發表的工作放在同一證據水平上,會有誤導之嫌。
AI 競爭的核心資產,正逐漸由單一基礎模型轉向模型周邊的整套系統。以下四項因素尤其重要:
所以,一個基準測試成績稍低的模型,如果放在工具更好、回饋更強、復原能力更高的環境中,實際上仍然可能具備競爭力。未來真正的產品,可能不只是模型 checkpoint,而是整個「提出改動—測試—保留—回復」的改良循環。
可復原性可以降低風險,卻不能將風險消除。回復按鈕無法保證代理行動的每一項後果都可被觀察或逆轉。改動可能影響資料、憑證、外部服務、安全邊界,或者執行時以外的人類決策。
更快的迭代速度,也可能同時放大錯誤目標、鑽規格漏洞、隱藏回歸問題及不透明的依賴關係。要維持人類控制,不能只靠技術上的 rollback;改動在整個系統內都必須保持可觀察、可獨立評估、受權限限制、有清晰責任歸屬,並且真正可以回復,而不只是插件圖內的狀態可以還原。
最穩妥的結論是:DSH 及 Cordis 展示了如何設計支援有界、可復原自我修改的代理基礎設施;AlphaEvolve 展示評估器驅動演化的力量;Anthropic 的工作則展示 AI 如何逐步參與研究。三者共同說明 AI 輔助改良循環正在進步,但仍未證明完全自主、開放式 RSI 或 AGI 已經實現。 14959
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
DeepSeek Harness(DSH)較合理的定位,是支援「有界遞迴自我改良」的基礎設施,而不是 DeepSeek 已實現自主 RSI 或 AGI 的證據。
DeepSeek Harness(DSH)較合理的定位,是支援「有界遞迴自我改良」的基礎設施,而不是 DeepSeek 已實現自主 RSI 或 AGI 的證據。 Cordis 分開處理兩件事:時間可組合性負責撤銷元件在執行時留下的受管理變更;空間可組合性則負責協調元件之間的依賴關係。
與 DSH 的執行時架構不同,AlphaEvolve 主打由自動評估器驅動的程式碼演化,Anthropic 研究自動化 AI 研究,而 OpenAI RSI Index 主要是量度相關能力的指標。