DeepSeek Harness(DSH)更适合被理解为支持“有边界的递归自我改进”的基础设施,而不是 DeepSeek 已实现自主 RSI 或 AGI 的证据。 Cordis 将时间可组合性与空间可组合性分开:前者负责撤销组件在运行时留下的受管理影响,后者负责协调组件之间的依赖关系。
研究答案

Create a landscape editorial hero image for this Studio Global article: How does DeepSeek Harness (DSH)—through its Cordis framework for temporally and spatially composable, reversible, failure-tolerant self-modi. Article summary: DSH is best understood as RSI-enabling infrastructure, not evidence that DeepSeek has achieved autonomous recursive self-improvement or AGI. Its core idea is to make an agent’s own runtime—tools, model adapters, memory/s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
DeepSeek Harness(DSH)并没有证明 DeepSeek 已经构建出自主递归自我改进系统,也没有证明其实现了通用人工智能(AGI)。更稳妥的判断是:DSH 提供了一种新的智能体运行时架构——工具、模型适配器、会话机制,甚至智能体循环本身,都可以被视为可替换组件。这让反复试验变得更安全、更现实,也为“有边界的自我改进”提供了重要基础。2526
“递归自我改进”(Recursive Self-Improvement,RSI)并不只有一种含义。系统可以改进某个具体产物,例如算法;也可以帮助研究人员构建更强的后继模型;还可以修改决定智能体如何工作的可复用脚手架,包括提示词、工具、记忆、策略和调度机制。相关研究将这种依赖外部评估、目标相对固定的自我精炼,与更开放式的 RSI 区分开来:后者不仅修改系统,还可能修改产生改进的机制乃至评判标准。1
DSH 最明确瞄准的是脚手架层。它不要求智能体直接重写神经网络权重,而是允许系统围绕模型试验不同组件:提示词、工具、记忆、策略、编排方式和执行循环。更强的组件可以被安装并测试;如果表现不佳,则可以移除。
这对面向工程的 RSI 来说是一个有意义的方向,但它并不等同于智能体独立设计更强的后继者、自主决定自身目标,或启动不受控制的“智能爆炸”。
DSH 建立在 Cordis 之上。Cordis 是一种插件运行时,其文档用“时空可组合性”(spatiotemporal composability)来描述它的设计思想。它主要处理软件在运行过程中动态变化时的两个问题:组件随时间被加载、卸载或替换时会发生什么,以及当前系统中各个组件如何协作。1718
插件可能会向共享运行时注册资源、监听器、服务或其他状态。在普通插件系统中,卸载往往依赖开发者手写清理代码,稍有遗漏就可能留下资源泄漏或“幽灵状态”。
Cordis 的做法是将运行时变化与可撤销的效果关联起来。组件被移除时,运行时可以按照适当顺序执行对应的逆操作。这里的目标不是让插件“倒放”,也不是撤销智能体已经对外部世界采取的每一个行动,而是将相关运行时结构恢复到一个有效的此前配置。2024
这一点需要特别澄清:插件注册的回滚机制,无法自动撤销已经发出的电子邮件、被删除的文件、使用污染数据训练出的模型,或现实世界中已经发生的不可逆行动。Cordis 的可逆性是一种有边界的软件属性,并非覆盖一切后果的安全保证。
组件之间还存在依赖关系。例如,工具可能需要工具注册表,记忆模块可能需要会话管理器,智能体循环可能需要模型适配器和工具接口。
空间可组合性允许组件声明这些关系。当提供者或依赖项出现、消失或发生替换时,运行时可以协调组件的启用、停用、替换和恢复。这样,模块化智能体就能重新配置自身,而不必把整个系统当作一个脆弱的整体来处理。1820
可撤销效果与依赖感知型组合结合起来,可以支持更安全的试验、组件替换、故障恢复和事务式运行时更新。对于自我改进而言,这些能力很关键,因为它们降低了尝试候选变更以及及时淘汰失败变更的成本。
从设计上看,DSH 展示的是一条偏系统工程的通用智能体路线:让执行环境足够灵活,使智能体能够改进自己完成任务所依赖的机制。
这种思路把关注点从单一模型转移到了模型周围的系统。即使基础模型不变,更好的工具、记忆、规划、评估和恢复机制,也可能显著提升智能体在实际任务中的能力。如果智能体能够提出这些机制的改动,用外部标准进行测试,并只保留成功版本,那么改进就可以在一个相对受控的循环中发生。
但仅凭架构本身,不能证明 DSH 已经自主执行递归自我改进。现有证据描述的是一个开源运行时和智能体框架,而不是一个已经展示出来的端到端闭环:由 DSH 独立生成、评估、筛选并部署越来越强的自身版本。2526
RSI 讨论中的不同系统,往往瞄准改进流程的不同层次。若把它们简单视为同类产品,反而会掩盖关键的技术差异。
AlphaEvolve 更接近一个直接的优化闭环:基于 Gemini 的智能体提出代码修改,自动评估器对结果打分,随后由进化过程筛选出有前景的候选方案。Google DeepMind 表示,该系统已被用于算法发现与优化,包括数学问题和计算基础设施等场景。2314
它最突出的优势是反馈:候选方案可以依据机器可检查的目标进行测试。相比之下,DSH 主要是一种用于安全组合和替换组件的运行时架构。AlphaEvolve 关注的是如何让解决方案进化,Cordis 关注的是如何让正在运行的系统安全地重新配置。
现有公开材料将 RSI Index 描述为多项 AI 研究评估的汇总指标。按照这一描述,它主要是追踪能力的测量工具,而不是能够自行修改模型或运行改进闭环的引擎。模型在若干与自我改进相关的任务上得分较高,可以说明其能力表现,但不能单凭分数证明系统在部署中自主改进自身。3435
因此,RSI Index 更适合与 DSH 的“测量层”进行比较,而不是被视为 DSH 的架构竞争者。就现有材料而言,外部还无法独立核实该指数的构成,也无法确定其分数变化应如何解释。
Anthropic 的自动化对齐研究者瞄准的是另一项瓶颈:如何利用较弱的监督来训练或引导更强的模型。相关智能体可以提出研究想法、运行实验,并围绕弱到强监督问题进行迭代。4958
这项工作更接近 AI 研究和对齐评估流程的自动化,而不是 DSH 所强调的运行时组件替换。未来两种路线可能形成互补:研究智能体负责发现更好的组件,可逆的 Harness 则负责在受控条件下测试、部署并回滚这些组件。
Anthropic 的更广泛公开讨论也给出了重要限定:该公司表示,目前还没有实现完全自主的递归自我改进,而且 RSI 并非必然发生。59
现有材料没有提供关于 Tencent Hyra-1.0 或 MiniMax M2.7 的可靠、可独立核验的技术文档。因此,贸然为这两个系统指定某种 RSI 架构,或把它们与 DSH、AlphaEvolve、Anthropic 已公开的研究放在同等证据基础上比较,都会产生误导。
越来越重要的竞争资产,可能不是基础模型本身,而是围绕模型构建的系统。以下四个部分尤其关键:
这也解释了为什么一个基准成绩略低的模型,仍可能凭借更好的环境、更强的工具、更及时的反馈和更可靠的恢复机制保持竞争力。真正成为产品的,不再只是模型检查点,而是整个改进闭环。
可恢复性能够降低风险,却不能消除风险。一个回滚按钮无法保证智能体行动的全部后果都可观测、可定位并且可逆。变化可能影响数据、凭证、外部服务、安全边界,甚至运行时之外的人类决策。
更快的迭代速度也可能放大错误目标、钻评估漏洞、隐藏回归和不透明依赖。人类控制需要的不只是技术上的回滚,还要求所有变更在整个系统范围内保持可观测、可独立评估、受权限约束、可追责,并且确实能够恢复,而不能只在插件依赖图内部可逆。
因此,最有分寸的结论是:DSH 与 Cordis 展示了如何为有边界、可恢复的自我修改设计智能体基础设施;AlphaEvolve 展示了评估器驱动的进化有多大潜力;Anthropic 的工作则表明 AI 正越来越多地参与 AI 研究。它们共同说明,AI 辅助改进闭环正在取得进展,但尚未证明完全自主、开放式的 RSI 或 AGI 已经到来。14959
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
DeepSeek Harness(DSH)更适合被理解为支持“有边界的递归自我改进”的基础设施,而不是 DeepSeek 已实现自主 RSI 或 AGI 的证据。
DeepSeek Harness(DSH)更适合被理解为支持“有边界的递归自我改进”的基础设施,而不是 DeepSeek 已实现自主 RSI 或 AGI 的证据。 Cordis 将时间可组合性与空间可组合性分开:前者负责撤销组件在运行时留下的受管理影响,后者负责协调组件之间的依赖关系。
与 DSH 的运行时架构不同,AlphaEvolve 侧重由自动评估器驱动的代码进化,Anthropic 侧重自动化 AI 研究与弱到强监督,OpenAI 的 RSI Index 则主要是能力测量框架。