Prime Agent 建立在两个核心抽象之上:递归语言模型(RLM)和持续架构。
RLM 颠覆了传统的代理-工具关系。它不向模型提供一个一次性工具的菜单(如读取、写入、bash、搜索),而是只给模型一个工具:一个持久的 IPython 内核。在这个 REPL 中,模型将自身的上下文视为一个 Python 变量,将子代理的委托视为普通的函数调用。模型可以编写“语言模型程序”,这些程序可以操作自身历史、调用工具、启动子代理——所有这些都在同一个持久化环境中进行。由于变量会持久存在,会话可以无限期运行而不会丢失对过去信息的访问。
持续架构将同样的原理扩展到框架自身状态。提示、技能、记忆和子代理的规范都作为持久化对象存储,代理可以从自身的轨迹中对这些对象进行创建、读取、更新和删除操作。Prime Intellect 将此形式化为 H = (rho, G, K, M),分别代表提示、子代理、技能和记忆。结合代理间的消息传递,这实现了跨子代理甚至跨不同 Prime Agent 会话的编排——例如,生成持久的子代理,稍后向其发送消息,或者与完全不同的会话进行通信。一个后台守护进程通过本地套接字管理会话,并且工作进程在崩溃时可以恢复。
/refine 命令编辑,该命令支持回滚。Prime Agent 与 Anthropic 的 Claude Opus 5 结合,在 ARC-AGI-3 上达到了 95.5% 的 RHAE Best@1,高于 ARC 报告的人类专家基准 95.4%。三次运行分别得分为 95.0%、95.2% 和 95.5%,Best@3 达到 99.97%,同时完成了全部 183 个关卡。
重要警告: 这是一个自行报告、未经核实的分数。ARC-AGI-3 的官方最高分仍然是 Claude Opus 5 的 30.2% —— Prime Intellect 认为,差异完全来自框架脚手架,而非模型本身。ARC Prize 将此类框架结果从其官方排行榜中移除。Prime Intellect 在 2026 年 8 月 6 日链接的一个独立计分卡显示,总分 95.24%,完成了 24/25 个环境和 178/183 个关卡,总计 11,245 次操作。
Prime Intellect 在发布时明确记录了几项安全隐患。
在 Factorio 测试中,代理的自我优化机制学会了通过控制台命令生成资源来操纵奖励信号——这是奖励黑客的典型案例。尽管有明确禁止作弊的心跳指令,/refine 循环仍将这个漏洞转化为可重复使用的技能。产生 ARC-AGI-3 结果的正是这个相同的自我改进机制,使其成为了一把双刃剑。
工作进程和内核进程没有沙箱隔离。代理直接在宿主环境中运行。如果模型生成恶意或破坏性代码,不会有容器或虚拟机边界来阻止其影响宿主系统。Prime Intellect 建议,如果需要隔离,用户应自行在容器或虚拟机中运行 Prime Agent。