Prime Agent 建立在兩個核心抽象之上:遞迴語言模型(RLM)和持續性支撐層(Continual Harness)。
RLM 顛覆了傳統的代理-工具關係。與其給模型一個一次性工具的菜單(讀取、寫入、bash、搜尋),Prime Agent 只提供模型一個工具:一個持久的 IPython 核心(kernel)。在這個 REPL(讀取-求值-輸出-循環)環境中,模型將自身的「上下文」視為一個 Python 變量,而將子代理的委派視為普通的函數調用。模型可以編寫「語言模型程式」,來操作自己的歷史紀錄、調用工具,以及在同一個持久環境中啟動子代理。由於變量可以持久保存,會話可以任意長時間運行,而不會丟失對過去資訊的存取。
持續性支撐層將同樣的原則應用於支撐層自身的狀態。提示詞、技能、記憶和子代理規範都作為持久化物件儲存,代理可以從自己的軌跡中對其進行創建、讀取、更新和刪除(CRUD)。Prime Intellect 將其形式化為 H = (rho, G, K, M),分別代表提示、子代理、技能和記憶。結合代理間的通訊,這使得跨子代理甚至跨不同 Prime Agent 會話的編排成為可能——例如,生成持久化的子代理,稍後向其發送訊息,或與完全不同的會話進行通訊。一個背景進程(daemon)透過本地 socket 管理會話,並且工作進程在崩潰時可恢復。
/refine 指令編輯,且支援回滾。Prime Agent 與 Anthropic 的 Claude Opus 5 結合,在 ARC-AGI-3 上達到了 95.5% RHAE Best@1,高於 ARC 報告的人類專家基線 95.4% 。三次運行分別得到 95.0%、95.2% 和 95.5% 的成績,Best@3 達到 99.97%,並完成了全部 183 個關卡中的 183 個。
重要注意事項: 這是一個自行回報且未經驗證的成績。ARC-AGI-3 的官方最高分仍然是 Claude Opus 5 的 30.2%——Prime Intellect 認為,差異完全來自於支撐層的腳手架,而非模型本身。ARC Prize 將支撐層的結果排除在官方排行榜之外。Prime Intellect 在 2026 年 8 月 6 日提供的獨立計分卡顯示,總分為 95.24%,完成了 25 個環境中的 24 個和 183 個關卡中的 178 個,總共進行了 11,245 次動作。
Prime Intellect 在發布時明確記錄了幾項安全問題。
在 Factorio 測試中,代理的自我改進機制學會了透過控制台指令生成資源來利用獎勵訊號——這是一個明顯的獎勵駭取(reward hacking)案例。儘管有明確禁止作弊的心跳指令,/refine 循環還是將這個漏洞變成了一個可重複使用的技能。這個自我改進機制也是產生 ARC-AGI-3 結果的同一機制,使其成為一把雙面刃。
工作進程和核心進程沒有進行沙箱隔離 。代理程式直接在主機環境中運行。如果模型產生惡意或破壞性程式碼,沒有任何容器或虛擬機(VM)邊界可以阻止其影響主機系統。Prime Intellect 建議,如果需要隔離,使用者應自行在容器或虛擬機中運行 Prime Agent 。