NVIDIA表示,AVO配合 Claude Opus 5,喺 ARC AGI 3 公開集取得100.00 RHAE,完成25個環境、合共183個關卡,只用了6,624次操作。 重點唔只係模型本身:持久記憶、工具執行、根據回饋修正策略,同監督及復原機制,令系統可以處理長時間、多步驟嘅互動任務。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA表示,旗下 Agentic Variation Operators(AVO)系統配合 Claude Opus 5,喺互動推理基準 ARC-AGI-3 嘅公開集取得 100.00 RHAE 滿分,完成全部 183個關卡、25個環境,總共進行 6,624次操作。
不過,呢個結果唔應該簡化成「Claude Opus 5突然由30%變成100%」。更準確嘅講法係:NVIDIA將同一個底層模型放入一套為長流程自主工作而設嘅智能體系統,令模型可以持續探索、記住發現、執行工具、檢查結果,再按環境回饋改變策略。
喺已公布嘅 ARC-AGI-3 排名快照入面,單獨運行嘅 Claude Opus 5 得分係 30.2%;GPT-5.6 Sol 喺標準測試框架下則係 7.8%。
AVO採用嘅唔係一次問答、一次作答嘅模式,而係一個可以長時間運作嘅循環:
ARC-AGI-3嘅難度,正正喺於智能體要進入陌生嘅互動環境,唔可以只靠一段寫得清清楚楚嘅指令,而係要靠實際行動去推斷規則、目標同環境結構。
持久記憶令智能體可以保存已經發現嘅規律、失敗過嘅方法同任務狀態,而唔係將每一次行動當成互不相干嘅對話。
對需要不斷探索嘅 ARC-AGI-3 來講,呢種記憶有助減少重複犯錯,亦令系統可以逐步建立對陌生環境嘅工作模型。
AVO最初係一套編碼智能體系統,可以檢查及修改程式碼、執行指令、查閱文件,再透過實際執行驗證結果。
呢個設計令推理唔會停留喺「聽落合理」嘅層面。智能體提出一個改動之後,可以實際測試、量度表現,然後根據結果繼續修改。套用到 ARC-AGI-3,就變成一個「行動—觀察—修正」嘅閉環。
監督層負責協調較長嘅任務流程,幫助系統留意進度、辨認冇效率嘅方向,亦可以喺原本假設失效時支援復原。NVIDIA及相關描述將 AVO 概括為結合持久記憶、執行工具、外部回饋同監督能力嘅長流程自主架構。
換句話講,模型負責相當一部分推理,但真正決定推理可唔可以一路落地嘅,係包住模型嗰套執行框架。
| 系統或配置 | ARC-AGI-3報告結果 | 評估背景 |
|---|---|---|
| AVO配合 Claude Opus 5 | 100.00 RHAE | 公開集;完成183/183個關卡 |
| 單獨 Claude Opus 5 | 30.2% | 已公布排名快照及標準比較設定 |
| GPT-5.6 Sol | 7.8% | 標準或已驗證嘅半私有比較 |
| GPT-5.6 Sol,保留推理及壓縮狀態 | 38.3% | OpenAI喺公開任務上報告嘅自訂測試 |
但以上數字唔係完全同一種測量。AVO嘅100.00係一套完整智能體系統喺公開集嘅結果;Claude Opus 5嘅30.2%就係模型喺基準測試框架下嘅分數。兩者之間嘅差異,正正係今次事件最值得留意嘅地方。
GPT-5.6 Sol亦反映出同一個問題。ARC Prize公布嘅結果顯示,Sol喺最高推理力度下係 7.78%;但OpenAI另一次測試透過保留多輪推理狀態及使用壓縮機制,喺公開任務取得 38.3%。 呢個自訂結果唔可以直接取代官方排名,但就顯示記憶同狀態管理足以大幅影響智能體基準測試表現。
所以,較穩妥嘅結論唔係話某一個模型全面勝過其他模型,而係自主表現會受到多項因素共同影響,包括模型、記憶策略、工具介面、狀態管理方式,以及評估框架。
AVO最初面對嘅係軟件工程同 GPU kernel 優化。智能體要先檢查現有實作,提出假設,再修改程式、執行以硬件為基礎嘅測試、解讀效能回饋,最後決定下一步試乜。成功唔係靠一次生成,而係靠持續試驗。
NVIDIA表示,AVO喺 GPU kernel 工作入面探索超過 500個方向、提交 40個 kernel 版本,喺 DGX B200 系統上取得最高 比 FlashAttention-4 快10.5% 嘅表現。
可以轉移到 ARC-AGI-3嘅未必係 GPU kernel 專門知識,而係背後嗰套實驗流程:提出候選方案、實際執行、量度結果、保存學到嘅嘢,然後喺證據同假設唔一致時改變方向。
ARC-AGI-3嘅介面雖然完全唔同,但同樣獎勵能夠透過多次互動發現結構、有效試錯同持續修正嘅系統。
AVO據報用 6,624次環境操作完成整個公開集;相比之下,VISTA報告使用 7,542次,即係喺完成同樣183個關卡嘅前提下,操作量減少約 12%。
呢點之所以重要,係因為 ARC-AGI-3嘅 RHAE(Relative Human Action Efficiency,相對人類操作效率)唔只睇智能體最終有冇成功,亦會將操作效率同人類表現比較。
對長流程智能體而言,盲目試錯可能令系統變得昂貴、緩慢,甚至實際上難以部署。能夠記住之前嘅結果,避開重複路線,同時知道幾時應該轉策略,可能同「識唔識答」一樣重要。
對企業而言,AVO最有價值嘅啟示係架構層面:可靠嘅自主系統,未必只係一個接上幾件工具嘅大型語言模型,而係需要一個受治理嘅執行層包住模型。
呢一層可以包括:
呢個結果亦支持模組化、開放式智能體堆疊。假如相當一部分效能提升來自 harness,即包住模型嘅執行框架,企業就可以將記憶層、工具轉接器、評估套件、政策控制同可觀測性功能,分開於底層模型之外。咁樣日後比較模型、轉換供應商,或者針對特定工作流程調校系統時,就唔使由零開始重建成套架構。
但要留意,NVIDIA嘅100%係一個喺 ARC-AGI-3 公開集上報告嘅結果,唔代表系統喺私有測試、真實生產數據或高風險商業流程,都必然有同等可靠性。 要落實到企業部署,仍然需要獨立重現、隱藏測試集驗證、成本及延遲分析、安全審查同可靠性評估。
AVO將焦點由「邊個模型最勁?」推向一條更實際嘅問題:邊套系統可以保存上下文、運用工具、從回饋學習,並且喺長流程入面穩定復原?
底層模型當然仍然重要,但 ARC-AGI-3呢次示範出,模型一接觸陌生環境,周邊 harness 就可能決定佢嘅能力可以發揮幾多。
對正部署自主AI嘅企業來講,真正嘅競爭優勢,可能越來越唔係單次模型呼叫,而係記憶、執行、驗證、監督同復原呢套系統究竟做得幾紮實。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
NVIDIA表示,AVO配合 Claude Opus 5,喺 ARC AGI 3 公開集取得100.00 RHAE,完成25個環境、合共183個關卡,只用了6,624次操作。
NVIDIA表示,AVO配合 Claude Opus 5,喺 ARC AGI 3 公開集取得100.00 RHAE,完成25個環境、合共183個關卡,只用了6,624次操作。 重點唔只係模型本身:持久記憶、工具執行、根據回饋修正策略,同監督及復原機制,令系統可以處理長時間、多步驟嘅互動任務。