換句話說,AVO 不再把任務處理成一次性的問答,而是建立一個持續循環:
AVO 的架構結合了數項單獨看似平凡、但在長流程中相當關鍵的能力。
AVO 原本就是一套程式碼智能體系統,能夠檢查工作內容、修改程式、執行指令並驗證結果。因此,它的推理會連結到可觀察的實際結果:一個看似合理的方案必須經過測試與測量,才能決定是否保留,而不是只因文字描述有說服力就被視為正確。
監督層則負責協調較長時間的工作流程。系統不必讓單一模型呼叫無限期地掌控所有決策,而是可以追蹤進度、辨識沒有產出的方向,並在原先假設失效時協助恢復。NVIDIA 及相關說明將 AVO 描述為結合記憶、執行工具、外部回饋與監督機制的長流程自主架構。
這些元件合在一起,讓模型能以更有組織的方式探索、行動、觀察與修正。模型依然提供大部分推理能力,但真正決定這些能力能否持續發揮的,是外圍的執行框架。
這幾組數字很有參考價值,但不能忽略它們採用的測試設定並不完全相同。
| 系統或設定 | ARC-AGI-3 公布結果 | 評測情境 |
|---|---|---|
| AVO 搭配 Claude Opus 5 | 100.00 RHAE | 公開集;完成 183/183 個關卡 |
| Claude Opus 5 單獨運作 | 30.2% | 已公布的排行榜快照與標準比較設定 |
| GPT-5.6 Sol | 7.8% | 標準或經驗證的半私有比較設定 |
| GPT-5.6 Sol,保留推理並進行壓縮 | 38.3% | OpenAI 在公開任務上的自訂測試 |
AVO 與 Claude Opus 5 單獨運作的數字,並不是完全相同類型的測量:前者是完整智能體系統在公開集上的結果,後者則是模型在基準測試框架下的分數。這個差異正是整起事件的關鍵。
GPT-5.6 Sol 也從另一個角度說明了同一件事。ARC Prize 公布的結果顯示,Sol 在最高推理強度下為 7.78%;OpenAI 則另外表示,在公開任務中保留跨回合推理狀態並採用壓縮機制後,成績可達 38.3%。 後者不是官方排行榜分數的直接替代,但顯示記憶與狀態管理方式,確實可能大幅影響智能體基準測試的表現。
因此,較穩妥的結論不是某個模型在所有情境都更強,而是自主 AI 的成績很大程度取決於模型、記憶策略、工具介面、狀態管理方式與評測框架能否協同運作。
AVO 最初面對的是高難度軟體工程與 GPU 核心最佳化。在這類工作中,智能體必須檢查實作、提出修改方案、執行以硬體為基礎的測試、解讀效能回饋,再決定下一步要嘗試什麼。成功關鍵不是一次生成正確答案,而是持續實驗。
NVIDIA 表示,在 GPU 核心最佳化工作中,AVO 探索了超過 500 個方向、提交了 40 個核心版本,並在 DGX B200 系統上達到最高比 FlashAttention-4 快 10.5% 的效能。
真正能移植到 ARC-AGI-3 的能力,未必是 GPU 核心相關知識,而是這套實驗流程:提出候選方案、執行、測量結果、保存學到的內容,並在證據不支持原先假設時改變方向。ARC-AGI-3 的介面雖然不同,卻同樣獎勵能透過反覆互動發現結構的智能體。
這點很重要,因為 ARC-AGI-3 的 RHAE(Relative Human Action Efficiency,相對人類行動效率)不只看智能體最後是否成功,也會將操作效率與人類表現相比。 長流程智能體若進行過多無效試錯,即使具備解題能力,也可能變得低效、昂貴或難以實際部署。
對企業應用而言,這次結果最有價值的啟示在於系統架構。一套可靠的自主 AI,恐怕不會只是「大型語言模型加上幾個工具」,而需要一個受到治理的執行層。
這個執行層可以包括:
AVO 也強化了模組化智能體技術棧的價值。如果大部分效能提升來自執行框架,企業就可以把記憶層、工具介接器、評測套件、政策控制與可觀測性功能,和底層基礎模型分開。如此一來,企業更容易比較不同模型、替換供應商,或針對特定工作流程調整系統,而不必重建整個架構。
不過,這項基準測試結果不能直接視為企業可靠性的證明。NVIDIA 的 100% 是其在 ARC-AGI-3 公開集上的報告結果,並不代表系統在私有測試題、實際生產資料或高風險商業流程中也能達到同等表現。 仍需要獨立複現、隱藏集測試、成本與延遲分析、安全審查及安全性評估。
AVO 的結果,讓問題從「哪個模型最聰明?」轉向更務實的提問:哪一套系統能在長時間工作流程中保留脈絡、使用工具、從回饋學習,並可靠地修正與復原?
模型當然仍然重要,但 ARC-AGI-3 生動展示了周邊框架可能決定模型能力能否真正應付陌生環境。對正在打造自主 AI 的企業而言,未來的競爭優勢可能越來越取決於執行系統的品質,而不只是單次模型呼叫的能力。