NVIDIA 称,Agentic Variation Operators(AVO)搭配 Claude Opus 5,在 ARC AGI 3 的 25 个公开环境、183 个关卡中取得 100.00 RHAE,并完成全部任务,仅使用 6,624 次环境操作。[1][2][7] 这次突破的重点不只是底层模型,而是智能体“外壳”:持久化记忆、工具执行、外部反馈、监督控制和持续修正,将一次性问答变成了长期自主运行的闭环。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA 表示,其智能体架构 Agentic Variation Operators(AVO,智能体变异算子) 搭配 Claude Opus 5,在交互式推理基准 ARC-AGI-3 的公开集上取得了 100.00 RHAE,完成全部 183 个关卡、25 个环境,共执行 6,624 次环境操作。
这件事最值得关注的地方,并不是某个基础模型突然“学会了一切”,而是一个原本用于软件工程和 GPU 内核优化的长期任务智能体架构,被迁移到了完全不同的交互式推理场景,并取得了满分结果。
在公开的 ARC-AGI-3 排行榜快照中,Claude Opus 5 单独运行时的成绩为 30.2%;GPT-5.6 Sol 在标准测试框架下的成绩为 7.8%。
AVO 使用了同一类底层模型,但为它配备了一套能够持续运行多步任务的执行系统。这套系统可以检查和修改工作对象,运行工具与命令,查阅文档,根据执行结果验证方案,并依据外部反馈不断调整策略。
简单来说,AVO 把“一问一答”改造成了一个持续循环:
这一闭环尤其适合 ARC-AGI-3。该测试要求智能体进入陌生的交互式环境,在没有完整规则和目标说明的情况下,通过不断操作来推断任务规律和目标,而不是只对一个定义清晰的提示词给出答案。
AVO 的优势并不来自某一个单独模块,而在于多个能力被组织起来,能够支撑更长的任务周期。
持久化记忆让智能体可以保留已经发现的规律、失败过的路径和有用的任务状态,而不是把每次操作都当成互不相关的对话。对于强调探索的基准测试而言,这有助于减少重复犯错,并逐步建立对陌生环境的工作模型。
这也解释了为什么“上下文是否被保留”会显著影响智能体表现:模型不只是需要推理能力,还需要知道此前试过什么、哪些假设已经被证伪,以及当前任务进行到了哪一步。
AVO 最初是一个代码智能体系统,能够检查和修改代码、执行命令,并通过实际运行来验证结果。它提出的方案不能只停留在“听起来合理”的层面,而要接受测试、测量和反馈,然后决定是否继续或改弦更张。
这种机制迁移到 ARC-AGI-3 后,模型的判断同样会受到环境结果约束:行动成功还是失败、环境发生了什么变化,都会成为下一步推理的依据。
监督层负责协调较长的执行过程。系统并非让一次模型调用无限期地控制所有决策,而是可以持续关注任务进度,识别没有产出的方向,并在关键假设失效时帮助智能体恢复。
因此,AVO 的核心并不是让模型凭空拥有更多知识,而是为它提供了一种结构化的工作方式:
探索 → 行动 → 观察 → 记忆 → 验证 → 修正
模型仍然承担了大量推理工作,但真正决定这些推理能否在陌生环境中持续发挥作用的,是外层执行框架。
这些数字很有参考价值,但不能脱离测试设置直接横向比较。
| 系统或配置 | ARC-AGI-3 报告成绩 | 测试背景 |
|---|---|---|
| AVO + Claude Opus 5 | 100.00 RHAE | 公开集;完成 183/183 个关卡 |
| Claude Opus 5 单独运行 | 30.2% | 已发布的排行榜快照和标准对比设置 |
| GPT-5.6 Sol | 7.8% | 标准或经过验证的半私有对比设置 |
| GPT-5.6 Sol(保留推理并进行压缩) | 38.3% | OpenAI 在公开任务上的自定义运行 |
AVO 的 100.00 RHAE 与 Claude Opus 5 的 30.2% 并不是完全同一种测量结果:前者是完整智能体系统在公开集上的结果,后者则是模型在基准测试框架下的成绩。这一区别正是整个事件的核心。
GPT-5.6 Sol 的情况从另一个角度说明了同样的问题。ARC Prize 发布的结果显示,Sol 在最大推理强度下的成绩为 7.78%;OpenAI 则另行报告称,在公开任务中保留跨轮次推理并使用压缩机制后,成绩达到 38.3%。 后一个数字并不能直接替代官方排行榜成绩,但它表明,记忆机制和状态管理确实可能大幅改变智能体基准测试的表现。
因此,更稳妥的结论不是“某个模型在所有场景都更强”,而是:自主任务的最终表现,很大程度上取决于模型、记忆策略、工具接口、状态管理方式和评测框架能否协同工作。
AVO 最初面对的是复杂的软件工程和 GPU 内核优化任务。在这类工作中,智能体需要检查实现,提出修改假设,运行基于真实硬件的测试,解读性能反馈,再决定下一步尝试什么。成功依赖的是反复实验,而不是一次性生成一段“正确代码”。
NVIDIA 报告称,在 GPU 内核优化工作中,AVO 探索了超过 500 个方向,提交了 40 个内核版本,并在 DGX B200 系统上实现了最高比 FlashAttention-4 快 10.5% 的性能。
这里真正可迁移的能力未必是 GPU 内核知识,而是实验流程:
ARC-AGI-3 的任务界面与 GPU 优化完全不同,但两者都奖励能够通过反复交互发现结构、根据反馈调整行动的系统。
据报道,AVO 使用 6,624 次环境操作完成了公开集,而 VISTA 报告使用了 7,542 次;在完成同样 183 个关卡的前提下,操作次数减少约 12%。
这一点很重要,因为 ARC-AGI-3 的 RHAE(Relative Human Action Efficiency,相对人类行动效率)指标不仅考察智能体是否最终成功,也会考虑相对于人类表现的行动效率。
换句话说,一个智能体即使有能力完成任务,如果需要大量无效试错,也可能变得昂贵、缓慢,难以用于实际工作流。长期自主系统必须同时解决“能不能做”和“能不能高效地做”两个问题。
对企业而言,AVO 最有价值的启示来自架构,而不是一个孤立的满分数字。可靠的自主系统很可能不会只是“一个大语言模型加几个工具”,而需要围绕模型搭建一套受治理的执行层。
这套执行层可以包括:
AVO 也强化了模块化智能体栈的价值。如果相当一部分性能提升来自外层 harness(智能体运行框架),企业就没有必要把所有差异化能力都绑定在单一模型供应商上。记忆层、工具适配器、评测套件、策略控制和可观测性模块,都可以与基础模型相互解耦。
这样一来,企业能够更容易地比较不同模型、替换供应商,或针对某一类业务流程调优,而不必重建整套系统。
不过,NVIDIA 报告的 100% 仍然只是 ARC-AGI-3 公开集上的结果,不能据此证明 AVO 在私有测试任务、生产数据或高风险业务流程中也能达到同等可靠性。 在投入企业应用前,仍需要独立复现、隐藏集测试、成本与延迟分析、安全审查以及针对具体业务的安全评估。
AVO 的成绩把问题从“哪个模型最聪明”推进了一步:
哪个系统能够保留上下文、调用工具、从反馈中学习,并在漫长工作流中稳定恢复和继续执行?
基础模型依然重要,但 ARC-AGI-3 的结果清楚展示了一个现实:模型能力能否在陌生环境中真正落地,很大程度上取决于周围的智能体框架。
对于正在构建自主 AI 的企业来说,下一阶段的竞争优势可能不再来自单次模型调用,而来自执行系统的质量——包括记忆、工具、验证、监督、权限和恢复机制能否被设计成一个可靠的整体。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
NVIDIA 称,Agentic Variation Operators(AVO)搭配 Claude Opus 5,在 ARC AGI 3 的 25 个公开环境、183 个关卡中取得 100.00 RHAE,并完成全部任务,仅使用 6,624 次环境操作。[1][2][7]
NVIDIA 称,Agentic Variation Operators(AVO)搭配 Claude Opus 5,在 ARC AGI 3 的 25 个公开环境、183 个关卡中取得 100.00 RHAE,并完成全部任务,仅使用 6,624 次环境操作。[1][2][7] 这次突破的重点不只是底层模型,而是智能体“外壳”:持久化记忆、工具执行、外部反馈、监督控制和持续修正,将一次性问答变成了长期自主运行的闭环。