NVIDIAによると、AVOはClaude Opus 5と組み合わせることで、ARC AGI 3の公開セットにある25環境・183レベルを6,624アクションで完了し、100.00 RHAEを記録した。[1][2][7] 注目点はモデル単体の性能向上ではなく、永続メモリー、ツール実行、外部フィードバック、監督機能を備えたエージェント・ハーネスが、長期的な探索と修正を可能にしたことだ。
研究の答え

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIAは、同社のエージェント基盤「Agentic Variation Operators(AVO)」が、インタラクティブな推論ベンチマークARC-AGI-3の公開セットで、100.00 RHAEという満点を達成したと発表した。Claude Opus 5を組み込んだAVOは、25環境・183レベルすべてを6,624アクションで完了したという。
この結果の核心は、新しい基盤モデルが突然ベンチマークを解いたという話ではない。ソフトウェア開発やGPUカーネル最適化向けに設計された、長時間・多段階の作業を継続できるエージェント構成が、まったく異なるインタラクティブ推論の課題にも転用できた点にある。
公開されているARC-AGI-3のスコア一覧では、Claude Opus 5単体は30.2%、GPT-5.6 Solは標準ハーネスで**7.8%**とされている。
一方、NVIDIAの100%という結果は、同じ基盤モデルを、長い作業を維持するための実行システムと組み合わせた構成で得られたものだ。AVOは成果物を調べて変更し、ツールやコマンドを実行し、ドキュメントを参照し、結果を評価したうえで、外部から得たフィードバックをもとに方針を修正できる。
単発の質問に答えるのではなく、次のループを繰り返す仕組みだ。
ARC-AGI-3では、エージェントは未知のインタラクティブ環境を探索し、明示された指示文だけに答えるのではなく、実際のやり取りからルールや目的を推測しなければならない。 そのため、各アクションを独立した応答として処理せず、過去の発見を次の判断につなげる能力が重要になる。
AVOのアーキテクチャは、個別に見れば一般的にも思える機能を、長いタスクの中で連携させている。
永続メモリーにより、エージェントは発見したルール、失敗した方法、重要な状態を、アクションごとに忘れず保持できる。探索が中心となるベンチマークでは、同じ失敗を繰り返すのを抑え、未知の環境について実用的な内部モデルを構築しやすくなる。
AVOはもともと、コードを調べて編集し、コマンドを実行し、結果を検証するコーディング・エージェントとして開発された。つまり、もっともらしい説明を生成して終わるのではなく、提案を実際に実行・測定し、結果に応じて作り直せる。
監督レイヤーは、長いプロセス全体を調整する。1回のモデル呼び出しにすべてを任せるのではなく、進捗を把握し、非効率な方向を見つけ、前提が崩れたときの立て直しを支援する。NVIDIAなどの説明では、AVOはメモリー、実行ツール、外部フィードバック、監督機能を組み合わせ、持続的な自律作業を実現する構成とされている。
これらを組み合わせることで、モデルは「探索する、行動する、観察する、修正する」という構造化されたループを実行できる。推論の多くを担うのは依然としてモデルだが、その推論を環境の中でどこまで継続し、検証し、活用できるかを決めるのがハーネスである。
比較には意味があるが、スコアだけを横並びにしてはいけない。評価条件が異なるためだ。
| システムまたは構成 | 報告されたARC-AGI-3結果 | 評価 context |
|---|---|---|
| AVO+Claude Opus 5 | 100.00 RHAE | 公開セット、183レベル中183レベルを完了 |
| Claude Opus 5単体 | 30.2% | 公開されたリーダーボードのスナップショット、標準比較環境 |
| GPT-5.6 Sol | 7.8% | 標準または検証済みの半非公開比較 |
| 推論保持・コンパクションを有効にしたGPT-5.6 Sol | 38.3% | OpenAIが公開タスクで報告した独自実行 |
AVOの100.00 RHAEは、公開セットを完了したエージェント・システム全体の結果だ。一方、Claude Opus 5の30.2%は、ベンチマーク用ハーネス上で測定されたモデルのスコアであり、同じ種類の数値ではない。この違いこそが今回のニュースの重要な部分である。
GPT-5.6 Solの例も、ハーネスの影響を別の角度から示している。ARC Prizeの公開結果では、Solは最大推論 effortで**7.78%だった。一方、OpenAIは、ターンをまたいで推論状態を保持し、コンパクションを利用した公開タスクの独自実行で38.3%**を報告している。 後者は公式リーダーボードのスコアを置き換える同条件の比較ではないが、メモリーや状態管理がエージェント・ベンチマークの結果を大きく変えうることは示している。
したがって、最も慎重な結論は「どのモデルが常に優れているか」ではない。モデル、メモリー方針、ツールのインターフェース、状態管理、評価ハーネスが一体となって、実際の自律性能を決めるということだ。
AVOが当初取り組んだのは、難度の高いソフトウェア開発とGPUカーネル最適化だった。そこでは、実装を調査し、変更案を考え、ハードウェア上でテストを実行し、性能フィードバックを読み取り、次に試す内容を決めなければならない。一度正しいコードを生成すれば終わり、という仕事ではない。
NVIDIAによると、GPUカーネル最適化でAVOは500以上の方向性を探索し、40種類のカーネル版をコミット。DGX B200システム上で、FlashAttention-4を最大**10.5%**上回る性能を達成したという。
ARC-AGI-3に移植されたのは、必ずしもGPUカーネルの知識そのものではない。候補を作り、実行し、結果を測定し、学習内容を保存し、仮説と証拠が食い違えば方針を変えるという、実験のプロセスだ。ARC-AGI-3のインターフェースは異なるものの、未知の環境との反復的なやり取りから構造を見つける点では共通している。
AVOは公開セット全体を6,624環境アクションで解いたと報告されている。これは、同じ183レベルを完了したVISTAの7,542アクションと比べ、約12%少ない。
この差が重要なのは、ARC-AGI-3のRHAE(Relative Human Action Efficiency、相対人間アクション効率)が、最終的に成功したかどうかだけでなく、人間の行動効率を基準にアクション数も評価する指標だからだ。
長期タスクのエージェントは、能力があっても、試行錯誤を過剰に繰り返せば非効率で高コストになる。探索と節約を同時に管理する必要がある。
企業で活用するうえで、今回の成果から得られる最も実務的な教訓は、アーキテクチャに関するものだ。信頼できる自律システムは、単にLLMへいくつかのツールを接続しただけでは成り立ちにくい。モデルの周囲に、管理された実行レイヤーが必要になる。
具体的には、次のような構成が考えられる。
AVOの結果は、モジュール型のエージェント・スタックを採用する理由も強める。性能向上の多くがハーネスから生まれるなら、メモリー、ツールアダプター、評価スイート、ポリシー制御、可観測性を基盤モデルから分離しておく価値がある。そうすれば、モデル提供元を変更したり、特定の業務に合わせて調整したりする際にも、システム全体を作り直さずに済む。
ただし、今回の100%という数字を、企業での信頼性の証明と受け取るべきではない。NVIDIAが報告したのは、ARC-AGI-3の公開セットでの結果であり、非公開のベンチマーク、実運用データ、リスクの高い業務プロセスでも同等に動くことを示すものではない。 独立した再現検証、非公開セットでのテスト、コストとレイテンシーの分析、セキュリティレビュー、安全性評価が必要になる。
AVOの成果は、「どのモデルが最も賢いのか」という問いを、「どのシステムが文脈を保持し、ツールを使い、フィードバックから学び、長いワークフローの途中で確実に立て直せるのか」という問いへと移している。
モデルの能力はもちろん重要だ。しかしARC-AGI-3は、未知の環境に触れたとき、その能力を最後まで引き出せるかどうかを周囲のハーネスが左右しうることを、分かりやすく示した。
自律型AIを構築する企業にとって、競争力の源泉はモデル呼び出しそのものではなく、メモリー、実行、検証、監督を組み合わせた実行システムの品質へ移っていく可能性がある。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
NVIDIAによると、AVOはClaude Opus 5と組み合わせることで、ARC AGI 3の公開セットにある25環境・183レベルを6,624アクションで完了し、100.00 RHAEを記録した。[1][2][7]
NVIDIAによると、AVOはClaude Opus 5と組み合わせることで、ARC AGI 3の公開セットにある25環境・183レベルを6,624アクションで完了し、100.00 RHAEを記録した。[1][2][7] 注目点はモデル単体の性能向上ではなく、永続メモリー、ツール実行、外部フィードバック、監督機能を備えたエージェント・ハーネスが、長期的な探索と修正を可能にしたことだ。