NVIDIA에 따르면 AVO는 Claude Opus 5와 함께 ARC AGI 3 공개 세트의 25개 환경, 183개 레벨을 6,624번의 행동으로 모두 해결해 100.00 RHAE를 기록했습니다. 이번 결과의 핵심은 모델 자체보다 에이전트 하니스에 있습니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA가 공개한 Agentic Variation Operators(AVO) 시스템이 인터랙티브 추론 벤치마크 ARC-AGI-3 공개 세트에서 100.00 RHAE라는 만점을 기록했습니다. Claude Opus 5를 기반으로 한 AVO는 25개 환경의 183개 레벨을 6,624번의 환경 행동으로 모두 해결했습니다.
눈여겨볼 대목은 새로운 기반 모델이 갑자기 벤치마크를 정복했다는 이야기가 아니라는 점입니다. GPU 커널 최적화와 소프트웨어 엔지니어링을 위해 설계된 장기 작업형 에이전트 구조가, 전혀 다른 인터랙티브 추론 과제로 이전됐다는 데 의미가 있습니다.
공개된 ARC-AGI-3 리더보드 스냅샷에서 Claude Opus 5 단독 점수는 30.2%, GPT-5.6 Sol은 표준 하니스 기준 **7.8%**로 제시됐습니다.
반면 NVIDIA의 100% 결과는 동일한 계열의 모델에 장기 작업을 지속할 수 있는 실행 시스템을 결합해 얻은 성과입니다. AVO는 작업 결과물을 살펴보고 수정하며, 도구와 명령을 실행하고, 문서를 참고하고, 외부 피드백을 바탕으로 결과를 검증한 뒤 접근 방식을 다시 고칠 수 있습니다.
쉽게 말해 AVO는 한 번 답을 생성하고 끝내는 질의응답 방식 대신 다음과 같은 순환 구조를 사용합니다.
이 구조는 ARC-AGI-3에서 특히 중요합니다. 이 벤치마크의 에이전트는 규칙과 목표가 완전히 설명된 프롬프트에 답하는 것이 아니라, 낯선 인터랙티브 환경을 직접 탐색하면서 규칙과 목표를 추론해야 합니다.
AVO의 구조는 각각 따로 보면 익숙한 기능들을 긴 작업 흐름 안에서 함께 작동시키는 데 초점이 맞춰져 있습니다.
지속형 메모리는 에이전트가 발견한 사실과 실패한 접근, 유용한 상태 정보를 다음 단계에서도 활용하도록 합니다. 매 행동을 별개의 대화처럼 처리하지 않기 때문에, 탐색 중심의 과제에서 같은 실수를 반복하는 일을 줄이고 낯선 환경에 대한 작동 모델을 만들어갈 수 있습니다.
AVO는 원래 코딩 에이전트 시스템으로 개발됐습니다. 코드를 확인하고 변경한 뒤 명령을 실행하고, 결과를 검증할 수 있는 구조입니다. 따라서 그럴듯한 설명을 내놓는 데 그치지 않고, 제안한 변경을 실제로 테스트하고 측정한 뒤 다시 수정할 수 있습니다.
감독 계층은 긴 작업 과정을 조율합니다. 하나의 모델 호출이 모든 결정을 끝없이 맡도록 하는 대신, 시스템은 진행 상황을 점검하고 비생산적인 방향을 찾아내며 잘못된 가정이 드러났을 때 복구를 지원할 수 있습니다. NVIDIA와 관련 설명은 AVO가 지속형 자율 작업을 위해 메모리, 실행 도구, 외부 피드백, 감독 기능을 결합한다고 소개합니다.
이 요소들이 결합되면 모델은 탐색하고, 행동하고, 관찰하고, 수정하는 구조화된 작업 루프를 갖게 됩니다. 추론의 상당 부분은 여전히 모델이 담당하지만, 그 추론이 실제 환경 속에서 얼마나 오래 유지되고 실행되는지는 하니스가 결정합니다.
점수 비교는 참고가 되지만, 각 수치가 동일한 평가 조건에서 나온 것은 아니라는 점을 먼저 봐야 합니다.
| 시스템 또는 구성 | 보고된 ARC-AGI-3 결과 | 평가 맥락 |
|---|---|---|
| Claude Opus 5를 탑재한 AVO | 100.00 RHAE | 공개 세트, 183개 중 183개 레벨 해결 |
| Claude Opus 5 단독 | 30.2% | 공개된 리더보드 스냅샷 및 표준 비교 설정 |
| GPT-5.6 Sol | 7.8% | 표준 또는 검증된 반비공개 비교 |
| 추론 보존·압축 기능을 적용한 GPT-5.6 Sol | 38.3% | OpenAI가 공개 과제로 보고한 맞춤 실행 |
AVO의 수치와 Opus 5 단독 점수는 같은 종류의 측정값이 아닙니다. 전자는 공개 세트 전체를 해결한 에이전트 시스템의 결과이고, 후자는 표준 벤치마크 하니스에서 측정한 모델 점수입니다. 바로 이 차이가 이번 사례의 핵심입니다.
GPT-5.6 Sol도 하니스의 영향을 보여주는 사례입니다. ARC Prize가 공개한 결과에서 Sol은 최대 추론 노력 설정으로 **7.78%**를 기록했습니다. 한편 OpenAI는 공개 과제에서 턴 사이의 추론 상태를 보존하고 정보를 압축하는 방식으로 **38.3%**를 기록했다고 별도로 발표했습니다. 이 수치는 공식 리더보드 점수를 대체하는 동일 조건의 결과는 아니지만, 메모리와 상태 관리가 에이전트 벤치마크 성능을 크게 바꿀 수 있음을 보여줍니다.
따라서 가장 안전한 결론은 특정 모델이 언제나 더 우수하다는 것이 아닙니다. 자율 시스템의 성능은 모델뿐 아니라 메모리 정책, 도구 인터페이스, 상태 관리 방식, 평가 하니스가 어떻게 함께 설계되는지에 크게 좌우된다는 것입니다.
AVO가 처음 적용된 분야는 난도가 높은 소프트웨어 엔지니어링과 GPU 커널 최적화였습니다. 이 환경에서 에이전트는 구현을 살펴보고 변경안을 제시한 뒤, 실제 하드웨어 기반 테스트를 실행하고, 성능 피드백을 해석하며, 다음에 무엇을 시도할지 결정해야 합니다. 한 번의 정답 생성이 아니라 반복적인 실험이 필요한 작업입니다.
NVIDIA는 GPU 커널 최적화 과정에서 AVO가 500개가 넘는 방향을 탐색하고 40개 커널 버전을 커밋했으며, DGX B200 시스템에서 FlashAttention-4보다 최대 10.5% 향상된 성능을 달성했다고 밝혔습니다.
이 과정에서 다른 과제로 이전된 능력은 GPU 지식 자체라기보다 실험 절차에 가깝습니다. 후보를 만들고, 실행하고, 결과를 측정하고, 배운 내용을 저장하고, 증거가 가설과 맞지 않으면 방향을 바꾸는 폐쇄 루프입니다. ARC-AGI-3의 인터페이스는 다르지만, 반복적인 상호작용을 통해 구조를 발견하는 에이전트가 유리하다는 점에서는 맞닿아 있습니다.
AVO는 공개 세트 전체를 6,624번의 환경 행동으로 해결한 것으로 보고됐습니다. 이는 같은 183개 레벨을 해결하는 데 7,542번의 행동을 사용한 것으로 알려진 VISTA보다 약 12% 적은 수치입니다.
이 차이는 단순한 기록 단축 이상의 의미가 있습니다. ARC-AGI-3의 RHAE 지표는 성공 여부만이 아니라 인간 수행과 비교한 행동 효율까지 반영하기 때문입니다. 장기 작업형 시스템은 무작정 시행착오를 반복하는 것이 아니라, 탐색 비용을 관리해야 합니다. 능력이 있어도 행동이 지나치게 많으면 비용과 지연 시간이 커져 실제 사용이 어려워질 수 있습니다.
기업이 얻을 수 있는 가장 현실적인 교훈은 아키텍처에 있습니다. 신뢰할 수 있는 자율 시스템은 단순히 LLM에 몇 가지 도구를 연결한 형태에 머물 가능성이 작습니다. 모델을 둘러싼 관리 가능한 실행 계층이 필요합니다.
그 계층에는 다음과 같은 기능이 포함될 수 있습니다.
AVO는 모듈형 에이전트 스택의 필요성도 뒷받침합니다. 성능 향상의 상당 부분이 하니스에서 나온다면, 기업은 메모리 계층, 도구 어댑터, 평가 도구, 정책 제어, 관측 가능성 기능을 기반 모델과 분리해두는 편이 유리할 수 있습니다. 이렇게 하면 전체 시스템을 다시 만들지 않고도 모델 제공업체를 바꾸거나 특정 업무에 맞춰 조정하기 쉬워집니다.
다만 이번 벤치마크 결과를 기업 환경의 신뢰성에 대한 증명으로 받아들여서는 안 됩니다. NVIDIA의 100%는 ARC-AGI-3 공개 세트에서 보고된 결과입니다. 비공개 과제, 실제 운영 데이터, 위험도가 높은 비즈니스 프로세스에서도 같은 성능을 낸다는 뜻은 아닙니다. 독립적인 재현, 비공개 세트 평가, 비용과 지연 시간 분석, 보안 검토, 안전성 평가가 여전히 필요합니다.
AVO의 성과는 질문의 방향을 바꿉니다. 이제 중요한 질문은 ‘어떤 모델이 가장 똑똑한가’만이 아니라, 어떤 시스템이 긴 작업 과정에서 맥락을 유지하고, 도구를 사용하며, 피드백을 학습하고, 실패 후 안정적으로 복구하는가입니다.
모델의 성능은 여전히 중요합니다. 그러나 ARC-AGI-3 사례는 낯선 환경과 부딪혔을 때 모델의 능력이 실제 결과로 이어질 수 있는지를 주변 하니스가 결정할 수 있음을 보여줍니다. 자율 AI를 구축하는 기업이라면 경쟁력의 중심이 단일 모델 호출이 아니라, 실행 시스템의 설계 품질로 이동할 가능성에 주목해야 합니다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
NVIDIA에 따르면 AVO는 Claude Opus 5와 함께 ARC AGI 3 공개 세트의 25개 환경, 183개 레벨을 6,624번의 행동으로 모두 해결해 100.00 RHAE를 기록했습니다.
NVIDIA에 따르면 AVO는 Claude Opus 5와 함께 ARC AGI 3 공개 세트의 25개 환경, 183개 레벨을 6,624번의 행동으로 모두 해결해 100.00 RHAE를 기록했습니다. 이번 결과의 핵심은 모델 자체보다 에이전트 하니스에 있습니다. 지속형 메모리, 도구 사용, 피드백 기반 수정, 감독 기능이 모델의 장기 작업 수행 능력을 크게 확장했습니다.