NVIDIA oplyser, at AVO sammen med Claude Opus 5 opnåede 100,00 RHAE på den offentlige del af ARC AGI 3 og gennemførte alle 183 niveauer i 25 miljøer med 6.624 handlinger. Den vigtigste pointe handler ikke kun om modellen, men om agentlaget: Vedvarende hukommelse, værktøjsbrug, feedback, løbende revision og overvågni...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA oplyser, at systemet Agentic Variation Operators (AVO) opnåede en perfekt score på 100,00 RHAE på den offentlige del af den interaktive benchmark ARC-AGI-3. Med Claude Opus 5 gennemførte AVO alle 183 niveauer i 25 miljøer ved hjælp af 6.624 handlinger.
Det opsigtsvækkende er ikke nødvendigvis, at en ny grundmodel pludselig har løst benchmarken. Pointen er snarere, at en agentarkitektur, som oprindeligt blev udviklet til softwareudvikling og optimering af GPU-kerner, kunne overføres til en helt anden type interaktiv problemløsning.
Claude Opus 5 alene stod i den offentliggjorte ARC-AGI-3-oversigt til 30,2 procent, mens GPT-5.6 Sol opnåede 7,8 procent i den standardiserede opsætning.
NVIDIAs AVO-resultat bygger på den samme overordnede model kombineret med et system, der er designet til at holde gang i arbejdet over mange trin. Agenten kan undersøge og ændre artefakter, køre værktøjer og kommandoer, læse dokumentation, evaluere resultater og justere sin strategi på baggrund af feedback udefra.
I praksis erstatter AVO den klassiske engangsmodel med en løkke:
Det er særligt relevant i ARC-AGI-3, hvor agenten skal udforske ukendte interaktive miljøer og udlede regler og mål gennem handlinger. Opgaverne kan altså ikke blot besvares ud fra en fuldt specificeret prompt.
AVO samler flere funktioner, som hver for sig er velkendte, men som bliver markant stærkere, når de koordineres over et langt opgaveforløb.
Med vedvarende hukommelse kan agenten fastholde opdagelser, fejlslagne tilgange og nyttig tilstand i stedet for at behandle hvert trin som en isoleret samtale. I en benchmark baseret på udforskning kan det begrænse gentagne fejl og hjælpe systemet med gradvist at opbygge en model af et ukendt miljø.
AVO blev udviklet som et system til kodeagenter, der kan undersøge arbejde, foretage ændringer, køre kommandoer og validere resultater. Agentens ræsonnement bliver dermed koblet til observerbare resultater: Et forslag kan testes, måles og ændres, hvis det ikke virker, i stedet for blot at blive accepteret, fordi det lyder overbevisende.
Et superviserende lag hjælper med at styre det længere forløb. I stedet for at lade ét modelkald træffe alle beslutninger uden begrænsning kan systemet holde øje med fremdriften, opdage uproduktive retninger og hjælpe med at komme videre, når en antagelse viser sig at være forkert. NVIDIA og relaterede beskrivelser fremhæver netop kombinationen af hukommelse, eksekveringsværktøjer, ekstern feedback og supervision.
Tilsammen giver funktionerne modellen en struktureret måde at udforske, handle, observere og korrigere på. Modellen leverer stadig en stor del af ræsonnementet, men agentlaget afgør, hvordan ræsonnementet omsættes til handling i miljøet.
Sammenligningen er interessant, men resultaterne skal ses i lyset af de forskellige evalueringsopsætninger.
| System eller konfiguration | Rapporteret ARC-AGI-3-resultat | Evalueringskontekst |
|---|---|---|
| AVO med Claude Opus 5 | 100,00 RHAE | Offentlig del; 183 af 183 niveauer gennemført |
| Claude Opus 5 alene | 30,2 % | Offentliggjort leaderboard-oversigt og standardopsætning |
| GPT-5.6 Sol | 7,8 % | Standardiseret eller verificeret sammenligning |
| GPT-5.6 Sol med bevaret ræsonnement og komprimering | 38,3 % | OpenAI-rapporteret specialkørsel på offentlige opgaver |
AVO-resultatet og den selvstændige Opus-score er ikke helt samme type måling. Det første er et komplet agentsystem på den offentlige del af benchmarken, mens det andet er en modelscore i en benchmark-harness. Netop den forskel er central for historien.
GPT-5.6 Sol illustrerer det samme fra en anden vinkel. ARC Prizes offentliggjorte resultater viser Sol på 7,78 procent ved maksimal ræsonneringsindsats, mens OpenAI separat har rapporteret 38,3 procent på offentlige opgaver efter at have bevaret ræsonnementet mellem trinnene og brugt komprimering. Resultaterne kan ikke uden videre erstatte den officielle leaderboard-score, men de viser, hvor stor betydning hukommelse og håndtering af tilstand kan have i en agentbenchmark.
Den mest forsigtige konklusion er derfor ikke, at én model generelt er bedre end alle andre. Det er, at autonom ydeevne i høj grad afhænger af samspillet mellem model, hukommelsespolitik, værktøjsgrænseflade, tilstandshåndtering og evalueringssystem.
AVOs oprindelige arbejdsområde var krævende softwareudvikling og optimering af GPU-kerner. Her skal en agent undersøge en implementering, formulere en ændring, køre hardwarebaserede tests, fortolke performance-feedback og beslutte, hvad der skal prøves bagefter. Succes kræver gentagne eksperimenter – ikke blot én korrekt kodegenerering.
NVIDIA oplyser, at AVO i arbejdet med GPU-kerner udforskede mere end 500 retninger, indsendte 40 kerneversioner og opnåede op til 10,5 procent bedre ydeevne end FlashAttention-4 på DGX B200-systemer.
Det, der kan overføres til ARC-AGI-3, er derfor ikke nødvendigvis specifik viden om GPU-kerner. Det er den eksperimentelle arbejdsform: Generér en kandidat, kør den, mål resultatet, gem det lærte, og skift retning, når data ikke understøtter hypotesen. ARC-AGI-3 har en helt anden brugerflade, men belønner også systemer, der kan opdage struktur gennem gentagen interaktion.
AVO gennemførte efter sigende hele den offentlige del med 6.624 handlinger mod 7.542 for VISTA. Det svarer til en reduktion på omkring 12 procent, mens begge systemer gennemførte de samme 183 niveauer.
Det er vigtigt, fordi ARC-AGI-3's RHAE-metrik ikke kun ser på, om agenten til sidst når frem til en løsning. Den indregner også effektiviteten af handlingerne sammenlignet med menneskelig performance.
Et system, der bruger ubegrænset prøven-og-fejlen, kan altså godt være dygtigt uden at være effektivt. I praktiske miljøer kan overflødige handlinger gøre en agent dyr, langsom eller vanskelig at anvende.
Den mest nyttige læring for virksomheder er arkitektonisk. En pålidelig autonom løsning er næppe blot en sprogmodel, der er koblet til en håndfuld værktøjer. Der er brug for et kontrolleret eksekveringslag omkring modellen.
Det lag kan blandt andet omfatte:
AVO styrker også argumentet for modulære agentstakke. Hvis en stor del af ydeevnen kommer fra agentlaget, kan virksomheder have fordel af at holde hukommelse, værktøjsadaptere, evalueringssuiter, politikstyring og overvågning adskilt fra grundmodellen. Det gør det lettere at sammenligne modeller, skifte leverandør eller tilpasse systemet til en bestemt arbejdsgang uden at bygge hele platformen forfra.
Benchmarkresultatet bør dog ikke opfattes som et bevis på enterprise-pålidelighed. NVIDIAs resultat på 100 procent er rapporteret på ARC-AGI-3's offentlige del. Det dokumenterer ikke tilsvarende performance på skjulte opgaver, produktionsdata eller forretningsprocesser med høj risiko. Uafhængig reproduktion, test på skjulte datasæt, analyser af pris og svartid samt sikkerheds- og evalueringstests er stadig nødvendige.
AVOs resultat flytter fokus fra spørgsmålet: »Hvilken model er smartest?« til et mere praktisk spørgsmål: Hvilket system kan bevare kontekst, bruge værktøjer, lære af feedback og komme sikkert videre gennem en lang arbejdsgang?
Modellen er fortsat vigtig. Men ARC-AGI-3 giver et tydeligt eksempel på, at agentlaget kan afgøre, om modellens evner holder, når den møder et ukendt miljø. For virksomheder, der bygger autonome AI-systemer, kan konkurrencefordelen derfor i stigende grad ligge i kvaliteten af eksekveringssystemet – ikke i selve modelkaldet.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA oplyser, at AVO sammen med Claude Opus 5 opnåede 100,00 RHAE på den offentlige del af ARC AGI 3 og gennemførte alle 183 niveauer i 25 miljøer med 6.624 handlinger.
NVIDIA oplyser, at AVO sammen med Claude Opus 5 opnåede 100,00 RHAE på den offentlige del af ARC AGI 3 og gennemførte alle 183 niveauer i 25 miljøer med 6.624 handlinger. Den vigtigste pointe handler ikke kun om modellen, men om agentlaget: Vedvarende hukommelse, værktøjsbrug, feedback, løbende revision og overvågning gjorde det muligt at fastholde arbejdet over mange trin.