NVIDIA uvádí, že AVO s modelem Claude Opus 5 dosáhl v veřejné sadě ARC AGI 3 skóre 100,00 RHAE a dokončil všech 183 úrovní v 25 prostředích za 6 624 akcí. Hlavní lekce se netýká pouze modelu: persistentní paměť, používání nástrojů, revize podle zpětné vazby a dohled pomohly změnit zhruba třicetiprocentní výsledek sa...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA oznámila, že její systém Agentic Variation Operators (AVO) dosáhl v veřejné sadě interaktivního benchmarku ARC-AGI-3 perfektního skóre 100,00 RHAE. Ve spojení s modelem Claude Opus 5 dokončil všech 183 úrovní v 25 prostředích a využil k tomu 6 624 akcí.
Nejzajímavější na výsledku není tvrzení, že by nový základní model náhle vyřešil celý benchmark. Důležitější je, že agentní architektura původně navržená pro softwarové inženýrství a optimalizaci GPU jader se přenesla do zcela odlišné úlohy interaktivního uvažování.
V publikovaném přehledu výsledků měl samotný Claude Opus 5 skóre 30,2 %, zatímco GPT-5.6 Sol dosáhl při standardním nastavení 7,8 %.
Výsledek AVO využil stejný obecný základní model, ale doplnil ho o systém určený k dlouhodobému provádění práce. AVO umí prohlížet a upravovat artefakty, spouštět nástroje a příkazy, vyhledávat v dokumentaci, vyhodnocovat výsledky a podle externí zpětné vazby svůj postup opakovaně měnit.
V praxi tak nejde o jednorázový modelový dotaz a odpověď, ale o smyčku:
To je pro ARC-AGI-3 zásadní. Agent se zde dostává do neznámých interaktivních prostředí a pravidla i cíl musí odhalit postupným zkoumáním. Nestačí tedy odpovědět na dokonale specifikované zadání.
AVO kombinuje několik schopností, které jsou samy o sobě známé, ale při koordinaci během dlouhé úlohy mohou výrazně změnit výsledek.
Persistentní neboli dlouhodobá paměť umožňuje agentovi uchovávat objevy, neúspěšné postupy i důležité informace o stavu. Každý krok tak nemusí začínat od nuly. V benchmarku založeném na průzkumu to může omezit opakování stejných chyb a pomoct systému vytvořit si pracovní model neznámého prostředí.
AVO vzniklo jako systém pro programovací agenty, kteří dokážou prohlížet práci, provádět změny, spouštět příkazy a ověřovat výsledky. Uvažování je proto propojené s tím, co se skutečně stalo: navrženou změnu lze otestovat, změřit a podle výsledku upravit, místo aby byla přijata jen proto, že zní přesvědčivě.
Supervizní vrstva pomáhá řídit delší pracovní proces. Namísto toho, aby jediný modelový dotaz neomezeně ovládal každé další rozhodnutí, může systém sledovat postup, rozpoznat neproduktivní směr a pomoct s návratem ve chvíli, kdy se původní předpoklad ukáže jako chybný. NVIDIA a související popisy AVO ho charakterizují jako spojení paměti, nástrojů pro provádění, externí zpětné vazby a dohledu určené k dlouhodobě autonomní práci.
Dohromady tyto prvky dávají modelu strukturovaný způsob, jak zkoumat, jednat, pozorovat a opravovat vlastní postup. Model stále zajišťuje velkou část uvažování, ale agentní harness — tedy prováděcí a řídicí vrstva kolem modelu — určuje, jak se toto uvažování promítne do práce v prostředí.
Čísla jsou užitečná, ale je nutné číst je spolu s podmínkami měření.
| Systém nebo konfigurace | Uváděný výsledek ARC-AGI-3 | Kontext hodnocení |
|---|---|---|
| AVO s Claude Opus 5 | 100,00 RHAE | Veřejná sada; dokončeno 183 z 183 úrovní |
| Samotný Claude Opus 5 | 30,2 % | Publikovaný přehled výsledků a standardní srovnávací nastavení |
| GPT-5.6 Sol | 7,8 % | Standardní nebo ověřené srovnávací nastavení |
| GPT-5.6 Sol s uchováním uvažování a kompakcí | 38,3 % | Vlastní běh OpenAI na veřejných úlohách |
Výsledky AVO a samotného Opusu 5 nejsou zcela stejným typem měření. První představuje výsledek kompletního agentního systému na veřejné sadě, druhý skóre modelu v rámci benchmarkového harnessu. Právě tento rozdíl je pro celý příběh klíčový.
GPT-5.6 Sol ukazuje stejný problém z opačné strany. ARC Prize uvádí pro Sol při maximálním úsilí skóre 7,78 %, zatímco OpenAI samostatně oznámila 38,3 % na veřejných úlohách po zachování uvažování mezi jednotlivými kroky a použití kompaktace. Nejde o přímou náhradu oficiálního skóre v žebříčku, ale výsledek ukazuje, jak výrazně může paměť a správa stavu ovlivnit výkon agenta.
Nejopatrnější závěr proto nezní, že jeden model je obecně lepší než jiný. Výkon autonomního systému do značné míry závisí na kombinaci modelu, pravidel práce s pamětí, rozhraní nástrojů, správy stavu a vyhodnocovacího harnessu.
Původním prostředím AVO bylo náročné softwarové inženýrství a optimalizace GPU jader. Agent v takové úloze musí prozkoumat implementaci, navrhnout změnu, spustit testy založené na skutečném chování hardwaru, vyhodnotit výkonnostní zpětnou vazbu a rozhodnout, co vyzkouší dál. Úspěch vyžaduje opakované experimentování, nikoli jediné správné vygenerování kódu.
NVIDIA uvádí, že AVO v této práci prozkoumalo více než 500 směrů, uložilo 40 verzí jader a na systémech DGX B200 dosáhlo až o 10,5 % lepšího výkonu než FlashAttention-4.
Přenositelnou schopností tedy nemusí být znalost GPU jader. Podstatný je experimentální proces: vytvořit kandidátní řešení, spustit ho, změřit výsledek, uchovat získané poznatky a změnit směr, když důkazy odporují původní hypotéze. ARC-AGI-3 má jiné rozhraní, ale také odměňuje agenty, kteří dokážou strukturu úlohy odhalovat opakovanou interakcí.
AVO podle zveřejněných údajů vyřešilo celou veřejnou sadu za 6 624 akcí v prostředí, zatímco u systému VISTA bylo uvedeno 7 542 akcí. Při dokončení stejných 183 úrovní to představuje snížení přibližně o 12 %.
To je důležité proto, že metrika RHAE v ARC-AGI-3 zohledňuje efektivitu akcí ve srovnání s lidským výkonem, nejen to, zda agent nakonec dospěje k úspěšnému stavu. Dlouhodobý agent proto musí průzkum řídit opatrně: příliš mnoho pokusů a omylů může jinak schopný systém prodražit, zpomalit nebo učinit nepraktickým.
Pro podnikové nasazení je nejcennější architektonická lekce. Spolehlivý autonomní systém pravděpodobně nebude jen jazykový model připojený k několika nástrojům. Potřebuje řízenou prováděcí vrstvu kolem modelu.
Ta může zahrnovat:
AVO zároveň posiluje argument pro modulární agentní stacky. Pokud významná část výkonu pochází z harnessu, mohou firmy oddělit paměť, adaptéry nástrojů, testovací sady, pravidla, řízení oprávnění a observabilitu od samotného základního modelu. Snáze pak porovnají různé modely, změní poskytovatele nebo systém upraví pro konkrétní pracovní postup, aniž by musely stavět celou infrastrukturu znovu.
Výsledek benchmarku však nelze chápat jako důkaz spolehlivosti v reálném provozu. Údaj 100 % se týká výsledku, který NVIDIA uvádí pro veřejnou sadu ARC-AGI-3. Nedokazuje stejnou úspěšnost na neveřejných úlohách, produkčních datech ani v rizikových podnikových procesech. Stále jsou zapotřebí nezávislé replikace, testování na skrytých datech, analýza nákladů a latence, bezpečnostní prověrky a hodnocení rizik.
AVO posouvá pozornost od otázky „Který model je nejchytřejší?“ k praktičtější otázce: Který systém dokáže uchovat kontext, používat nástroje, učit se ze zpětné vazby a spolehlivě se zotavit během dlouhého pracovního procesu?
Model zůstává důležitý. ARC-AGI-3 ale názorně ukazuje, že o tom, zda se jeho schopnosti udrží při kontaktu s neznámým prostředím, může rozhodovat okolní harness. Pro firmy budující autonomní AI tak může konkurenční výhoda stále více spočívat v kvalitě prováděcího systému — nikoli v samotném volání modelu.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA uvádí, že AVO s modelem Claude Opus 5 dosáhl v veřejné sadě ARC AGI 3 skóre 100,00 RHAE a dokončil všech 183 úrovní v 25 prostředích za 6 624 akcí.
NVIDIA uvádí, že AVO s modelem Claude Opus 5 dosáhl v veřejné sadě ARC AGI 3 skóre 100,00 RHAE a dokončil všech 183 úrovní v 25 prostředích za 6 624 akcí. Hlavní lekce se netýká pouze modelu: persistentní paměť, používání nástrojů, revize podle zpětné vazby a dohled pomohly změnit zhruba třicetiprocentní výsledek samotného modelu v kompletní výsledek celého systému.