NVIDIA kertoo AVO:n ja Claude Opus 5:n suorittaneen ARC AGI 3:n julkisen aineiston kaikki 183 tasoa 25 ympäristössä 6 624 toiminnolla ja saavuttaneen tuloksen 100,00 RHAE. Keskeinen oppi koskee mallin ympärille rakennettua agenttijärjestelmää: pitkäkestoinen muisti, työkalujen käyttö, palautteeseen perustuva korjaam...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA kertoo Agentic Variation Operators (AVO) -järjestelmän saavuttaneen ARC-AGI-3:n interaktiivisen vertailutestin julkisessa aineistossa täydet 100,00 RHAE-pistettä. Claude Opus 5:n kanssa toiminut AVO suoritti kaikki 183 tasoa 25 ympäristössä käyttäen 6 624 toimintoa.
Yllättävintä ei ole se, että jokin uusi perustamalli olisi yhtäkkiä ratkaissut testin. Olennaisempaa on, että ohjelmistosuunnitteluun ja GPU-ytimien optimointiin kehitetty pitkäkestoisten tehtävien agenttiarkkitehtuuri siirrettiin aivan toisenlaiseen, vuorovaikutteiseen päättelytehtävään.
Julkaistussa ARC-AGI-3-tulosten vertailussa Claude Opus 5:n tulos oli 30,2 prosenttia, kun GPT-5.6 Sol saavutti standardoidussa asetelmassa 7,8 prosenttia.
NVIDIAn täydellinen tulos syntyi, kun samaa yleisen tason mallia käytettiin AVO:n kaltaisen suoritusjärjestelmän osana. Järjestelmä pystyy tutkimaan ja muokkaamaan artefakteja, suorittamaan työkaluja ja komentoja, lukemaan dokumentaatiota, arvioimaan lopputuloksia sekä muuttamaan toimintatapaansa ulkoisen palautteen perusteella.
Käytännössä AVO korvaa kertaluonteisen kysymys–vastausmallin jatkuvalla silmukalla:
Tällainen toimintatapa on ARC-AGI-3:ssa erityisen tärkeä. Agentti joutuu tutkimaan ennestään tuntemattomia ympäristöjä ja päättelemään niiden säännöt ja tavoitteet vuorovaikutuksen kautta – ei vain vastaamaan valmiiksi määriteltyyn kehotteeseen.
AVO yhdistää useita ominaisuuksia, jotka ovat yksittäin tuttuja mutta muodostavat yhdessä tehokkaan kokonaisuuden pitkissä tehtävissä.
Pysyvän muistin ansiosta agentti voi säilyttää löydöksiä, epäonnistuneita lähestymistapoja ja muuta hyödyllistä tilatietoa sen sijaan, että jokainen siirto käsiteltäisiin irrallisena keskusteluvuorona. Tutkimiseen perustuvassa testissä tämä voi vähentää samojen virheiden toistamista ja auttaa rakentamaan toimivan mallin vieraasta ympäristöstä.
AVO kehitettiin koodausagentiksi, joka voi tutkia työn jälkeä, tehdä muutoksia, suorittaa komentoja ja varmistaa lopputuloksen. Agentin päättely kytkeytyy näin havaittaviin tuloksiin: ehdotusta voidaan testata ja mitata, eikä sitä hyväksytä vain siksi, että se kuulostaa uskottavalta.
Valvontakerros auttaa koordinoimaan pitkää työskentelyprosessia. Sen sijaan, että yksi mallikutsu hallitsisi kaikkia päätöksiä loputtomasti, järjestelmä voi seurata etenemistä, tunnistaa tehottomat suunnat ja auttaa palautumaan, kun jokin oletus osoittautuu vääräksi. NVIDIA ja järjestelmää käsittelevät kuvaukset korostavat muistin, suoritusvälineiden, ulkoisen palautteen ja valvonnan yhdistelmää pitkäkestoisessa autonomisessa työssä.
Yhdessä nämä osat antavat mallille rakenteisen tavan tutkia, toimia, havainnoida ja korjata. Malli tuottaa edelleen suuren osan päättelystä, mutta agenttijärjestelmä ratkaisee, miten päättely viedään käytäntöön ympäristössä.
Tuloksia on hyödyllistä verrata, mutta pisteiden yhteydessä on huomioitava niiden erilaiset arviointiasetukset.
| Järjestelmä tai kokoonpano | Raportoitu ARC-AGI-3-tulos | Arviointikonteksti |
|---|---|---|
| AVO ja Claude Opus 5 | 100,00 RHAE | Julkinen aineisto; 183/183 tasoa suoritettu |
| Claude Opus 5 yksin | 30,2 % | Julkaistu tuloslistan tilannekuva ja standardoitu vertailuasetelma |
| GPT-5.6 Sol | 7,8 % | Standardoitu tai varmennettu puoliksi yksityinen vertailu |
| GPT-5.6 Sol, päättelyn säilytys ja tiivistys käytössä | 38,3 % | OpenAI:n raportoima oma ajo julkisilla tehtävillä |
AVO:n ja itsenäisen Opus-tuloksen luvut eivät ole täysin samaa mittausta. Ensimmäinen on kokonaisen agenttijärjestelmän tulos julkisessa aineistossa, kun taas jälkimmäinen on mallin tulos vertailutestin vakioidussa kehyksessä. Tämä ero on koko tapauksen kannalta ratkaiseva.
GPT-5.6 Sol havainnollistaa samaa asiaa toisesta näkökulmasta. ARC Prize listasi Solille 7,78 prosentin tuloksen enimmäispäättelyn asetuksella, kun OpenAI raportoi erillisessä kokeessa 38,3 prosentin tuloksen julkisilla tehtävillä säilyttämällä päättelytilan vuorojen välillä ja käyttämällä tiivistystä. Kyse ei ole virallisen tuloslistan kanssa yksi yhteen vertailukelpoisesta korvaavasta luvusta, mutta tulos osoittaa, kuinka paljon muisti ja tilan käsittely voivat vaikuttaa agenttien vertailutesteissä.
Varovaisin johtopäätös ei siis ole, että jokin malli olisi kaikissa tilanteissa muita parempi. Pikemminkin autonominen suorituskyky riippuu merkittävästi mallin, muistipolitiikan, työkalurajapinnan, tilanhallinnan ja arviointikehyksen yhteistoiminnasta.
AVO:n alkuperäinen käyttökohde oli vaativa ohjelmistosuunnittelu ja GPU-ytimien optimointi. Tällaisessa työssä agentin on tutkittava toteutusta, ehdotettava muutosta, suoritettava laitteistoon perustuvia testejä, tulkittava suorituskykypalautetta ja päätettävä, mitä kokeillaan seuraavaksi. Onnistuminen vaatii toistuvia kokeita, ei yhtä täydellistä koodintuotosta.
NVIDIAn mukaan AVO tutki tässä työssä yli 500 suuntaa, vei eteenpäin 40 ytimen versiota ja saavutti DGX B200 -järjestelmissä parhaimmillaan 10,5 prosenttia paremman suorituskyvyn kuin FlashAttention-4.
Siirrettävä kyvykkyys ei välttämättä ole GPU-ytimien tuntemus. Se on kokeellinen prosessi: ehdokkaan luominen, sen suorittaminen, tuloksen mittaaminen, opitun säilyttäminen ja suunnan vaihtaminen, jos näyttö ei tue alkuperäistä hypoteesia. ARC-AGI-3 käyttää erilaista käyttöliittymää, mutta palkitsee samalla tavoin agentteja, jotka pystyvät löytämään rakenteen toistuvan vuorovaikutuksen kautta.
AVO:n kerrotaan ratkaisseen koko julkisen aineiston 6 624 ympäristötoiminnolla, kun VISTA:n vastaava raportoitu määrä oli 7 542. Toimintojen määrä väheni näin noin 12 prosenttia, vaikka molemmat järjestelmät suorittivat samat 183 tasoa.
Tällä on merkitystä, koska ARC-AGI-3:n RHAE-mittari huomioi tehtävien ratkaisemisen lisäksi toimintojen tehokkuuden suhteessa ihmisen suoritukseen. Pitkäkestoisen agentin on siis hallittava tutkimistaan huolellisesti: liiallinen kokeilu voi tehdä muuten kyvykkäästä järjestelmästä hitaan, kalliin tai käytännössä hankalan.
Yrityksille tärkein oppi on arkkitehtuurissa. Luotettava autonominen järjestelmä ei todennäköisesti ole vain kielimalli, jolle annetaan muutama työkalu. Mallin ympärille tarvitaan hallittu suorituskerros.
Tähän kerrokseen voivat kuulua esimerkiksi:
AVO vahvistaa myös modulaaristen agenttipinojen perustelua. Jos suuri osa suorituskyvyn kasvusta tulee mallin ympärillä olevasta järjestelmästä, organisaatioiden kannattaa pitää muisti, työkalusovittimet, arviointikokonaisuudet, käytäntöjen valvonta ja havainnointi erillään perustamallista. Silloin malleja on helpompi vertailla ja palveluntarjoajaa vaihtaa ilman, että koko tekninen pino rakennetaan uudelleen.
Vertailutulosta ei silti pidä tulkita todisteeksi yrityskäyttöön soveltuvasta luotettavuudesta. NVIDIAn 100 prosentin tulos on raportoitu ARC-AGI-3:n julkisesta aineistosta. Se ei osoita vastaavaa suorituskykyä yksityisissä tehtävissä, tuotantodatalla tai korkean riskin liiketoimintaprosesseissa. Tarvitaan edelleen riippumatonta toistoa, piilotettujen testiaineistojen arviointia, kustannus- ja viiveanalyysiä sekä turvallisuus- ja tietoturvatestausta.
AVO:n tulos siirtää huomion kysymyksestä ”mikä malli on älykkäin?” käytännöllisempään kysymykseen: mikä järjestelmä pystyy säilyttämään kontekstin, käyttämään työkaluja, oppimaan palautteesta ja palautumaan virheistä pitkän työnkulun aikana?
Malli on edelleen tärkeä, mutta ARC-AGI-3 tarjoaa havainnollisen esimerkin siitä, että ympäröivä agenttijärjestelmä voi ratkaista, säilyykö mallin kyvykkyys, kun se joutuu toimimaan oudossa ja ennestään tuntemattomassa ympäristössä. Autonomista tekoälyä rakentaville organisaatioille kilpailuetu saattaa yhä useammin löytyä suoritusjärjestelmän laadusta – ei yksittäisestä mallikutsusta.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA kertoo AVO:n ja Claude Opus 5:n suorittaneen ARC AGI 3:n julkisen aineiston kaikki 183 tasoa 25 ympäristössä 6 624 toiminnolla ja saavuttaneen tuloksen 100,00 RHAE.
NVIDIA kertoo AVO:n ja Claude Opus 5:n suorittaneen ARC AGI 3:n julkisen aineiston kaikki 183 tasoa 25 ympäristössä 6 624 toiminnolla ja saavuttaneen tuloksen 100,00 RHAE. Keskeinen oppi koskee mallin ympärille rakennettua agenttijärjestelmää: pitkäkestoinen muisti, työkalujen käyttö, palautteeseen perustuva korjaaminen ja valvonta voivat nostaa yksittäisen mallin tuloksen aivan uudelle...