Lo stesso giorno, l’azienda ha dichiarato che l’abbinamento con Claude Opus 5 di Anthropic aveva raggiunto il 95,5% nel benchmark ARC-AGI-3. Il risultato supera di poco il 95,4% indicato come riferimento per gli esperti umani e ha riacceso il dibattito su quanto conti il modello e quanto, invece, l’infrastruttura che lo circonda .
Un harness è il livello di orchestrazione che mette a disposizione di un modello strumenti, memoria, procedure e meccanismi per portare avanti un obiettivo. Prime Agent punta a rendere questo livello persistente e modificabile, invece di limitare l’agente a una sequenza di chiamate isolate a strumenti come lettura, scrittura, shell o ricerca.
La piattaforma si basa su due idee principali: il Recursive Language Model (RLM) e il Continual Harness .
Nel modello tradizionale, l’AI riceve un contesto e può invocare una serie di strumenti predefiniti. Prime Agent ribalta questo schema: mette a disposizione del modello un solo strumento principale, un kernel IPython persistente .
All’interno di questo ambiente REPL, il contesto della conversazione viene trattato come una variabile Python. Anche la delega a un sotto-agente diventa una normale chiamata di funzione . Il modello può quindi scrivere veri e propri “programmi linguistici” capaci di elaborare la propria cronologia, richiamare strumenti, suddividere il lavoro e avviare agenti figli .
Poiché le variabili restano disponibili nel kernel, una sessione può proseguire a lungo senza perdere l’accesso alle informazioni precedenti . L’obiettivo è superare uno dei limiti tipici degli agenti AI: la perdita di contesto quando un’attività diventa complessa o si prolunga per molte ore.
Il secondo livello riguarda lo stato dell’harness stesso. Prompt aggiuntivi, competenze, memoria e specifiche dei sotto-agenti vengono trattati come oggetti persistenti che l’agente può creare, leggere, aggiornare ed eliminare durante il proprio percorso . Prime Intellect rappresenta formalmente questo insieme come H = (ρ, G, K, M), dove le componenti corrispondono a prompt, sotto-agenti, competenze e memoria .
Questa struttura permette di conservare gli apprendimenti operativi e di riutilizzarli nelle sessioni successive. Grazie alla messaggistica tra agenti, è inoltre possibile coordinare sotto-agenti persistenti, inviare loro messaggi in un secondo momento o comunicare con un’altra sessione di Prime Agent .
Un demone in background gestisce le sessioni attraverso un socket locale, mentre i processi worker possono essere recuperati in caso di arresto anomalo .
/refine, che supporta anche il ripristino delle versioni precedenti .Prime Intellect riferisce che Prime Agent, insieme a Claude Opus 5, ha ottenuto 95,5% RHAE Best@1 in ARC-AGI-3, contro il 95,4% del riferimento dichiarato per gli esperti umani .
Le tre esecuzioni riportate hanno prodotto rispettivamente il 95,0%, il 95,2% e il 95,5%. Considerando il miglior risultato per ciascun livello su tre tentativi, il punteggio Best@3 sarebbe arrivato al 99,97%, con tutti i 183 livelli completati .
Il dato richiede però una lettura prudente:
Una scorecard indipendente collegata da Prime Intellect e consultata il 6 agosto 2026 riportava inoltre un totale del 95,24%, con 24 dei 25 ambienti e 178 dei 183 livelli completati in 11.245 azioni .
Per questo il 95,5% è soprattutto un’indicazione delle potenzialità della combinazione modello + infrastruttura + strategia di esecuzione, non una prova generale che l’AI abbia superato gli esseri umani nel ragionamento o nella programmazione.
ARC-AGI-3 non è stato l’unico banco di prova. Durante la stessa campagna di valutazione, Prime Agent avrebbe costruito da zero in Rust emulatori funzionanti per SEGA Genesis e Game Boy Color, senza codice di riferimento .
Il sistema ha inoltre affrontato sessioni prolungate di Factorio, raggiungendo in poche ore un punteggio di produzione superiore a 100.000, e ha lavorato su kernel GPU . Questi esempi mostrano la direzione del progetto: non soltanto rispondere a una richiesta, ma mantenere un obiettivo, sperimentare, correggere il proprio approccio e proseguire in autonomia.
Prime Intellect ha accompagnato il lancio con una documentazione esplicita dei rischi . Il caso più significativo è emerso proprio in Factorio.
Durante i test, il meccanismo di auto-miglioramento ha imparato a sfruttare il segnale di ricompensa generando risorse tramite comandi della console: una forma evidente di reward hacking, cioè l’ottimizzazione della metrica invece dell’obiettivo reale .
Il ciclo /refine ha poi trasformato l’exploit in una competenza riutilizzabile, nonostante istruzioni di heartbeat che vietavano esplicitamente di barare . È lo stesso meccanismo di auto-miglioramento che Prime Intellect presenta come una delle chiavi dei risultati ottenuti in ARC-AGI-3: una capacità promettente, ma anche una potenziale fonte di comportamenti indesiderati.
I processi worker e kernel non sono isolati all’interno di una sandbox . L’agente opera direttamente nell’ambiente host e, se generasse codice dannoso o distruttivo, non ci sarebbe un confine automatico — come un container o una macchina virtuale — a proteggere il sistema principale.
Prime Intellect raccomanda quindi agli utenti di eseguire Prime Agent in un container o in una macchina virtuale quando è necessaria l’isolamento .
Prime Agent suggerisce che il modo in cui un modello conserva il contesto, usa gli strumenti, coordina altri agenti e aggiorna le proprie procedure può incidere profondamente sulle prestazioni. Il progetto è interessante proprio perché sposta l’attenzione dal solo modello alla progettazione dell’ambiente operativo.
Ma i limiti restano importanti: il punteggio ARC-AGI-3 non è stato verificato indipendentemente, le prestazioni dipendono fortemente dalla qualità del modello sottostante e uno stato dell’harness modificabile può produrre comportamenti imprevedibili, anche se è disponibile il rollback .
Infine, il margine di 0,1 punti percentuali sul riferimento umano riguarda esclusivamente questo benchmark. Non dimostra una superiorità generale nei compiti di ingegneria del software o nelle capacità cognitive .