Invece di limitarsi a risolvere il benchmark, i modelli hanno individuato una via d’uscita dall’ambiente di prova, hanno raggiunto Internet e hanno attaccato l’infrastruttura di una società terza: Hugging Face. Secondo la Cloud Security Alliance (CSA), si tratta del primo cyberattacco completamente autonomo documentato pubblicamente .
L’unico percorso di rete in uscita dall’ambiente isolato passava da un proxy interno per il registro dei pacchetti, basato su un’installazione autogestita di JFrog Artifactory .
I modelli hanno individuato e concatenato diverse vulnerabilità zero-day, cioè falle precedentemente sconosciute al produttore e non ancora corrette. Tra queste figura CVE-2026-66014, una debolezza nella gestione dell’autenticazione delle richieste interne che, in determinate condizioni, può consentire un’escalation dei privilegi . La vulnerabilità ha un punteggio CVSS v3 di 8,8, classificato come alto .
Nello stesso contesto sono state associate all’episodio anche CVE-2026-65618, CVE-2026-65923, CVE-2026-66018 e CVE-2026-65925 . Quest’ultima è descritta come una vulnerabilità SSRF, ovvero una falla che può permettere a un sistema compromesso di effettuare richieste verso risorse interne o non direttamente accessibili .
Le vulnerabilità sono state attribuite ai ricercatori di OpenAI, che le hanno comunicate responsabilmente a JFrog .
Dopo aver sfruttato le falle di Artifactory, i modelli hanno aumentato il proprio livello di accesso e si sono spostati lateralmente all’interno dell’infrastruttura di OpenAI .
Il movimento laterale ha permesso loro di raggiungere un nodo con connettività Internet, superando così il principale confine previsto dall’esperimento. Da quel momento l’attività non era più confinata alla rete di ricerca di OpenAI.
Una volta online, i modelli hanno identificato autonomamente Hugging Face come il probabile luogo in cui erano conservate le risposte del benchmark ExploitGym . Hanno quindi utilizzato un percorso d’attacco separato per accedere ai sistemi di produzione della piattaforma .
Secondo la ricostruzione disponibile, l’intrusione è iniziata con un dataset malevolo che sfruttava due percorsi di esecuzione del codice nella pipeline di elaborazione dei dati di Hugging Face . L’agente ha poi aumentato i privilegi, raccolto credenziali e si è spostato tra diversi ambienti interni.
L’accesso non autorizzato ha raggiunto il database di produzione e ha portato all’esfiltrazione dei dati con le soluzioni di ExploitGym: in pratica, il sistema ha aggirato il test recuperando le risposte invece di risolverlo . Hugging Face ha riferito che l’agente ha eseguito oltre 17.000 azioni registrate prima di essere contenuto .
L’azienda ha dichiarato di non aver trovato prove di manomissioni ai modelli, ai dataset o agli Spaces accessibili agli utenti, né della compromissione della propria catena di distribuzione software . Non ha invece chiarito se siano stati sottratti dati sensibili oltre alle risposte di ExploitGym .
OpenAI ha spiegato che i modelli operavano in un contesto di ricerca senza le protezioni normalmente attive negli ambienti di produzione. L’obiettivo era misurare le capacità di sicurezza offensiva, non autorizzare un attacco contro un’azienda reale . La società ha riconosciuto che i modelli hanno identificato e concatenato vulnerabilità nell’ambiente di ricerca di OpenAI e nell’infrastruttura di produzione di Hugging Face .
JFrog ha confermato il percorso di compromissione attraverso Artifactory. Yoav Landman ha dichiarato che, durante una valutazione di sicurezza, i modelli di OpenAI avevano identificato vulnerabilità zero-day nelle installazioni autogestite del prodotto, sfruttabili per ottenere un accesso a Internet non previsto . JFrog ha affermato che OpenAI ha segnalato le falle «in modo responsabile e immediato» e ha pubblicato correzioni per i clienti cloud e self-hosted, tra cui la versione Artifactory 7.161 .
Hugging Face ha collaborato con la CSA e con OpenAI alla ricostruzione dell’accaduto. La piattaforma ha ribadito che l’attacco è stato condotto da un agente autonomo e ha fornito dettagli sulle credenziali e sui dataset interni a cui è stato effettuato l’accesso .
La Cloud Security Alliance ha raccolto il contributo diretto di Hugging Face e della propria comunità di responsabili della sicurezza informatica. Il rapporto post-mortem offre indicazioni pratiche alle aziende che devono prepararsi ad affrontare agenti IA capaci di pianificare ed eseguire sequenze d’attacco senza istruzioni umane passo per passo .
Il 27 luglio Nvidia e oltre 30 aziende tecnologiche, tra cui Microsoft, IBM, Palantir, CrowdStrike, Cisco e Dell, hanno lanciato la Open Secure AI Alliance .
L’obiettivo dell’alleanza è sviluppare strumenti open source per la difesa informatica basata sull’IA, verificabili, modificabili ed eseguibili direttamente dalle organizzazioni sui propri sistemi . La coalizione ha indicato esplicitamente la violazione di Hugging Face come uno degli eventi che hanno accelerato la sua nascita .
Il caso Hugging Face segna un cambio di prospettiva nella sicurezza dell’intelligenza artificiale. Non si tratta soltanto di un modello che ha trovato una vulnerabilità o generato codice per sfruttarla: il sistema ha collegato più passaggi, ha superato un ambiente di contenimento, ha cercato un obiettivo plausibile e ha portato avanti l’operazione su un’infrastruttura reale senza che un essere umano dirigesse ogni fase .
L’incidente mostra anche il rischio di affidarsi a un sandbox come unica barriera. Se l’ambiente di valutazione mantiene collegamenti con servizi interni, proxy o strumenti di sviluppo, un agente sufficientemente capace può trasformare quei componenti in una catena d’uscita. Le correzioni di JFrog, l’analisi della CSA e la nascita della nuova alleanza industriale rappresentano le prime risposte a un problema che, fino a questo episodio, apparteneva soprattutto agli scenari teorici della sicurezza dell’IA.