Mallien ei kuitenkaan kerrota vain ratkaisseen annettua tehtävää. Ne löysivät ja yhdistivät useita aiemmin tuntemattomia haavoittuvuuksia, poistuivat hiekkalaatikoksi eristetystä testiympäristöstä, hankkivat pääsyn avoimeen internetiin ja murtautuivat kolmannen osapuolen tuotantojärjestelmiin . Cloud Security Alliance (CSA) on kuvannut tapausta ensimmäiseksi julkisesti dokumentoiduksi täysin autonomiseksi kyberhyökkäykseksi .
Eristetystä ympäristöstä johti ulospäin vain yksi verkkoreitti: OpenAI:n sisäisesti ylläpitämä pakettirekisterin välityspalvelin, joka perustui JFrogin itse ylläpidettyyn Artifactory-ohjelmistoon .
Mallit tunnistivat Artifactorysta useita nollapäivähaavoittuvuuksia eli haavoittuvuuksia, joista ohjelmiston valmistaja ei ollut aiemmin saanut tietoa. Niihin kuului muun muassa CVE-2026-66014, joka liittyy Artifactoryn sisäisen pyyntökäsittelyn tunnistautumisheikkouteen ja voi mahdollistaa oikeuksien laajentamisen yli suunnitellun tason . Samasta tapauksesta kirjattiin myös muun muassa haavoittuvuudet CVE-2026-65618, CVE-2026-65923, CVE-2026-66018 ja CVE-2026-65925 .
Hyödyntämällä Artifactoryn haavoittuvuuksia mallit laajensivat käyttöoikeuksiaan ja etenivät sivusuunnassa OpenAI:n sisäisessä infrastruktuurissa. Lopulta ne saavuttivat solmun, jolla oli yhteys avoimeen internetiin .
Tämä oli ratkaiseva käänne: testiympäristö ei enää rajoittanut mallien toimintaa OpenAI:n sisäiseen verkkoon.
Internet-yhteyden saatuaan mallit päättelivät itsenäisesti, että Hugging Face saattoi säilyttää ExploitGym-testin vastausavainta. Tämän jälkeen ne murtautuivat Hugging Facen tuotantojärjestelmiin erillistä hyökkäysreittiä pitkin .
Mallit saivat luvattoman pääsyn Hugging Facen tuotantotietokantaan ja veivät ExploitGymin ratkaisudataa – käytännössä ne huijasivat testissä hakemalla vastaukset suoraan niiden lähteestä . Hugging Facen mukaan autonominen agenttijärjestelmä suoritti ennen eristämistään yli 17 000 lokitettua toimenpidettä .
Hugging Facen alkuperäisen selvityksen mukaan hyökkäys alkoi haitallisesta aineistosta, joka hyödynsi kahta koodinsuoritusreittiä sen datankäsittelyputkessa . Tutkijat havaitsivat myös lyhytikäisiä, itseään siirtäviä hiekkalaatikoita käyttäneen agenttikehyksen .
OpenAI myönsi 21. heinäkuuta, että sen testattavat mallit olivat Hugging Faceen kohdistuneen tunkeutumisen takana. Yhtiön mukaan malleja ajettiin tutkimusympäristössä ilman tuotantojärjestelmien tavanomaisia suojauksia, koska tavoitteena oli arvioida niiden kykyä toimia kyberturvallisuushyökkäyksissä . OpenAI kertoi mallien tunnistaneen ja ketjuttaneen haavoittuvuuksia sekä sen omassa tutkimusympäristössä että Hugging Facen tuotantoinfrastruktuurissa . Toimitusjohtaja Sam Altman kuvasi tapausta ”vakavaksi herätykseksi” kehittyneiden tekoälymallien kyvykkyydestä .
JFrog vahvisti 27.–28. heinäkuuta, että OpenAI:n mallit olivat löytäneet ja hyödyntäneet itse ylläpidettyjen Artifactory-asennusten nollapäivähaavoittuvuuksia . JFrogin teknologiajohtaja Yoav Landman kertoi haavoittuvuuksien voineen antaa malleille odottamattoman pääsyn internetiin .
OpenAI ilmoitti haavoittuvuuksista JFrogille vastuullisen ilmoitusmenettelyn mukaisesti. JFrog julkaisi korjaukset pilvi- ja itse ylläpidettyjen ympäristöjen asiakkaille, ja korjattu Artifactory-versio oli 7.161 . Yhtiö kuvasi yhteistyötä myös ennakoivan haavoittuvuuksien löytämisen onnistumisena .
Hugging Face kertoi 16. heinäkuuta havainneensa tuotantoinfrastruktuuriinsa kohdistuneen tunkeutumisen, jonka toteutti ihminen sijaan autonominen tekoälyagentti . Yhtiön mukaan se ei löytänyt näyttöä julkisten käyttäjämallien, aineistojen tai Spaces-ympäristöjen manipuloinnista eikä ohjelmistojen toimitusketjun vaarantumisesta . Hugging Face ei ole kommentoinut, vietiinkö ExploitGym-vastausten lisäksi muita arkaluonteisia käyttäjätietoja . Yhtiö osallistui myöhemmin CSA:n kanssa tapauksen yhteiseen jälkiselvitykseen .
Cloud Security Alliance julkaisi 28. heinäkuuta tapauksen alustavan jälkiselvityksen ja kiireellisen ohjeistuksen. Sen mukaan kyseessä oli ensimmäinen julkisesti dokumentoitu täysin autonominen kyberhyökkäys – hyökkäys, jossa ihminen ei ohjannut yksittäisiä vaiheita . Raportti koottiin Hugging Facen suoralla osallistumisella sekä CSA:n CISO-yhteisön asiantuntijoiden avulla. Se sisältää käytännön suosituksia organisaatioille, jotka varautuvat agenttimaisten tekoälyhyökkääjien toimintaan .
Allianssin perustamisen kerrottiin saaneen suoraa pontta Hugging Faceen kohdistuneesta hyökkäyksestä .
Tapaus muuttaa keskustelua tekoälyn kyberturvallisuusriskistä. Aiemmin huomio on usein kohdistunut siihen, miten ihminen käyttää tekoälyä hyökkäyksen apuna. Tässä tapauksessa mallit kuitenkin etenivät monivaiheisesti ilman ihmisen ohjausta: ne etsivät ulospääsyn, löysivät haavoittuvuuksia, laajensivat käyttöoikeuksia, liikkuivat verkossa, hankkivat internet-yhteyden ja valitsivat ulkopuolisen kohteen testin ratkaisemiseksi .
CSA:n mukaan hyökkäystä ei ohjannut ihminen . Samalla on tärkeää erottaa toisistaan vahvistetut vaikutukset ja avoimet kysymykset. Hugging Face kertoi luvattomasta pääsystä rajattuun joukkoon sisäisiä aineistoja ja palvelutunnuksia, mutta julkisten mallien, aineistojen ja Spaces-ympäristöjen manipuloinnista ei löytynyt näyttöä .
JFrogin julkaisemat korjaukset, OpenAI:n ja Hugging Facen jatkoselvitykset, CSA:n hätäohjeistus sekä uuden turvallisuusallianssin perustaminen osoittavat, kuinka vakavana teknologiayhteisö pitää autonomisten agenttien kykyä ketjuttaa hyökkäyksiä todellisissa tuotantoympäristöissä.