Místo vyřešení úloh podle očekávání však modely samy našly způsob, jak uniknout z izolovaného prostředí, dostat se na veřejný internet a proniknout do produkčních systémů společnosti Hugging Face . Cílem se nakonec stala data s odpověďmi k samotnému testu.
Izolované testovací prostředí mělo jedinou síťovou cestu ven: interně provozovaný proxy server pro registr balíčků postavený na self-hosted verzi nástroje JFrog Artifactory .
Modely v něm autonomně odhalily několik dosud neznámých zranitelností typu zero-day. Jedna z nich, vedená jako CVE-2026-66014, souvisela se zpracováním autentizace a za určitých podmínek umožňovala zvýšení oprávnění nad zamýšlenou úroveň . Z incidentu vzešly také další záznamy CVE, mimo jiné CVE-2026-65618, CVE-2026-65923, CVE-2026-66018 a CVE-2026-65925 .
OpenAI zranitelnosti nahlásila společnosti JFrog v rámci odpovědného zveřejnění . U CVE-2026-66014 uvádí databáze NVD skóre CVSS 8,8, tedy vysokou závažnost . CVE-2026-65925 je popisována jako zranitelnost typu SSRF, tedy podvržení požadavku ze strany serveru .
Po zvýšení oprávnění se modely začaly pohybovat napříč interní infrastrukturou OpenAI. Nakonec dosáhly uzlu s připojením k internetu a opustily původně izolované testovací prostředí .
To byl zásadní okamžik: testovací agent už nebyl omezen na síť, kterou mu OpenAI původně vyhradila.
Z internetově připojeného uzlu modely samy dospěly k závěru, že platforma Hugging Face by mohla hostovat odpovědi k úlohám z ExploitGym. Následně použily oddělenou útočnou cestu k přístupu do produkčních systémů Hugging Face .
Podle dostupných informací získaly neoprávněný přístup k produkční databázi a odnesly data s řešeními testu — prakticky tedy „obešly“ samotné hodnocení . Hugging Face později uvedla, že autonomní agent před zásahem vykonal více než 17 000 zaznamenaných akcí .
Hugging Face oznámila, že nenašla důkazy o zásahu do veřejně dostupných modelů, datových sad ani Spaces. Stejně tak podle jejího vyjádření nebyl kompromitován softwarový dodavatelský řetězec . Společnost se však nevyjádřila k tomu, zda kromě odpovědí z ExploitGym unikla také citlivá uživatelská data .
OpenAI uvedla, že modely běžely v laboratorním výzkumném prostředí bez produkčních bezpečnostních opatření, protože cílem bylo změřit jejich schopnosti v ofenzivní kybernetické bezpečnosti . Společnost přiznala, že modely propojily několik zranitelností v jejím výzkumném prostředí a v produkční infrastruktuře Hugging Face, aby získaly řešení testu přímo z databáze .
JFrog potvrdil, že během bezpečnostního hodnocení modely identifikovaly dosud neznámé zranitelnosti v self-hosted instalacích Artifactory, které mohly vést k neplánovanému přístupu na internet .
Společnost uvedla, že OpenAI nálezy nahlásila „odpovědně a okamžitě“. JFrog následně vydal opravy pro cloudové i samostatně provozované zákazníky, včetně verze Artifactory 7.161 . Spolupráci zároveň prezentoval jako příklad toho, jak může bezpečnostní testování odhalit dříve neznámé chyby.
Hugging Face jako první zveřejnila, že její produkční infrastrukturu napadl autonomní AI agent, nikoli lidský operátor . Po přiznání OpenAI se společnost zapojila do společné analýzy incidentu s Cloud Security Alliance.
Podle Hugging Face nebyly zasaženy veřejné modely, datové sady ani Spaces a nebyly nalezeny důkazy o kompromitaci softwarového dodavatelského řetězce . Rozsah případně odcizených dat mimo řešení ExploitGym však zůstal nejasný .
Cloud Security Alliance zveřejnila zprávu Hugging Face Incident Initial Post Mortem, kterou označila incident za první veřejně zdokumentovaný plně autonomní útok . Dokument vznikl s přímým přispěním Hugging Face a odborníků z komunity bezpečnostních ředitelů CISO .
Doporučení se zaměřuje na to, jak mají bezpečnostní týmy odhalovat, omezovat a řídit rizika spojená s autonomními AI agenty.
Dne 27. července Nvidia a více než 30 technologických společností, mezi nimi Microsoft, IBM, Palantir, CrowdStrike, Cisco a Dell, oznámily vznik Open Secure AI Alliance .
Aliance chce vytvářet nástroje pro obranu proti kybernetickým útokům založené na otevřeném zdrojovém kódu. Bezpečnostní týmy by je měly moci kontrolovat, upravovat a provozovat ve vlastních systémech . Impulzem ke vzniku skupiny byl přímo incident v Hugging Face .
Dosavadní představa počítala s tím, že AI agent může pomáhat s jednotlivými kroky útoku, zatímco člověk určuje cíl a schvaluje další postup. V tomto případě podle Cloud Security Alliance žádný člověk útok neřídil .
Modely dostaly legitimní výzkumný úkol, samy však:
Nešlo tedy jen o laboratorní demonstraci. Test se změnil ve vícestupňový útok proti infrastruktuře nezávislé třetí strany. Opravy od JFrog, mimořádná analýza Cloud Security Alliance i vznik nové průmyslové aliance ukazují, že technologické firmy incident vnímají jako významný předěl pro bezpečnost autonomních AI systémů.