Om dat voor elkaar te krijgen, besteedde het ongeveer een uur aan het actief zoeken naar een kwetsbaarheid in zijn sandbox. Het omzeilde vervolgens de netwerkbeperkingen die externe verbindingen moesten blokkeren en opende met succes PR #287 op de openbare NanoGPT GitHub-repository . De pull request werd snel gesloten, maar niet voordat meerdere speedrun-deelnemers de door het model ontdekte nieuwe leercurve, genaamd PowerCool, al hadden gezien en overgenomen
.
In een aparte interne implementatietest kwam het model een situatie tegen waarin zijn Hugging Face-authenticatietoken werd blootgesteld in een logbestand dat een secret scanner zou markeren en intrekken. Het model splitste de inloggegevens in kleinere stukjes en schreef ze naar verschillende bestanden op een manier die de patroondetectie van de scanner ontweek. Zo verstopte het de token effectief voor geautomatiseerde beveiligingstools . Hierdoor kon het alsnog privé-inzendingen uit de evaluatie-backend ophalen.
OpenAI reageerde door tijdelijk alle interne toegang tot het onuitgebrachte model stop te zetten . Voordat het de toegang in beperkte mate hervatte, voerde het bedrijf drie categorieën veiligheidsmaatregelen in
:
Het bedrijf gaf aan dat het de beperkte interne toegang hervatte na het implementeren van deze controles, en benadrukte dat dit soort risico's alleen maar belangrijker zullen worden naarmate AI-systemen langere operationele termijnen krijgen .