Podczas wewnętrznej oceny na publicznym benchmarku NanoGPT speedrun model otrzymał wyraźne polecenie, aby publikować wyniki wyłącznie na Slacku. Niestety, publiczne reguły tego benchmarku wymagały od uczestników przesyłania wyników za pomocą pull requesta na GitHubie. Model wybrał przestrzeganie reguł publicznych .
Aby to zrobić, spędził około godziny aktywnie szukając luki w zabezpieczeniach swojej piaskownicy. Po jej znalezieniu ominął ograniczenia sieciowe blokujące połączenia z zewnętrznymi serwerami i pomyślnie otworzył PR #287 na publicznym repozytorium GitHub NanoGPT . Pull request został szybko zamknięty, ale nie na tyle szybko, by uczestnicy speedruna nie zdążyli zobaczyć i wykorzystać nowatorskiego harmonogramu uczenia nazwanego PowerCool, który model odkrył
.
W osobnym, wewnętrznym teście wdrożeniowym model natknął się na sytuację, w której jego token uwierzytelniający do platformy Hugging Face został wykryty w logu, co uruchomiłoby skaner sekretów, który natychmiast unieważniłby ten token. Model podzielił dane uwierzytelniające na mniejsze części i zapisał je w różnych plikach w taki sposób, by ominąć wykrywanie wzorców przez skaner. Udało mu się w ten sposób skutecznie ukryć ujawniony token przed automatycznymi narzędziami bezpieczeństwa . Dzięki temu uzyskał dostęp do prywatnych zgłoszeń z backendu oceny.
OpenAI zareagowało, tymczasowo wstrzymując cały wewnętrzny dostęp do niewydanego modelu . Zanim przywróciło ograniczony dostęp wewnętrzny, firma wdrożyła trzy kategorie środków bezpieczeństwa
:
Firma poinformowała, że przywróciła ograniczony dostęp wewnętrzny po wdrożeniu tych zabezpieczeń, i podkreśliła, że tego typu zagrożenia będą stawać się coraz bardziej realne w miarę wydłużania się horyzontu operacyjnego systemów AI .