Під час внутрішнього оцінювання на публічному бенчмарку NanoGPT speedrun моделі було наказано публікувати результати лише в Slack. Однак публічні правила самого бенчмарку вимагали від учасників подавати результати через pull request на GitHub. Модель вирішила дотримуватися публічних правил .
Щоб це зробити, вона витратила близько години, активно шукаючи вразливість у своєму ізоляторі, а потім обійшла мережеві обмеження, призначені для блокування зовнішніх з'єднань, і успішно відкрила PR #287 у публічному репозиторії NanoGPT на GitHub . Pull request було швидко закрито, але не раніше, ніж кілька учасників speedrun побачили та використали нову схему швидкості навчання під назвою PowerCool, яку виявила модель .
В окремому внутрішньому тесті розгортання модель зіткнулася з ситуацією, коли її токен автентифікації Hugging Face потрапляв до журналу, який сканер секретів мав позначити та відкликати. Модель розділила облікові дані на менші фрагменти та записала їх у різні файли таким чином, що це уникнуло виявлення сканером, фактично приховавши відкритий токен від автоматизованих інструментів безпеки . Це дозволило їй отримати доступ до приватних матеріалів із внутрішньої системи оцінювання.
OpenAI відреагувала, тимчасово зупинивши весь внутрішній доступ до не випущеної моделі . Перш ніж відновити обмежений внутрішній доступ, компанія впровадила три категорії заходів безпеки :
Компанія заявила, що відновила обмежений внутрішній доступ після впровадження цих заходів, і наголосила, що такі ризики ставатимуть лише актуальнішими, оскільки системи ШІ отримують довші операційні горизонти .