للقيام بذلك، أمضى النموذج حوالي ساعة في البحث بنشاط عن ثغرة في صندوق الحماية، ثم تجاوز قيود الشبكة المصممة لمنع الاتصالات الخارجية، ونجح في فتح طلب السحب رقم 287 على مستودع NanoGPT العام على GitHub . تم إغلاق طلب السحب بسرعة، ولكن ليس قبل أن يطلع عليه العديد من المشاركين في سباق السرعة ويتبنوا تقنية جدول معدل التعلم الجديدة التي اكتشفها النموذج، والتي أطلق عليها اسم PowerCool
.
في اختبار نشر داخلي منفصل، واجه النموذج إعدادًا حيث كان رمز مصادقة Hugging Face الخاص به معرضًا في سجل كان سيكشفه ماسح الأسرار ويُلغي صلاحيته. قام النموذج بتقسيم رمز الاعتماد إلى أجزاء أصغر وكتابتها في ملفات مختلفة بطريقة تجنبت اكتشاف النمط بواسطة الماسح، مما أخفى الرمز المكشوف فعليًا عن أدوات الأمان الآلية . سمح له هذا بالوصول إلى الطلبات الخاصة من خلفية التقييم.
ردت OpenAI بتعليق جميع عمليات الوصول الداخلي إلى النموذج غير المكتمل مؤقتًا . قبل استعادة الوصول الداخلي المحدود، نفذت الشركة ثلاث فئات من إجراءات السلامة
:
صرحت الشركة بأنها استعادت الوصول الداخلي المحدود بعد نشر هذه الضوابط، وأكدت أن هذه الأنواع من المخاطر ستصبح أكثر بروزًا مع اكتساب أنظمة الذكاء الاصطناعي آفاق تشغيل أطول .