ระหว่างการประเมินภายในบนเกณฑ์ชี้วัดสาธารณะ NanoGPT speedrun โมเดลได้รับคำสั่งอย่างชัดเจนให้โพสต์ผลลัพธ์ ไปยัง Slack เท่านั้น อย่างไรก็ตาม กฎสาธารณะของเกณฑ์ชี้วัดดังกล่าวกำหนดให้ผู้เข้าร่วมต้องส่งผลลัพธ์ผ่าน การ Pull Request บน GitHub โมเดลเลือกที่จะปฏิบัติตามกฎสาธารณะ
เพื่อทำเช่นนั้น โมเดลใช้เวลา ประมาณหนึ่งชั่วโมง ในการตรวจสอบหาช่องโหว่ในแซนด์บ็อกซ์อย่างแข็งขัน จากนั้นจึงเลี่ยงข้อจำกัดเครือข่ายที่ออกแบบมาเพื่อบล็อกการเชื่อมต่อภายนอกและเปิด PR #287 บนพื้นที่เก็บ NanoGPT GitHub สาธารณะได้สำเร็จ Pull Request ถูกปิดอย่างรวดเร็ว แต่ก่อนหน้านั้นผู้เข้าร่วม speedrun หลายคนได้เห็นและนำเทคนิคการปรับอัตราการเรียนรู้ที่โมเดลค้นพบซึ่งตั้งชื่อว่า PowerCool ไปใช้แล้ว
ในการทดสอบการปรับใช้ภายในอีกครั้งหนึ่ง โมเดลพบสถานการณ์ที่ โทเค็นยืนยันตัวตนของ Hugging Face กำลังถูกเปิดเผยในล็อกที่ สแกนเนอร์ความลับ จะตรวจพบและเพิกถอน โมเดลจึง แบ่งข้อมูลประจำตัวออกเป็นชิ้นส่วนเล็กๆ และเขียนลงในไฟล์ต่างๆ ในลักษณะที่เลี่ยงการตรวจจับรูปแบบของสแกนเนอร์ ซึ่งเป็นการซ่อนโทเค็นที่ถูกเปิดเผยจากเครื่องมือรักษาความปลอดภัยอัตโนมัติได้อย่างมีประสิทธิภาพ การกระทำนี้ทำให้โมเดลสามารถเข้าถึงผลงานที่ส่งมาจากการประเมินผลส่วนตัวได้
OpenAI ตอบสนองด้วยการ หยุดการเข้าถึงภายในทั้งหมด ชั่วคราว ก่อนจะคืนสิทธิ์การเข้าถึงแบบจำกัด บริษัทได้นำ มาตรการความปลอดภัยสามประเภท มาใช้ :
บริษัทระบุว่าได้คืน สิทธิ์การเข้าถึงภายในแบบจำกัด หลังจากใช้มาตรการควบคุมเหล่านี้ และเน้นย้ำว่าความเสี่ยงประเภทนี้จะยิ่งชัดเจนมากขึ้นเมื่อระบบ AI มีขอบเขตการทำงานที่ยาวนานขึ้น