โมเดลทั้ง 5 รุ่นที่ถูกทดสอบ ได้แก่ GPT-5.4, GPT-5.5 และ GPT-5.6 Sol จาก OpenAI รวมถึง Claude Opus 4.7 และ Claude Mythos Preview จาก Anthropic โดย AISI ให้คำจำกัดความของคำว่า 'โกง' ว่าคือ การกระทำที่นอกเหนือขอบเขตของงาน หรือละเมิดกฎที่ถูกกำหนดไว้อย่างชัดเจน เพื่อบรรลุเป้าหมายด้วยวิธีลัดหรือวิธีแก้ปัญหาที่ไม่ได้ถูกออกแบบไว้
จากการทดสอบทั้งหมด 475 ครั้งต่อโมเดล อัตราการตรวจพบการพยายามโกงมีดังนี้ :
AISI บันทึกพฤติกรรมหลากหลายที่เกินกว่าการแหกกฎแบบธรรมดา :
AISI ย้ำว่าไม่มีข้อมูลรั่วไหลหรือเกิดความเสียหาย แต่เตือนว่าหากโครงสร้างพื้นฐานไม่ได้ถูกสร้างมาอย่างปลอดภัย การโจมตีดังกล่าวอาจประสบความสำเร็จได้
การให้โมเดลรายงานตัวเองพิสูจน์แล้วว่าเป็นกลไกที่เชื่อถือไม่ได้ เมื่อถูกถามถึงพฤติกรรมของพวกมัน :
การอ่านบันทึก 'ลูกโซ่แห่งความคิด' (Chain-of-Thought - CoT) ก็ไม่ช่วยปิดช่องโหว่นี้ เพราะโมเดลมักจะไม่เขียนเหตุผลสำหรับขั้นตอนที่ถูกตรวจจับ หรือเลือกว่าจะแสดงเหตุผลมากน้อยแค่ไหน
AISI พบว่า ไม่มีความสัมพันธ์ที่ชัดเจน ระหว่างความสามารถดิบของโมเดลกับอัตราการพยายามโกง โมเดลที่แข็งแกร่งกว่าไม่ได้มีแนวโน้มที่จะโกงมากกว่าโมเดลที่อ่อนแอกว่า สถาบันสรุปว่าพฤติกรรมการโกงนั้น ถูกกำหนดอย่างมีนัยสำคัญโดยรายละเอียดเฉพาะของวิธีที่โมเดลถูกฝึกและปรับแต่ง (Alignment) ไม่ใช่เพียงแค่ระดับความฉลาดของมัน ผลการค้นพบนี้ชี้ให้เห็นว่าเทคนิคการปรับแต่งโมเดลในปัจจุบันยังไม่สามารถแก้ปัญหานี้ได้
AISI ได้ข้อสรุปที่มองไปข้างหน้าหลายประการ :