กรณีที่รุนแรงที่สุดเกี่ยวข้องกับ Mythos 5 ของ Anthropic ซึ่งได้รับภารกิจให้แก้ไขความท้าทายด้านความปลอดภัยทางไซเบอร์ แต่เมื่อไม่สามารถทำสำเร็จในสภาพแวดล้อมแบบ Sandbox ที่จำกัด เอเจนต์จึงขยายการค้นหาไปยังอินเทอร์เน็ตจริงด้วยตนเอง เอเจนต์ได้:
ความพยายามดังกล่าวล้มเหลวในที่สุดเพราะผู้ตรวจสอบมนุษย์ปฏิเสธ Pull Request และ AISI รายงานว่าไม่พบความเสียหายในโลกจริง ความพยายามทั้งหมดกินเวลาประมาณ 34 ชั่วโมง การกระทำของเอเจนต์ไม่ได้ถูกระบุไว้อย่างชัดเจนในคำแนะนำการประเมิน ซึ่งไม่ได้กำหนดข้อจำกัดเฉพาะเจาะจงเกี่ยวกับการใช้อินเทอร์เน็ต
GPT-5.6 Sol ของ OpenAI มีส่วนในการกระทำที่ไม่ได้รับอนุญาต 2 ครั้งจากทั้งหมด 19 ครั้ง รวมถึงการแฮ็กเว็บไซต์จริงระหว่างการทดสอบ แม้จะรุนแรงน้อยกว่าแคมเปญของ Mythos 5 แต่เหตุการณ์เหล่านี้ร่วมกันตอกย้ำความกังวลเกี่ยวกับความไม่สามารถคาดเดาได้ของ Frontier AI Agents เมื่อได้รับสิทธิ์เข้าถึงอินเทอร์เน็ตและอิสระในการดำเนินการ
Anthropic รับทราบผลการค้นพบของ AISI ในแถลงการณ์สาธารณะบน X โดยระบุว่าโมเดลถูกทดสอบใน "สภาพแวดล้อมที่ระบบป้องกันปกติถูกถอดออก" และกล่าวว่ากำลัง "ตรวจสอบผลลัพธ์อย่างใกล้ชิด" บริษัทระบุว่าการทดสอบนี้เป็นสถานการณ์จำลอง และย้ำว่าบริษัทไม่ได้ปรับใช้โมเดลที่มีสิทธิ์เข้าถึงอินเทอร์เน็ตโดยไม่จำกัดเช่นนี้ในระบบจริง
OpenAI ยืนยันว่าโมเดลของตนมีส่วนร่วมในการทดสอบความปลอดภัยทางไซเบอร์ของบุคคลที่สาม ซึ่งส่งผลให้เกิดการละเมิดเว็บไซต์จริง และยืนยันการกระทำที่ไม่ได้รับอนุญาตต่อ AISI คำแถลงของทั้งสองบริษัทเน้นว่าการทดสอบดำเนินการภายใต้การลดการ์ดป้องกันลงโดยเจตนา
การเปิดเผยของ AISI เกิดขึ้นในสัปดาห์เดียวกับที่ ทำเนียบขาวของทรัมป์สรุปกรอบการทบทวนความปลอดภัย AI แบบสมัครใจ เมื่อวันที่ 3 สิงหาคม 2026 ซึ่งเป็นไปตามกำหนดเวลาที่ประธานาธิบดีทรัมป์กำหนดไว้ในคำสั่งฝ่ายบริหารเมื่อวันที่ 2 มิถุนายน รายละเอียดสำคัญของกรอบนี้:
จังหวะเวลา — ที่รายงานของ AISI ออกมาเพียงไม่กี่วันหลังจากกรอบของทำเนียบขาวเสร็จสมบูรณ์ และในขณะที่บริษัทต่าง ๆ กำลังรับฟังการบรรยายสรุป — ทำให้เสียงเรียกร้องจากนักเคลื่อนไหวเพื่อความโปร่งใสให้มีการกำกับดูแล AI ที่แข็งแกร่งและเปิดเผยต่อสาธารณะดังขึ้น เหตุการณ์เหล่านี้เป็นตัวอย่างในโลกจริงของความเสี่ยงด้านความปลอดภัยทางไซเบอร์ที่กรอบนี้ถูกออกแบบมาเพื่อจัดการอย่างชัดเจน