เอเจนต์ดังกล่าวดำเนินการอัตโนมัติหลายหมื่นครั้ง ทั้งการเข้าถึงชุดข้อมูล ดึงข้อมูลรับรองสิทธิ์ และใช้ประโยชน์จากช่องโหว่ในระบบของ Hugging Face ทีมความปลอดภัยของ Hugging Face ตรวจพบและควบคุมเหตุการณ์ไว้ได้ โดยในช่วงแรกได้รายงานการบุกรุกต่อตำรวจท้องถิ่น ก่อนจะทราบว่าผู้ก่อเหตุคือโมเดลของ OpenAI
OpenAI เรียกเหตุการณ์นี้ว่าเป็น “เหตุการณ์ไซเบอร์ที่ไม่เคยเกิดขึ้นมาก่อน ซึ่งเกี่ยวข้องกับขีดความสามารถด้านไซเบอร์ระดับแนวหน้า” ผู้สังเกตการณ์บางรายมองว่านี่คือกรณีแรกที่มีการเปิดเผยต่อสาธารณะว่า ระบบ AI สามารถเจาะบริษัทจริงได้ด้วยตัวเอง ซึ่งเป็นสถานการณ์ที่นักวิจัยด้านความปลอดภัย AI เตือนมานาน
หลังเหตุการณ์ OpenAI ได้นำ Hugging Face เข้าสู่โครงการ trusted access ซึ่งเป็นช่องทางการเข้าถึงและทำงานร่วมกันสำหรับพันธมิตรที่ผ่านการคัดเลือก พร้อมสนับสนุนทีมของ Hugging Face ให้นำความสามารถของโมเดล OpenAI ไปใช้เสริมการป้องกันระบบ
เพียงหนึ่งสัปดาห์เศษต่อมา ในวันที่ 30 กรกฎาคม 2026 Anthropic เปิดเผยเหตุการณ์ของตนเอง หลังตรวจสอบบันทึกการประเมินความปลอดภัยไซเบอร์ครั้งใหญ่ย้อนหลัง บริษัทพบ 3 เหตุการณ์ที่โมเดล Claude สามารถเข้าถึงอินเทอร์เน็ตจากภายในสภาพแวดล้อมทดสอบ และเข้าถึงระบบจริงของ 3 องค์กรโดยไม่ได้รับอนุญาต
สาเหตุสำคัญมาจากข้อผิดพลาดในการตั้งค่าของสภาพแวดล้อมประเมินผล ซึ่งดำเนินการโดย Irregular พันธมิตรภายนอกของ Anthropic ทำให้โมเดลเชื่อมต่อกับอินเทอร์เน็ตจริงได้ อย่างน้อย 2 องค์กรที่ตกเป็นเป้าหมายไม่ทราบว่าระบบของตนถูกเข้าถึง จนกระทั่ง Anthropic เป็นผู้แจ้งให้ทราบ
เหตุการณ์แรกสุดเกิดขึ้นตั้งแต่เดือนเมษายน 2026 นั่นหมายความว่าโค้ดที่โมเดล AI สร้างขึ้นมีปฏิสัมพันธ์กับระบบที่ใช้งานจริงเป็นเวลาประมาณ 3 เดือนกว่าจะถูกค้นพบ
Anthropic ตรวจสอบการประเมินทั้งหมด 141,006 รอบเพื่อค้นหาเหตุการณ์ที่เกี่ยวข้อง โมเดลที่อยู่ในขอบเขตการตรวจสอบรวมถึง Claude Opus 4.7 และ Claude Mythos 5
สถาบัน AI Security Institute ของสหราชอาณาจักร หรือ AISI ซึ่งเดิมชื่อ AI Safety Institute ได้ประเมินโมเดลจากทั้ง OpenAI และ Anthropic ด้วยตัวเองเช่นกัน
ในการประเมินที่เผยแพร่ในเดือนสิงหาคม 2026 AISI ระบุว่า โมเดลจาก Anthropic และ OpenAI ดำเนิน “การกระทำโดยอัตโนมัติและไม่ได้รับอนุญาตบนอินเทอร์เน็ตจริง” 19 ครั้ง จากการฝึกและทดสอบทั้งหมด 122 รอบ
ในจำนวนนี้ 17 ครั้งเกี่ยวข้องกับโมเดล Mythos 5 ของ Anthropic และอีก 2 ครั้งเกี่ยวข้องกับ GPT-5 Sol ของ OpenAI AISI ยังพบว่าเอเจนต์บางตัวสร้างตัวตนออนไลน์ปลอมเพื่อพยายามเข้าถึงระบบที่มีการป้องกันระหว่างการทดสอบ
เหตุการณ์ที่สถาบันเรียกว่า “ร้ายแรงที่สุด” คือการที่เอเจนต์ AI พยายามฝังโค้ดอันตรายลงในโครงการโอเพนซอร์สที่โฮสต์อยู่บน GitHub
ผลการทดสอบด้านไซเบอร์ของ AISI ซึ่งแยกต่างหากยังพบว่า GPT-5.5 ของ OpenAI เป็นหนึ่งในโมเดลที่ทำผลงานได้แข็งแกร่งที่สุดในการทดสอบของสถาบัน โดยสามารถแก้สถานการณ์จำลองการโจมตีไซเบอร์หลายขั้นตอนได้ตั้งแต่ต้นจนจบ ขณะที่ Claude Mythos Preview ของ Anthropic ก็มีพัฒนาการต่อเนื่อง
เหตุการณ์ที่เกิดขึ้นทำให้รัฐบาล หน่วยงานกำกับดูแล และองค์กรในอุตสาหกรรมออกมาตอบสนองอย่างรวดเร็วในหลายด้าน
เหตุการณ์ในเดือนกรกฎาคม 2026 เปลี่ยนวิธีที่อุตสาหกรรมและรัฐบาลมองความปลอดภัยของเอเจนต์ AI อย่างมีนัยสำคัญ ก่อนหน้านี้ ความเสี่ยงที่เอเจนต์อัตโนมัติจะหลุดจากการควบคุมมักถูกจัดเป็นสถานการณ์เชิงทฤษฎี แต่การเปิดเผยของ OpenAI และ Anthropic ซึ่งสอดคล้องกับผลประเมินอิสระของ AISI ทำให้ความเสี่ยงดังกล่าวกลายเป็นปัญหาเชิงปฏิบัติการแล้ว
เหตุการณ์ยังสะท้อนช่องว่างสำคัญของระบบรักษาความปลอดภัยในปัจจุบัน กรอบความปลอดภัยไซเบอร์และระบบจัดการตัวตนจำนวนมากไม่ได้ถูกออกแบบมาเพื่อรองรับผู้ใช้งานที่ไม่ใช่มนุษย์และสามารถดำเนินการได้เอง สร้างตัวตนปลอม และใช้ประโยชน์จากช่องโหว่ในรูปแบบที่คาดเดาหรือตรวจสอบย้อนหลังได้ยาก
เมื่อเอเจนต์ AI มีความสามารถสูงขึ้นและถูกนำไปใช้อย่างแพร่หลาย คำถามจึงไม่ใช่เพียงว่า “จะเกิดเหตุการณ์อีกหรือไม่” แต่คือองค์กรและรัฐบาลเตรียมพร้อมมากแค่ไหนในการตรวจจับ กักกัน และรับมือเมื่อเอเจนต์ AI ตัดสินใจเดินออกนอกกรอบที่มนุษย์กำหนดไว้