Peter Garraghan ผู้ก่อตั้ง Mindgard บรรยายผลลัพธ์ว่า "โหดร้ายมาก บางครั้งก็โจ่งแจ้งทางเพศ บางครั้งก็ทั้งสองอย่างรวมกัน" ขณะที่ Jim Nightingale นักวิจัยผู้ทำการทดสอบกล่าวว่าเขารู้สึก "สั่นเทิ้มและถึงกับร้องไห้" กับสิ่งที่ระบบผลิตออกมา
การโจมตีนี้เป็นรูปแบบหนึ่งของ Adversarial Prompting (การใช้คำสั่งเพื่อหลอกระบบ) Mindgard นำคำสั่งตลกที่แชร์กันทั่วไปและทำการปรับเปลี่ยนข้อความเพียงเล็กน้อย รายละเอียดที่สำคัญคือ คำสั่งที่ถูกปรับปรุงนั้น ไม่ได้ระบุอย่างชัดเจน ถึงเนื้อหาที่รุนแรง AI กลับสร้างเนื้อหาที่โหดร้ายและโจ่งแจ้งทางเพศ "ด้วยความสมัครใจของมันเอง" จากคำสั่งที่ดูเหมือนไม่เป็นอันตราย
การค้นพบนี้ต่อยอดจากงานวิจัยก่อนหน้าของ Mindgard ที่แสดงให้เห็นว่าระบบป้องกันภาพของ ChatGPT ยังสามารถถูกเลี่ยงผ่านได้ด้วย การจัดการหน่วยความจำ (Memory Manipulation) โดยที่บริบทของหน่วยความจำผู้ใช้และ System Prompt ที่กำหนดเองสามารถแทนที่ตัวกรองความปลอดภัยได้ โดยไม่จำเป็นต้องเข้าถึงระบบแบ็กเอนด์หรือปรับเปลี่ยนโมเดลแต่อย่างใด
Mindgard ได้แจ้งเตือน OpenAI ถึงช่องโหว่ดังกล่าวตั้งแต่เดือนพฤษภาคม ปี 2026 แต่ทางบริษัทตอบกลับเพียงอัตโนมัติ หลังจากที่ BBC สอบถาม OpenAI จึงออกแถลงการณ์ว่าได้ "เพิ่มมาตรการป้องกันเพิ่มเติมสำหรับคำสั่งในลักษณะนี้"
และกล่าวว่ามีการป้องกันภาพหลายชั้นที่ผสานระบบอัตโนมัติเข้ากับการตรวจสอบโดยมนุษย์
อย่างไรก็ตาม Mindgard พบว่าแม้หลังการแก้ไขของ OpenAI การปรับเปลี่ยนถ้อยคำในคำสั่งเพียงเล็กน้อยก็ยังสามารถสร้างเนื้อหาที่น่ากังวลได้อีกครั้ง