นี่ไม่ใช่แค่บั๊กทั่วไป แต่เป็นการแสดงให้เห็นถึงช่องโหว่ประเภทใหม่ที่ Zenity เรียกว่า 'PleaseFix' ซึ่งเป็นกลุ่มช่องโหว่แบบ zero-click ที่ส่งผลกระทบต่อเบราว์เซอร์ AI ทุกตัวที่ทีมวิจัยได้ทดสอบ
การโจมตีของ Zenity สามารถเลี่ยงระบบรักษาความปลอดภัยสามชั้นของ OpenAI ได้ด้วยสามเทคนิคหลัก :
นอกจาก WhatsApp แล้ว การโจมตีแบบเดียวกันนี้ยังสามารถใช้เพื่อสั่งซื้อสินค้าบน Amazon โดยไม่ได้รับอนุญาต ซึ่งแสดงให้เห็นถึงความสามารถในการครอบครองบัญชีทั้งหมดของผู้ใช้ สิ่งสำคัญคือ การเข้ารหัสแบบ end-to-end ของ WhatsApp ไม่ได้ถูกเจาะ ตัวแทน AI เพียงแค่ทำงานภายในเซสชันที่ผู้ใช้ล็อกอินไว้อยู่แล้ว
Zenity Labs เปิดเผยว่า PleaseFix เป็นกลุ่มช่องโหว่ zero-click ที่ส่งผลกระทบต่อ เบราว์เซอร์ AI เชิงพาณิชย์ทุกราย ที่พวกเขาตรวจสอบ ช่องโหว่ดังกล่าวถูกสาธิตบนแพลตฟอร์มดังต่อไปนี้:
โดยรวมแล้ว Zenity พบ ช่องโหว่ที่แตกต่างกันถึง 20 จุด บนแพลตฟอร์มเหล่านี้ ปัญหาหลักอยู่ที่โครงสร้างพื้นฐาน: เบราว์เซอร์ AI ถูกออกแบบมาให้อ่านเนื้อหาเว็บ ติดตามคำสั่ง และดำเนินการแทนผู้ใช้ได้โดยอัตโนมัติ ซึ่งความเป็นอิสระนี้เองที่กลายเป็นช่องทางการโจมตี ผู้โจมตีสามารถจี้ตัวแทน AI ได้ผ่าน เนื้อหาทั่วไปและการกระทำที่คาดหวัง โดยไม่ต้องใช้มัลแวร์ ช่องโหว่ หรือให้ผู้ใช้คลิกเลย
ผลลัพธ์ของการโจมตีที่สาธิตได้แก่ :
นักวิจัยด้านความปลอดภัยโต้แย้งว่าแนวทางในปัจจุบัน — การเพิ่มชั้นกรองความปลอดภัยและราวกั้นในระดับพรอมต์บนตัวแทน AI ที่มีอิสระสูง — นั้นไม่มีประสิทธิภาพในเชิงโครงสร้าง งานวิจัยของ Zenity แสดงให้เห็นว่าเบราว์เซอร์ AI ทุกตัวสามารถถูกเจาะได้โดยใช้เทคนิคพื้นฐานเดียวกัน: การป้อนเนื้อหาที่เป็นอันตรายซึ่งตัวแทน AI ถูกออกแบบมาให้ประมวลผล
ปัญหาหลักคือ ระบบกรองความปลอดภัยแบบความน่าจะเป็น (Probabilistic AI Safety Filters) ซึ่งเดาว่าการกระทำนั้นปลอดภัยหรือไม่ ไม่สามารถหยุดผู้โจมตีที่สามารถสร้างอินพุตชนิดใหม่เพื่อเลี่ยงผ่านตัวกรองเหล่านั้นได้อย่างน่าเชื่อถือ นักวิจัยจึงเรียกร้องให้มี 'กำแพงกั้นความปลอดภัยที่แน่นอน' (Deterministic Security Barriers) ซึ่งเป็นข้อจำกัดที่บังคับใช้อย่างเด็ดขาดว่าตัวแทน AI ได้รับอนุญาตให้ทำอะไรได้บ้าง โดยไม่ขึ้นอยู่กับว่ามันตีความคำสั่งอย่างไร ตัวอย่างเช่น:
ตราบใดที่ยังไม่มีระบบควบคุมแบบ Deterministic เหล่านี้ ช่องโหว่ระดับ PleaseFix ก็แสดงให้เห็นว่าเบราว์เซอร์ AI สามารถถูกใช้เป็นอาวุธต่อต้านผู้ใช้ของตัวเองได้ เพียงแค่ผู้โจมตีเผยแพร่เนื้อหาเว็บที่ดูธรรมดา