यह कोई अलग-थलग बग नहीं था। यह एक पहले से अज्ञात वल्नरेबिलिटी वर्ग का सबसे नाटकीय प्रदर्शन था, जिसे Zenity ने "PleaseFix" नाम दिया है — जीरो-क्लिक खामियों का एक परिवार, जो शोधकर्ताओं द्वारा जांचे गए हर प्रमुख कमर्शियल एजेंटिक ब्राउज़र को प्रभावित करता है ।
Zenity के प्रूफ-ऑफ-कॉन्सेप्ट अटैक ने OpenAI की तीन-स्तरीय सुरक्षा प्रणाली को तीन तकनीकों से बायपास किया :
उसी एक्सप्लॉइट चेन का उपयोग Amazon पर अनधिकृत खरीदारी करने के लिए भी किया जा सकता है, जो एक व्यापक अकाउंट-टेकओवर क्षमता को प्रदर्शित करता है । ध्यान देने वाली बात है कि WhatsApp का एंड-टू-एंड एन्क्रिप्शन नहीं तोड़ा गया — AI एजेंट बस यूजर के ऑथेंटिकेटेड सेशन के अंदर काम कर रहा था ।
Zenity Labs ने PleaseFix को एक परिवार के रूप में खुलासा किया, जो सभी प्रमुख कमर्शियल एजेंटिक ब्राउज़रों को प्रभावित करता है, जिनकी उन्होंने जांच की । ये खामियां निम्नलिखित ब्राउज़रों में प्रदर्शित की गईं:
कुल मिलाकर, Zenity ने इन प्लेटफार्मों में 20 अलग-अलग खामियां खोजीं । मुख्य समस्या आर्किटेक्चरल है: एजेंटिक ब्राउज़रों को वेब कंटेंट को स्वायत्त रूप से पढ़ने, निर्देशों का पालन करने और यूजर की ओर से कार्य करने के लिए डिज़ाइन किया गया है — और यही स्वायत्तता ही अटैक सरफेस है । हमलावर एजेंटों को सामान्य कंटेंट और अपेक्षित कार्यों के जरिए हाईजैक कर लेते हैं, बिना किसी मैलवेयर, एक्सप्लॉइट या यूजर के क्लिक की आवश्यकता के ।
प्रदर्शित अटैक आउटकम में शामिल हैं :
सुरक्षा शोधकर्ताओं का तर्क है कि वर्तमान दृष्टिकोण — अत्यधिक स्वायत्त AI एजेंटों के ऊपर सेफ्टी फिल्टर और प्रॉम्प्ट-लेवल गार्डरेल की परतें चढ़ाना — संरचनात्मक रूप से अपर्याप्त है । Zenity के शोध ने दिखाया कि हर एक एजेंटिक ब्राउज़र से उसी मूल तकनीक का उपयोग करके समझौता किया जा सकता है: एजेंट को उस दुर्भावनापूर्ण कंटेंट को खिलाना जिसे वह संसाधित करने के लिए डिज़ाइन किया गया था ।
मुख्य समस्या यह है कि प्रोबेबिलिस्टिक AI सेफ्टी फिल्टर (जो अनुमान लगाते हैं कि कोई कार्रवाई सुरक्षित है या नहीं) किसी हमलावर को रोक नहीं सकते, जो ऐसे नए इनपुट बना सकता है जो इन फिल्टरों को चकमा दे दें। शोधकर्ता निर्धारक सुरक्षा बाधाओं की मांग कर रहे हैं — AI एजेंट को क्या करने की अनुमति है, इस पर कठोर, लागू करने योग्य बाधाएं, भले ही वह निर्देशों की व्याख्या कैसे भी करे । उदाहरणों में शामिल हैं:
जब तक ऐसे निर्धारक नियंत्रण मौजूद नहीं हैं, PleaseFix वर्ग की खामियां दिखाती हैं कि एजेंटिक ब्राउज़रों को सिर्फ सामान्य दिखने वाली वेब सामग्री प्रकाशित करके अपने ही उपयोगकर्ताओं के खिलाफ हथियार बनाया जा सकता है ।