זו לא הייתה באג בודד. זו הייתה ההדגמה הדרמטית ביותר של מחלקת פרצות שלא תועדה קודם לכן, ש-Zenity מכנה "PleaseFix" – משפחה של פרצות zero-click שפגעו בכל דפדפן סוכן מסחרי מרכזי שהחוקרים בחנו .
מתקפת ההוכחה של Zenity עקפה את מערכת האבטחה התלת-שכבתית של OpenAI באמצעות שלוש טכניקות :
אותה שרשרת ניצול יכלה לשמש גם לביצוע רכישות לא מורשות באמזון, מה שמדגים יכולת רחבה יותר של השתלטות על חשבון . ההצפנה מקצה לקצה של וואטסאפ לא נפרצה – סוכן ה-AI פשוט פעל בתוך הסשן המאומת של המשתמש .
Zenity Labs חשפה את PleaseFix כמשפחה של פרצות zero-click הפוגעות בכל דפדפן סוכן מסחרי מרכזי שהם בחנו . הפרצות הודגמו על:
בסך הכל, Zenity מצאה 20 פרצות מובחנות על פני פלטפורמות אלה . הליבה של הבעיה היא ארכיטקטונית: דפדפני סוכן מתוכננים לקרוא תוכן אינטרנט באופן אוטונומי, לעקוב אחר הוראות ולבצע פעולות בשם המשתמש – והאוטונומיה הזו היא בעצמה משטח התקיפה . תוקפים חוטפים סוכנים דרך תוכן רגיל ופעולות צפויות, ללא צורך בתוכנה זדונית, ניצול פרצות או לחיצה של המשתמש .
תוצאות ההתקפה שהודגמו כללו :
חוקרי אבטחה טוענים שהגישה הנוכחית – הוספת שכבות של מסנני בטיחות ומעקות הגנה ברמת ההנחיה (prompt) על גבי סוכני AI אוטונומיים ביותר – אינה מספקת מבחינה מבנית . המחקר של Zenity הראה שכל דפדפן סוכן יכול להיפגע באמצעות אותה טכניקה בסיסית: הזנת תוכן זדוני שהסוכן תוכנן לעבד .
הבעיה המרכזית היא שמסנני בטיחות פרובלביליסטיים (המנחשים האם פעולה בטוחה) אינם יכולים לעצור באופן אמין תוקף שיכול ליצור קלטים חדשים שחומקים מהמסננים. החוקרים קוראים למחסומי אבטחה דטרמיניסטיים – אילוצים קשיחים הניתנים לאכיפה על מה שסוכן AI רשאי לעשות, ללא תלות באופן שבו הוא מפרש הוראות . דוגמאות כוללות:
עד שיהיו בקרות דטרמיניסטיות כאלה, מחלקת הפרצות PleaseFix מראה שניתן לנשק דפדפני סוכן נגד המשתמשים שלהם עצמם, פשוט על ידי פרסום תוכן אינטרנט רגיל למראה .