הרעלת זיכרון היא מתקפת שלמות מושהית: תוכן לא מהימן נכתב לזיכרון המתמשך של סוכן AI ונשלף בהמשך כאילו היה ידע קודם אמין. הניתוח בחן הרעלת שרשרת, שכתוב מדיניות, הפעלת דלת אחורית וסחיפה איטית — וממחיש מדוע בדיקת פרומפט בודד אינה מספיקה.
פורסם על ידינערך באמצעות GPT-5.6 Terraהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does “memory poisoning” work as a delayed attack against AI agents with persistent memory—where attackers inject false information that. Article summary: Memory poisoning is a delayed integrity attack: an attacker causes untrusted content—false facts, misleading instructions, or unsafe procedures—to be written into an agent’s persistent memory. The agent may appear normal. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
זיכרון מתמשך הופך סוכן AI לשימושי יותר: הוא יכול לזכור העדפות, עבודה קודמת, נהלים והקשר בין משימות. אבל הוא גם יוצר בעיית אבטחה מסוג אחר. אם תוכן לא מהימן נשמר בזיכרון, תוקף אינו חייב לגרום לכשל מיידי. הוא יכול להמתין עד שהסוכן ישלוף את הרשומה המורעלת במשימה עתידית, שנראית כלל לא קשורה לאירוע המקורי. 1
5
הרעלת זיכרון היא מתקפת שלמות מידע: פגיעה במה שהסוכן יתייחס אליו בעתיד כאל ידע שצבר בעצמו. התהליך הבסיסי נראה כך:
ההבדל המרכזי לעומת הזרקת פרומפט רגילה הוא הזמן. כתיבה זדונית מוצלחת לזיכרון יכולה להשפיע על הפעלות עתידיות, גם אם השיחה שבה הוזן התוכן לא שינתה באופן גלוי את התנהגות הסוכן. 1
30
לא בכל תרחיש נדרשת גישה ישירה של התוקף למסד הנתונים של הזיכרון. מחקר על סוכני גלישה ברשת, למשל, מתאר תקיפה חוצת־הפעלות וחוצת־אתרים: דף אינטרנט שעבר מניפולציה נצפה במהלך פעולה רגילה, מזהם את הזיכרון, ומופעל במשימה עתידית. 2
חוקרים המזוהים עם אוניברסיטת קלגרי דיווחו כי ניתחו 2,614 מסלולי תקיפה מדומים ורב־שלביים של סוכני LLM בעלי זיכרון. במקום להסתפק בשאלה אם תקיפה הצליחה או נכשלה, הם בחנו כיצד הפגיעה מתפתחת לאורך זמן. העבודה כללה ארבע תבניות תקיפה: הרעלת שרשרת, שכתוב מדיניות, הפעלת דלת אחורית וסחיפה איטית. 14
בהרעלת שרשרת נשתלת הנחת יסוד מזיקה בשלב מוקדם של תהליך רב־שלבי. ההנמקה המאוחרת יותר יכולה להתבסס עליה דרך החלטות ביניים שנראות לכאורה סבירות, עד לתוצאה לא בטוחה. מבחינת אבטחה, הבעיה היא שאף שלב בודד לא בהכרח ייראה זדוני כשבוחנים אותו בנפרד. 14
שכתוב מדיניות משבש כללים, אישורים, סדרי עדיפויות או הנחות תפעוליות שנשמרו בזיכרון. במשימה עתידית, הסוכן עלול לשלוף את הרשומות ששונו ולפעול לפי המדיניות שהחליף התוקף במקום לפי המדיניות המקורית. 14
רשומת זיכרון בסגנון דלת אחורית נשארת רדומה עד שמשימה עתידית כוללת טריגר מתאים — למשל ניסוח מסוים, הקשר משימתי או התאמה סמנטית. מחקרים קודמים הדגימו את הסיכון הרחב יותר: תצפית מזוהמת אחת שנשמרת יכולה להיות מופעלת בהמשך, בין הפעלות ובאתרים שונים. 2
14
סחיפה איטית מתארת שינויים קטנים שמטים לאורך זמן את המלצות הסוכן או את דפוסי הפעולה שלו. מחקר על פגיעה בזיכרון מתמשך מצא שמשימות עתידיות הדומות מילולית או סמנטית יכולות להציף רשומות מורעלות ולגרום לדפוסים לא בטוחים לאורך כמה הפעלות. 29
הניתוח מקלגרי מדגיש בעיה כרונולוגית: בזמן ההזרקה, חלק מהתקיפות עשויות להיות קשות להבחנה מהתנהגות רגילה. הנזק מופרד בזמן מכתיבת הזיכרון, ועלול להתגלות רק לאחר שליפה עתידית. 14
לכן, הסיכון אינו בהכרח ליניארי. הוא עשוי להישאר שקט לאורך כמה אינטראקציות ואז לעלות כאשר משימה רלוונטית, הקשר מתאים או טריגר גורמים לזיכרון המורעל לקבל דירוג גבוה מספיק כדי להישלף. מחקר נוסף מתאר גם הוא את הרעלת הזיכרון כתהליך דו־שלבי: תחילה הזרקה, ובהמשך הפעלה בעקבות שליפה. 5
בדיקה ששואלת רק: "האם הסוכן נכשל מול הפרומפט הזה?" עלולה ליצור תחושת ביטחון שגויה. גם הערכה שלב־אחר־שלב שמאפסת הקשר, מדלגת על הפעלות ביניים או לא מפעילה משימה עתידית רלוונטית, עלולה שלא לשחזר את התנאים הנחוצים להפעלה.
יחידת הבדיקה המתאימה יותר היא המסלול המלא:
ההשפעה המיידית של הרעלה יכולה להיות תשובה גרועה. החשש הגדול יותר מתחיל כאשר לסוכן יש סמכות לבצע פעולות אחרי שהתייעץ בזיכרון שלו. שליפה מאוחרת עשויה להשפיע על הודעת דוא״ל, תהליך עבודה בדפדפן, פעולה במסד נתונים או משימה אחרת שמתווכת באמצעות כלי. מחקר eTAMP מראה במפורש שהגנות המבוססות על הרשאות בלבד עלולות שלא לעצור איום שהוחדר בעקיפין דרך סביבה שהסוכן מורשה לבחון. 2
במילים אחרות, הזיכרון הוא חלק מגבול האבטחה התפעולי — לא רק תכונת נוחות. מערכת זיכרון שמקבלת חומר לא מהימן ואז מציגה אותו בהמשך כהקשר שימושי, עלולה להפוך אירוע מוקדם ודל־נראות לתקרית מאוחרת. 1
4
המחקרים המצוטטים אינם מציגים הגנה אוניברסלית ואינם קובעים באיזו מידה ארגונים כבר אימצו תהליכי תגובה בשלים לאירועים כאלה. עם זאת, הם תומכים בהתייחסות לזיכרון מתמשך כמערכת רגישה לאבטחה, שדורשת בקרות מפורשות.
יש לבצע הערכות יריביות הכוללות טריגרים מושהים, הפעלות חוזרות, משימות ביניים תקינות, ניסוחים מגוונים לשליפה והרשאות כלים מציאותיות. חשוב לבדוק גם אם הסוכן מסוגל להתאושש לאחר שמזוהה כתיבת זיכרון חשודה. 2
14
יש לשמור מידע על מקור הזיכרון, הסיבה שבגללה נשמר ותנאי האמון שחלו בזמן הכתיבה. מחקר על הגנת זיכרון ארוך טווח מציע יומן כתיבות והחלטות הרשאה עמיד בפני שינוי, וממחיש את הערך של היסטוריית זיכרון שאפשר לבקר ולחקור. 31
הערה שנשלפה מהזיכרון אינה אמורה לקבל אוטומטית את הסמכות של הוראה או מדיניות מאומתת. יש להגביל את הפעולות שסוכן יכול לבצע על בסיס זיכרונות בעלי רמת אמון נמוכה או כאלה שמקורם חיצוני, ולבודד אישורים ופעולות בעלות השפעה גבוהה.
זיהוי אינו יכול להתמקד רק בפרומפטים נכנסים. צוותים צריכים לראות מה נכנס לזיכרון, מה נשלף מאוחר יותר ואילו פעולות במורד הזרם באות בעקבותיו. גישת זיהוי אחת שהוצעה מתבססת על מעברים נצפים משליפה לפעולה, אך תוצאותיה תלויות בארכיטקטורה ולכן אין לראות בה פתרון אוניברסלי. 18
תהליך התגובה צריך לאפשר לאתר רשומות חשודות, להסגיר או למחוק אותן, לבטל תקצירים נגזרים ככל שניתן, ולבדוק פעולות שבוצעו לאחר שליפת זיכרון שעשוי להיות מורעל.
הרעלת זיכרון משנה את השאלה מ־"האם הסוכן יכול להתנגד לפרומפט זדוני עכשיו?" ל־"האם הוא מסוגל לנהל בבטחה מידע שעשוי להשפיע עליו הרבה יותר מאוחר?" ניתוח 2,614 המסלולים מדגיש מדוע אי אפשר לענות על כך מאינטראקציה בודדת. בסוכנים בעלי זיכרון, בדיקות אבטחה צריכות לעקוב אחר כל הדרך: מקלט לא מהימן, דרך אחסון, שליפה מושהית ועד פעולה בעולם האמיתי. 14
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
הרעלת זיכרון היא מתקפת שלמות מושהית: תוכן לא מהימן נכתב לזיכרון המתמשך של סוכן AI ונשלף בהמשך כאילו היה ידע קודם אמין.
הרעלת זיכרון היא מתקפת שלמות מושהית: תוכן לא מהימן נכתב לזיכרון המתמשך של סוכן AI ונשלף בהמשך כאילו היה ידע קודם אמין. הניתוח בחן הרעלת שרשרת, שכתוב מדיניות, הפעלת דלת אחורית וסחיפה איטית — וממחיש מדוע בדיקת פרומפט בודד אינה מספיקה.
בסוכנים שמפעילים כלים או פועלים לאורך כמה הפעלות, כתיבת זיכרון, שליפתו, ההרשאות ומנגנוני השחזור הם כולם חלק מגבול האבטחה.