Hafıza zehirleme, güvenilmeyen içeriğin ajanın kalıcı hafızasına yazılması ve daha sonra geçmişten gelen güvenilir bilgi gibi geri çağrılmasıyla işleyen gecikmeli bir bütünlük saldırısıdır. 2.614 simüle çok adımlı saldırı rotasını inceleyen araştırma; zincir zehirleme, politika yeniden yazımı, arka kapı tetikleme ve...
YayımlayanGPT-5.6 Terra ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: How does “memory poisoning” work as a delayed attack against AI agents with persistent memory—where attackers inject false information that. Article summary: Memory poisoning is a delayed integrity attack: an attacker causes untrusted content—false facts, misleading instructions, or unsafe procedures—to be written into an agent’s persistent memory. The agent may appear normal. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Kalıcı hafıza, yapay zekâ ajanlarının önceki işleri, kullanıcı tercihlerini, prosedürleri ve bağlamı görevler arasında hatırlamasını sağlar. Ne var ki bu kolaylık yeni bir güvenlik riski de doğurur: Güvenilmeyen içerik hafızaya kaydedilirse saldırganın ajanın davranışını hemen değiştirmesi gerekmez. Zehirlenmiş kayıt, daha sonraki ve ilk olayla ilgisiz görünen bir görevde geri çağrılmayı bekleyebilir. 1
5
Hafıza zehirleme, bir ajanın zaman içinde biriktirdiği bilgilerin bütünlüğünü hedef alır. Tipik akış şöyledir:
Klasik istem enjeksiyonundan temel fark zamandır. Başarılı bir kötü niyetli hafıza yazımı, ilk etkileşimde görünür bir davranış değişikliği yaratmasa bile sonraki oturumları etkileyebilir. 1
30
Her senaryoda saldırganın hafıza veritabanını doğrudan düzenlemesi de gerekmez. Web ajanlarına ilişkin araştırmalar, ajanın normal çalışırken manipüle edilmiş bir sayfayı görmesiyle hafızasının kirletilebildiği; zehirli kaydın daha sonraki bir görevde, hatta farklı bir web sitesinde etkinleşebildiği oturumlar arası ve siteler arası saldırıları tanımlıyor. 2
University of Calgary ile bağlantılı araştırmacılar, hafıza kullanan büyük dil modeli ajanlarını içeren 2.614 simüle çok adımlı saldırı rotasını analiz etti. Çalışma, saldırıyı yalnızca “başarılı” ya da “başarısız” diye sınıflandırmak yerine ele geçirmenin zaman içinde nasıl geliştiğine baktı. Dört saldırı örüntüsü ele alındı: zincir zehirleme, politika yeniden yazımı, arka kapı tetikleme ve yavaş kayma. 14
Zincir zehirleme, çok adımlı bir sürecin erken aşamasına zararlı bir öncül yerleştirir. Sonraki muhakeme, yüzeyde makul görünen ara kararlarla bu öncülün üzerine kurulabilir ve en sonunda güvensiz bir sonuca ulaşabilir. Güvenlik açısından kritik nokta, tek tek bakıldığında hiçbir adımın açıkça kötü niyetli görünmeyebilmesidir. 14
Bu yöntemde ajanın hatırladığı kurallar, onaylar, öncelikler veya çalışma varsayımları bozulur. Ajan ilerideki bir görevde değiştirilmiş kaydı geri çağırdığında, amaçlanan politika yerine saldırganın ikame ettiği politikayı izleyebilir. 14
Arka kapı niteliğindeki bir hafıza kaydı, belirli bir ifade, görev bağlamı veya anlamsal eşleşme gibi doğru tetikleyici ortaya çıkana kadar pasif kalır. İlgili çalışmalar, tek bir kirlenmiş gözlemin saklanıp sonraki oturumlarda ve farklı sitelerdeki işlerde etkinleşebileceğine dair daha geniş riski de ortaya koyuyor. 2
14
Yavaş kayma, ajanının önerilerini veya eylem kalıplarını zaman içinde küçük ama birikimli değişimlerle saptırmayı ifade eder. Kalıcı hafıza ihlaline ilişkin araştırmalar, sözcüksel ya da anlamsal açıdan benzer sonraki görevlerin zehirlenmiş kayıtları öne çıkararak oturumlar boyunca güvensiz davranış örüntülerine yol açabildiğini buluyor. 29
Calgary analizinin öne çıkardığı sorun zamansal ayrımdır: Bazı saldırılar, enjeksiyon anında normal davranıştan ayırt edilmesi zor biçimde kalabilir. Zararlı etki, ilk hafıza yazımından ayrışır ve ancak daha sonraki bir geri çağırmada görünür hale gelebilir. 14
Dolayısıyla risk doğrusal biçimde artmak zorunda değildir. Sistem birkaç etkileşim boyunca sorunsuz görünebilir; ardından ilgili görev, bağlam veya tetikleyici zehirlenmiş kaydın geri çağırma sıralamasında yeterince yükselmesine neden olduğunda risk birden belirginleşebilir. Başka araştırmalar da hafıza zehirlemeyi iki aşamalı bir süreç olarak tanımlıyor: Önce enjeksiyon, ardından geri çağırma yoluyla etkinleşme. 5
Bu yüzden yalnızca “ajan bu istemde başarısız oldu mu?” sorusunu soran bir değerlendirme yanıltıcı bir güven duygusu yaratabilir. Her adımda bağlamı sıfırlayan, aradaki oturumları atlayan veya ilgili gelecekteki görevi hiç çalıştırmayan testler de etkinleşme için gerekli koşulları yeniden üretemeyebilir.
Daha doğru test birimi, uçtan uca saldırı rotasıdır:
Zehirlemenin ilk sonucu hatalı bir yanıt olabilir. Asıl büyük risk, ajanın hafızasına başvurduktan sonra eylem yapma yetkisine sahip olmasıyla doğar. Sonraki bir geri çağırma; e-posta gönderimini, tarayıcı üzerinden yürütülen bir işlemi, veritabanı operasyonunu veya başka bir araç aracılı görevi etkileyebilir. eTAMP araştırması özellikle, ajanın incelemesine izin verilen bir ortamdan dolaylı biçimde gelen tehdidin yalnızca izin tabanlı savunmalarla her zaman durdurulamayabileceğini gösteriyor. 2
Bu nedenle hafıza, yalnızca kullanışlı bir özellik değil, operasyonel güvenlik sınırının da parçasıdır. Güvenilmeyen malzemeyi kabul eden ve bunu sonradan yararlı bağlam olarak sunan bir hafıza sistemi, ilk anda fark edilmeyen bir olayı gecikmeli bir vakaya dönüştürebilir. 1
4
Atıf yapılan araştırmalar evrensel bir savunma yöntemi ortaya koymuyor; kuruluşların olgun olay müdahale uygulamalarını ne kadar yaygın benimsediğini de göstermiyor. Ancak kalıcı hafızanın açık denetimler gerektiren, güvenlik açısından hassas bir sistem olarak ele alınmasını destekliyor.
Gecikmeli tetikleyicileri, tekrar eden oturumları, araya giren zararsız görevleri, farklı geri çağırma ifadelerini ve gerçekçi araç yetkilerini içeren saldırgan değerlendirmeler uygulayın. Şüpheli bir hafıza yazımı tespit edildiğinde ajanın toparlanıp toparlanamadığını da sınayın. 2
14
Her kaydın nereden geldiğini, neden saklandığını ve yazım anında hangi güven koşullarına tabi olduğunu kaydedin. Uzun süreli hafızayı korumaya yönelik bir araştırma, yazımları ve yetkilendirme kararlarını kurcalamaya karşı görünür bir kayıt zincirine eklemeyi öneriyor; bu yaklaşım denetlenebilir hafıza geçmişlerinin değerini gösteriyor. 31
Geri çağrılan bir not, doğrulanmış bir talimat veya politika ile aynı yetkiyi otomatik olarak taşımamalıdır. Düşük güven düzeyli ya da dış kaynaklı hafızaların ajana yaptırabileceklerini sınırlayın; kimlik bilgilerini ve yüksek etkili işlemleri birbirinden ayırın.
Tespit mekanizmaları yalnızca gelen istemlere odaklanamaz. Ekiplerin hafızaya neyin girdiğini, daha sonra neyin hatırlandığını ve bunun ardından hangi eylemlerin geldiğini görmesi gerekir. Önerilen bir tespit yaklaşımı, gözlemlenebilir geri çağırma-eylem geçişlerini kullanıyor; ancak raporlanan sonuçlar mimariye bağlı olduğundan evrensel bir çözüm olarak değerlendirilmemeli. 18
Müdahale süreci; şüpheli kayıtları bulabilmeli, karantinaya alabilmeli veya silebilmeli, mümkünse bu kayıtlardan türetilmiş özetleri geçersiz kılabilmeli ve potansiyel olarak zehirlenmiş hafızaların geri çağrılmasından sonra yapılan eylemleri inceleyebilmelidir.
Hafıza zehirleme, soruyu “Ajan şu anda kötü niyetli bir isteme direnebilir mi?” noktasından “Ajan, kendisini çok daha sonra etkileyebilecek bilgiyi güvenle yönetebilir mi?” noktasına taşıyor. Calgary ekibinin 2.614 rota üzerindeki analizi, bu sorunun tek bir etkileşimle yanıtlanamayacağını vurguluyor. Hafızalı ajanlarda güvenlik testleri; güvenilmeyen girdiden depolamaya, gecikmeli geri çağırmadan gerçek dünyadaki eyleme kadar tüm zinciri izlemeli. 14
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Hafıza zehirleme, güvenilmeyen içeriğin ajanın kalıcı hafızasına yazılması ve daha sonra geçmişten gelen güvenilir bilgi gibi geri çağrılmasıyla işleyen gecikmeli bir bütünlük saldırısıdır.
Hafıza zehirleme, güvenilmeyen içeriğin ajanın kalıcı hafızasına yazılması ve daha sonra geçmişten gelen güvenilir bilgi gibi geri çağrılmasıyla işleyen gecikmeli bir bütünlük saldırısıdır. 2.614 simüle çok adımlı saldırı rotasını inceleyen araştırma; zincir zehirleme, politika yeniden yazımı, arka kapı tetikleme ve yavaş kayma türlerini ele aldı.
Araç kullanabilen ve oturumlar arasında çalışan ajanlarda hafıza kayıtları, geri çağırmalar, yetkiler ve geri alma süreçleri güvenlik sınırının parçası olarak ele alınmalıdır.