Keracunan memori ialah serangan integriti tertangguh: kandungan tidak dipercayai disimpan dalam memori berterusan ejen AI, lalu muncul semula sebagai pengetahuan lampau yang kelihatan sah. Analisis 2,614 trajektori serangan berbilang langkah meneliti keracunan berantai, penulisan semula dasar, pencetus pintu belakan...
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does “memory poisoning” work as a delayed attack against AI agents with persistent memory—where attackers inject false information that. Article summary: Memory poisoning is a delayed integrity attack: an attacker causes untrusted content—false facts, misleading instructions, or unsafe procedures—to be written into an agent’s persistent memory. The agent may appear normal. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Memori berterusan menjadikan ejen AI lebih berguna. Ia boleh mengingati pilihan pengguna, kerja terdahulu, prosedur dan konteks antara tugasan. Namun, ciri yang sama juga mewujudkan masalah keselamatan tersendiri: jika kandungan tidak dipercayai tersimpan sebagai memori, penyerang tidak semestinya perlu mencetuskan kegagalan serta-merta. Mereka boleh menunggu sehingga ejen mengambil semula rekod yang telah dicemari itu dalam tugasan lain yang kelihatan tidak berkaitan. 1
5
Keracunan memori ialah serangan terhadap integriti maklumat yang kemudiannya dianggap ejen sebagai sebahagian daripada pengetahuan terkumpulnya sendiri. Secara ringkas, urutannya ialah:
Perbezaan utama berbanding suntikan arahan (prompt injection) biasa ialah faktor masa. Penulisan memori berniat jahat yang berjaya boleh mempengaruhi sesi kemudian, walaupun interaksi asal tidak menunjukkan perubahan tingkah laku yang ketara. 1
30
Tidak semua keadaan memerlukan penyerang mengubah pangkalan data memori secara langsung. Penyelidikan tentang ejen web, misalnya, menghuraikan serangan merentas sesi dan merentas laman: ejen melihat halaman yang dimanipulasi ketika beroperasi seperti biasa, pemerhatian itu mencemari memorinya, dan kesannya diaktifkan dalam tugasan kemudian di laman lain. 2
Penyelidik yang berkaitan dengan Universiti Calgary menganalisis 2,614 trajektori serangan berbilang langkah yang disimulasikan melibatkan ejen model bahasa besar (LLM) dengan keupayaan memori. Mereka tidak sekadar menilai serangan sebagai berjaya atau gagal, sebaliknya meneliti bagaimana kompromi berkembang mengikut masa. Empat corak serangan dikaji: keracunan berantai, penulisan semula dasar, pencetus pintu belakang dan hanyutan perlahan. 14
Keracunan berantai menanam premis berbahaya pada peringkat awal proses berbilang langkah. Penaakulan selepas itu boleh membina atas premis tersebut menerusi keputusan perantaraan yang kelihatan munasabah, sebelum akhirnya menghasilkan keputusan tidak selamat. Dari sudut keselamatan, tiada satu langkah pun semestinya kelihatan jelas berniat jahat apabila diperiksa secara berasingan. 14
Penulisan semula dasar mencemari peraturan, kelulusan, keutamaan atau andaian operasi yang diingati. Apabila rekod yang telah diubah itu diambil semula dalam tugasan kemudian, ejen mungkin mengikut dasar gantian yang ditetapkan penyerang, bukannya dasar yang dimaksudkan. 14
Rekod memori bergaya pintu belakang kekal tidak aktif sehingga tugasan akan datang mengandungi pencetus yang sepadan, seperti frasa tertentu, konteks tugasan atau padanan semantik. Penyelidikan terdahulu menunjukkan risiko lebih luas apabila satu pemerhatian yang tercemar boleh disimpan dan diaktifkan dalam kerja masa hadapan merentas sesi serta laman web. 2
14
Hanyutan perlahan merujuk perubahan kecil yang mengalihkan cadangan atau corak tindakan ejen secara beransur-ansur. Penyelidikan mengenai kompromi memori berterusan mendapati tugasan kemudian yang serupa dari segi perkataan atau makna boleh memunculkan rekod tercemar dan mendorong corak tidak selamat merentas sesi. 29
Analisis Calgary menekankan masalah temporal: sesetengah serangan sukar dibezakan daripada tingkah laku biasa ketika suntikan berlaku. Kesan berbahaya dipisahkan daripada penulisan memori asal dan mungkin hanya muncul selepas proses pengambilan semula pada masa hadapan. 14
Risikonya juga tidak semestinya meningkat secara lurus. Ia boleh senyap sepanjang beberapa interaksi, kemudian meningkat apabila tugasan, konteks atau pencetus yang relevan menyebabkan memori tercemar mendapat kedudukan cukup tinggi untuk diambil semula. Penyelidikan lain turut menghuraikan keracunan memori sebagai proses dua fasa: suntikan terlebih dahulu, diikuti pengaktifan kemudian melalui pengambilan semula. 5
Justeru, ujian yang hanya bertanya, “Adakah ejen gagal pada arahan ini?” boleh memberikan rasa selamat yang palsu. Penilaian langkah demi langkah yang menetapkan semula konteks, melangkau sesi di antara, atau tidak menguji tugasan masa hadapan yang berkaitan juga mungkin tidak dapat menghasilkan semula keadaan bagi pengaktifan serangan.
Unit ujian yang lebih sesuai ialah keseluruhan trajektori, meliputi:
Kesan segera keracunan mungkin sekadar jawapan yang salah. Kebimbangan lebih besar timbul apabila ejen mempunyai kuasa untuk bertindak selepas merujuk memorinya. Pengambilan semula pada masa hadapan boleh mempengaruhi e-mel, aliran kerja pelayar web, operasi pangkalan data atau tugasan lain yang menggunakan alat. Penyelidikan eTAMP menunjukkan bahawa pertahanan berasaskan kebenaran sahaja mungkin tidak dapat menghentikan ancaman yang masuk secara tidak langsung melalui persekitaran yang memang dibenarkan untuk diperiksa oleh ejen. 2
Ini menjadikan memori sebahagian daripada sempadan keselamatan operasi, bukan sekadar ciri kemudahan. Sistem memori yang menerima bahan tidak dipercayai dan kemudian memaparkannya sebagai konteks berguna boleh mengubah peristiwa awal yang sukar dikesan menjadi insiden tertangguh. 1
4
Penyelidikan yang dirujuk tidak membuktikan satu pertahanan sejagat, dan tidak menunjukkan sejauh mana organisasi telah menggunakan amalan tindak balas insiden yang matang. Namun, dapatan itu menyokong pendekatan yang menganggap memori berterusan sebagai sistem sensitif keselamatan dan memerlukan kawalan yang jelas.
Gunakan penilaian adversarial yang memasukkan pencetus tertangguh, sesi berulang, tugasan biasa di antara, variasi frasa pengambilan semula dan kebenaran alat yang realistik. Uji juga sama ada ejen boleh pulih selepas penulisan memori yang mencurigakan dikenal pasti. 2
14
Rekodkan dari mana memori datang, sebab ia disimpan dan syarat kepercayaan yang dikenakan ketika penulisan. Satu cadangan perlindungan memori jangka panjang menggunakan log penulisan serta keputusan kebenaran yang dapat dikesan ganggu, menunjukkan nilai sejarah memori yang boleh diaudit. 31
Nota yang diambil semula tidak sepatutnya secara automatik mempunyai kuasa yang sama seperti arahan atau dasar yang telah disahkan. Hadkan tindakan yang boleh dibuat oleh ejen berdasarkan memori berkepercayaan rendah atau memori daripada sumber luaran, dan asingkan kelayakan akses serta tindakan berimpak tinggi.
Pengesanan tidak boleh tertumpu pada arahan masuk sahaja. Pasukan keselamatan memerlukan keterlihatan tentang apa yang masuk ke memori, apa yang dipanggil semula kemudian dan tindakan susulan yang berlaku. Satu pendekatan pengesanan yang dicadangkan menggunakan peralihan yang boleh diperhatikan antara pengambilan memori dan tindakan, tetapi hasilnya bergantung pada seni bina dan tidak patut dianggap penyelesaian sejagat. 18
Proses respons perlu membolehkan rekod mencurigakan dikenal pasti, dikuarantin atau dipadamkan; ringkasan terbitan dibatalkan jika boleh; serta tindakan yang dibuat selepas memori berpotensi tercemar diambil semula disemak.
Keracunan memori mengubah soalan keselamatan daripada “Bolehkah ejen menolak arahan berniat jahat sekarang?” kepada “Bolehkah ia mengurus maklumat dengan selamat apabila maklumat itu mungkin mempengaruhinya jauh kemudian?” Analisis 2,614 trajektori oleh penyelidik Calgary menunjukkan sebab jawapan itu tidak boleh ditentukan melalui satu interaksi sahaja. Bagi ejen AI yang mempunyai memori, ujian keselamatan perlu menjejak keseluruhan laluan: daripada input tidak dipercayai, kepada penyimpanan, pengambilan semula tertangguh dan tindakan di dunia sebenar. 14
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Keracunan memori ialah serangan integriti tertangguh: kandungan tidak dipercayai disimpan dalam memori berterusan ejen AI, lalu muncul semula sebagai pengetahuan lampau yang kelihatan sah.
Keracunan memori ialah serangan integriti tertangguh: kandungan tidak dipercayai disimpan dalam memori berterusan ejen AI, lalu muncul semula sebagai pengetahuan lampau yang kelihatan sah. Analisis 2,614 trajektori serangan berbilang langkah meneliti keracunan berantai, penulisan semula dasar, pencetus pintu belakang dan hanyutan perlahan.
Bagi ejen yang boleh menggunakan alatan atau bertindak merentas sesi, penulisan memori, pengambilan semula, kebenaran dan pemulihan perlu dianggap sebagai sebahagian daripada sempadan keselamatan.