메모리 포이즈닝은 신뢰할 수 없는 내용이 AI 에이전트의 장기 기억에 저장된 뒤, 나중에 과거 지식처럼 호출되는 지연형 무결성 공격이다. 캘거리대 관련 연구진은 2,614개의 다단계 모의 공격 궤적에서 연쇄 오염, 정책 재작성, 백도어 트리거, 느린 드리프트를 분석했다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: How does “memory poisoning” work as a delayed attack against AI agents with persistent memory—where attackers inject false information that. Article summary: Memory poisoning is a delayed integrity attack: an attacker causes untrusted content—false facts, misleading instructions, or unsafe procedures—to be written into an agent’s persistent memory. The agent may appear normal. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
지속형 메모리는 AI 에이전트가 사용자 선호, 이전 업무, 절차, 맥락을 다음 작업에도 활용하게 해 준다. 그러나 신뢰할 수 없는 콘텐츠가 이 기억에 저장되면 새로운 보안 문제가 생긴다. 공격자는 즉시 오류를 일으킬 필요가 없다. 독성 정보가 훗날 전혀 다른 업무 중 다시 검색될 때까지 기다릴 수 있기 때문이다. 1
5
메모리 포이즈닝은 에이전트가 나중에 자신의 축적된 지식처럼 취급할 정보를 훼손하는 무결성 공격이다. 전형적인 흐름은 다음과 같다.
일반적인 프롬프트 인젝션과 다른 핵심은 시간차다. 악성 메모리가 한 번 기록되면, 최초 상호작용에서 눈에 띄는 이상 행동이 없더라도 이후 세션에 영향을 줄 수 있다. 1
30
모든 경우에 공격자가 메모리 데이터베이스를 직접 수정해야 하는 것도 아니다. 웹 에이전트 연구에서는 조작된 웹페이지를 에이전트가 통상적인 작업 중 열람하는 것만으로 기억이 오염되고, 이후 다른 사이트에서 수행하는 작업 중 활성화되는 세션 간·사이트 간 공격이 제시됐다. 2
캘거리대 관련 연구진은 메모리 기능을 갖춘 LLM 에이전트를 대상으로 한 다단계 모의 공격 궤적 2,614개를 분석했다. 공격 성공 여부를 단순히 이분법으로 판단하는 대신, 침해가 시간 흐름에 따라 어떻게 전개되는지를 살폈다. 분석 대상은 **연쇄 오염(chain poisoning), 정책 재작성(policy rewriting), 백도어 트리거(backdoor triggering), 느린 드리프트(slow drift)**의 네 유형이었다. 14
연쇄 오염은 다단계 처리의 이른 단계에 해로운 전제를 심어 놓는 방식이다. 이후 추론은 겉보기에는 그럴듯한 중간 결정을 거치면서 그 전제를 쌓아 올리고, 결국 안전하지 않은 결과로 이어질 수 있다. 개별 단계만 따로 보면 명백히 악성으로 보이지 않을 수 있다는 점이 보안상 중요하다. 14
정책 재작성은 기억된 규칙, 승인 기준, 우선순위, 운영 가정을 오염시킨다. 이후 업무가 바뀐 기록을 검색하면 에이전트는 원래 정책이 아니라 공격자가 바꿔 놓은 정책을 따를 수 있다. 14
백도어형 메모리 항목은 특정 문구, 업무 맥락, 의미상 일치 같은 조건이 나올 때까지 잠복한다. 관련 연구는 단 한 번의 오염된 관찰 정보가 기억에 저장된 뒤, 여러 세션과 웹사이트에 걸친 이후 작업에서 활성화될 수 있다는 더 넓은 위험을 보여준다. 2
14
느린 드리프트는 작은 변화가 누적되며 에이전트의 추천이나 행동 패턴을 서서히 바꾸는 현상이다. 지속형 메모리 침해 연구에 따르면, 어휘나 의미가 유사한 이후 업무가 독성 기록을 불러내 세션 전반에 걸친 위험한 행동 패턴을 유도할 수 있다. 29
캘거리대 관련 분석이 강조한 것은 시간의 문제다. 일부 공격은 주입 시점에는 정상 행동과 구별하기 어렵다. 피해를 유발하는 효과가 최초 메모리 기록과 분리돼 있으며, 나중에 해당 기록이 다시 검색될 때에야 나타날 수 있기 때문이다. 14
위험도 선형적으로 커지지 않는다. 관련 업무, 맥락, 트리거가 등장해 독성 메모리의 검색 순위가 충분히 올라갈 때까지 조용하다가 갑자기 커질 수 있다. 다른 연구도 메모리 포이즈닝을 주입 단계와 이후 검색을 통한 활성화 단계로 나뉘는 2단계 과정으로 설명한다. 5
따라서 “이 프롬프트에서 에이전트가 실패했는가”만 묻는 평가는 잘못된 안도감을 줄 수 있다. 단계별 평가라 해도 맥락을 초기화하거나 중간 세션을 건너뛰고, 관련된 미래 업무를 실행하지 않는다면 활성화 조건을 재현하지 못할 수 있다.
더 적절한 테스트 단위는 전체 궤적이다.
오염의 즉각적 결과는 잘못된 답변일 수 있다. 더 큰 문제는 에이전트가 기억을 참조한 뒤 실제 행동을 할 권한을 지녔을 때다. 나중에 불러온 기록은 이메일 발송, 브라우저 기반 업무 흐름, 데이터베이스 작업 등 도구를 매개로 한 업무에 영향을 미칠 수 있다. eTAMP 연구는 에이전트가 열람하도록 허용된 환경을 통해 간접적으로 유입된 위협은 권한 기반 방어만으로 막기 어려울 수 있음을 보여준다. 2
이 때문에 메모리는 단순한 편의 기능이 아니라 운영 보안 경계의 일부가 된다. 신뢰할 수 없는 자료를 받아들이고 나중에 유용한 맥락으로 제시하는 메모리 시스템은, 처음에는 눈에 띄지 않았던 사건을 지연된 보안 사고로 바꿀 수 있다. 1
4
인용된 연구가 모든 상황에 통하는 방어책을 확립했거나, 조직들이 성숙한 사고 대응 체계를 얼마나 널리 갖췄는지를 입증한 것은 아니다. 다만 지속형 메모리를 명시적 통제가 필요한 보안 민감 시스템으로 다뤄야 한다는 근거는 제공한다.
지연 트리거, 반복 세션, 중간의 정상 업무, 다양한 검색 표현, 현실적인 도구 권한을 포함한 적대적 평가를 수행해야 한다. 의심스러운 메모리 기록을 발견한 뒤 에이전트가 회복할 수 있는지도 시험할 필요가 있다. 2
14
메모리가 어디서 왔는지, 왜 저장됐는지, 기록 시점에 어떤 신뢰 조건이 적용됐는지 남겨야 한다. 장기 메모리 보호 연구는 기록·권한 승격·허용 또는 거부 판단을 변조 탐지 가능한 해시 체인에 추가하는 방식을 제안하며, 감사 가능한 메모리 이력의 가치를 보여준다. 31
검색된 메모가 검증된 지시나 정책과 같은 권위를 자동으로 가져서는 안 된다. 신뢰 수준이 낮거나 외부에서 유래한 메모리에 근거해 에이전트가 할 수 있는 일을 제한하고, 자격 증명과 고영향 작업은 분리해야 한다.
탐지는 들어오는 프롬프트만 봐서는 안 된다. 무엇이 메모리에 들어왔는지, 이후 무엇이 다시 호출됐는지, 그 뒤 어떤 행동이 이어졌는지 가시성을 확보해야 한다. 한 탐지 연구는 검색에서 행동으로 이어지는 관찰 가능한 전이를 활용했지만, 보고된 결과는 특정 아키텍처에 좌우되므로 보편적 해법으로 받아들여서는 안 된다. 18
대응 절차는 의심스러운 항목을 찾고, 격리 또는 삭제하며, 가능하다면 여기서 파생된 요약도 무효화하고, 잠재적으로 오염된 메모리가 검색된 뒤 실행된 행동을 검토할 수 있어야 한다.
메모리 포이즈닝은 질문을 바꾼다. “에이전트가 지금 이 악성 프롬프트를 막을 수 있는가”가 아니라, “훗날 자신에게 영향을 줄 수 있는 정보를 안전하게 관리할 수 있는가”가 핵심이 된다. 2,614개 궤적 분석은 단 한 번의 상호작용만으로 답을 판단할 수 없는 이유를 보여준다. 메모리를 쓰는 AI 에이전트의 보안 평가는 신뢰할 수 없는 입력에서 저장, 지연 검색, 실제 행동에 이르는 전체 경로를 따라가야 한다. 14
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
메모리 포이즈닝은 신뢰할 수 없는 내용이 AI 에이전트의 장기 기억에 저장된 뒤, 나중에 과거 지식처럼 호출되는 지연형 무결성 공격이다.
메모리 포이즈닝은 신뢰할 수 없는 내용이 AI 에이전트의 장기 기억에 저장된 뒤, 나중에 과거 지식처럼 호출되는 지연형 무결성 공격이다. 캘거리대 관련 연구진은 2,614개의 다단계 모의 공격 궤적에서 연쇄 오염, 정책 재작성, 백도어 트리거, 느린 드리프트를 분석했다.
도구를 사용하고 세션을 넘나드는 에이전트라면 메모리 기록·검색·권한·복구 절차 모두를 보안 경계의 일부로 다뤄야 한다.