코넬테크 연구진이 ‘WARP(Web Agent Retrieval Poisoning)’라는 간단한 공격으로 딥리서치 AI를 속일 수 있음을 증명했다. AI 에이전트가 관련 검색어의 최대 48%에서 동일한 레딧 페이지를 반복 검색하는 구조적 결함이 문제의 핵심이다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What does a Cornell Tech study reveal about how a single short Reddit comment can trick AI deep-research agents into recommending scams or f. Article summary: A new Cornell Tech preprint (Zhang, Triedman, and Shmatikov) demonstrates that deep-research AI agents are highly vulnerable to a simple attack called **WARP (Web Agent Retrieval Poisoning)**. A single short comment, as . Topic tags: general, academic, news, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject ""We show that a tiny snippet—just 13 words—of retrieved text on a UGC website like Reddit, Wikipedia, Quora, or Facebook can change AI agents to output spam / scam content pretty c" source context "It Is Trivially Easy to Use Reddit to Manipulate AI Search, Research ..." Reference image 2: visual
당신이 생성형 AI 검색 도구에 “요즘 제일 핫한 데이트 앱 추천해 줘” 혹은 “이 구독 서비스 해지하는 가장 빠른 방법 알려줘”라고 묻는 순간, 그 답변은 이미 누군가의 교묘한 시나리오에 포섭되어 있을지 모릅니다. 무려 13단어짜리 짧은 댓글 하나면 충분합니다.
코넬테크(Cornell Tech)의 연구진 팅웨이 장(Tingwei Zhang), 해럴드 트라이드먼(Harold Triedman), 비탈리 슈마티코프(Vitaly Shmatikov)가 발표한 최신 사전 논문은 이 충격적인 취약점을 실증했습니다. 이들은 이 공격을 **WARP(Web Agent Retrieval Poisoning)**라고 명명했죠 . 국내 사용자들이 흔히 신뢰하는 “AI가 검색해서 정리해 준 정보”의 민낯이 적나라하게 드러난 순간입니다.
STORM, Co-STORM, OmniThink 같은 딥리서치 에이전트들은 여러 개의 연관 검색어를 발행한 뒤 방대한 정보를 종합해 마치 ‘레포트’ 같은 결과물을 만들어 냅니다. 그런데 코넬테크 연구진은 이 과정에서 치명적인 약점을 발견했습니다. 바로 에이전트들이 검색하는 URL의 무려 54~71%가 레딧이나 위키백과 같은 사용자 제작 콘텐츠(UGC) 플랫폼에서 온다는 사실입니다 .
문제는 여기서 발생합니다. 공격자는 사람들이 자주 찾는 인기 레딧 스레드에 “이 제품 정말 좋아요, 강추합니다” 같은 짧은 댓글을 슬쩍 끼워 넣거나, 위키백과 문서를 은밀하게 편집합니다. AI 에이전트는 특정 주제에 대해 검색을 반복할 때마다 같은 고랭킹 UGC 페이지만 계속해서 가져오기 때문에, 단 하나의 오염된 페이지만으로도 AI의 전체 조사 맥락을 감염시킬 수 있습니다 .
연구 결과는 그 효율성 면에서 경악스럽습니다. 실험에 따르면, 고작 13단어 분량의 독극물 텍스트만 심어도 38%에서 62%의 확률로 AI의 최종 출력물에 공격자의 목표물이 인용되었습니다. 이는 AI가 작성한 답변에 가짜 서비스나 사기 제품에 대한 추천이 자연스럽게 녹아들었다는 뜻입니다. 더욱이 이 효과는 다양한 검색어 클러스터와 에이전트 아키텍처 전반에서 동일하게 나타나, 단순한 버그가 아닌 구조적 취약점임이 입증되었습니다 .
게다가 이 공격은 AI의 전체 출력물을 전혀 어색하게 만들지 않습니다. 주입된 텍스트는 마치 주변의 진짜 사용자 후기처럼 자연스럽게 녹아들기 때문에, 이용자나 자동화 필터가 쉽게 알아채기 어렵습니다 .
이 사태의 근본 원인은 ‘검색 중복(Retrieval Overlap)’입니다. 연구진은 하나의 주제 클러스터 내에서 동일한 레딧 페이지가 무려 48%에 달하는 연관 질의 검색 결과에 중복 등장하는 현장을 포착했습니다. 이는 “최고의 긴급출동 서비스”, “구독 해지 방법”, “최고 평점 데이트 앱” 등 다양한 질문을 해도, 결국 바라보는 정보원은 똑같다는 의미입니다. 즉, 트래픽이 몰리는 단 하나의 레딧 스레드를 오염시키는 것만으로 해당 주제에 관한 전체 질문의 절반 가까이를 좌우할 수 있는, 매우 위험한 단일 장애점이 탄생하는 것입니다 .
연구팀은 세 가지 직관적인 방어 전략을 실험했지만, 각각 효과가 없거나 오히려 역효과를 냈습니다 .
UGC 도메인 자체를 차단한다?
오염된 레딧과 위키백과 페이지를 원천 봉쇄하면 공격을 즉시 막을 수 있습니다. 하지만 이는 ‘병 주고 약 주는’ 격입니다. UGC 플랫폼이야말로 AI 에이전트의 풍부하고 상세한 답변을 가능하게 하는 핵심 자양분이기 때문에, 도메인을 차단하는 순간 AI는 사용자가 기대하는 심층 보고서를 생산할 능력을 상실합니다 .
AI 모델에게 선별을 시킨다?
검색 전 AI가 직접 출처의 신뢰성을 평가하도록 하는 방법은 때때로 명백한 독극물을 걸러내지만, 근본적으로 신뢰할 수 없습니다. 주변의 진짜 댓글과 똑같은 어조로 정교하게 쓰인 텍스트는 이런 검열을 가볍게 통과하며, 처리 지연과 비용만 증가시킵니다 .
최종 출력물의 개연성을 검증한다?
극단적이거나 논리적으로 모순된 추천을 걸러낼 수는 있지만, WARP 공격은 매우 은밀하게 설계됩니다. 주입된 텍스트는 짧고 맥락에 완벽하게 부합하며, 전체적인 보고서의 완성도를 절대 떨어뜨리지 않습니다. 명백한 레드 플래그가 없기 때문에, 최종 문서는 검증 과정을 무사히 통과하면서도 그 안에는 조용히 공격자의 상품을 추천하는 내용이 담기게 됩니다 .
연구의 결론은 냉혹합니다. 이 취약점은 패치로 해결될 소프트웨어 버그가 아닙니다. 이 AI 에이전트들이 설계된 작동 원리 그 자체의 근본적인 결과물입니다. 소수의 반복 검색되는 UGC 페이지에 크게 의존하는 구조는 집중적이고 공략 가능한 공격 표면을 만들며, 에이전트의 핵심 기능을 함께 무너뜨리지 않고서는 어떤 기존 방어책도 이 틈을 완벽히 메울 수 없습니다 .
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
코넬테크 연구진이 ‘WARP(Web Agent Retrieval Poisoning)’라는 간단한 공격으로 딥리서치 AI를 속일 수 있음을 증명했다.
코넬테크 연구진이 ‘WARP(Web Agent Retrieval Poisoning)’라는 간단한 공격으로 딥리서치 AI를 속일 수 있음을 증명했다. AI 에이전트가 관련 검색어의 최대 48%에서 동일한 레딧 페이지를 반복 검색하는 구조적 결함이 문제의 핵심이다.
13단어의 짧은 독극물 텍스트만으로도 38 62%의 확률로 AI 최종 보고서에 사기 정보를 심을 수 있었다.