
Create a landscape editorial hero image for this Studio Global article: What does a Cornell Tech study reveal about how a single short Reddit comment can trick AI deep-research agents into recommending scams or f. Article summary: A new Cornell Tech preprint (Zhang, Triedman, and Shmatikov) demonstrates that deep-research AI agents are highly vulnerable to a simple attack called **WARP (Web Agent Retrieval Poisoning)**. A single short comment, as . Topic tags: general, academic, news, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject ""We show that a tiny snippet—just 13 words—of retrieved text on a UGC website like Reddit, Wikipedia, Quora, or Facebook can change AI agents to output spam / scam content pretty c" source context "It Is Trivially Easy to Use Reddit to Manipulate AI Search, Research ..." Reference image 2: visual
Bir dahaki sefere bir yapay zekâ araştırma aracına "en iyi arkadaşlık uygulaması hangisi?" veya "şu üyeliği nasıl iptal ederim?" diye sorduğunuzda alacağınız cevap, bir dolandırıcının Reddit'teki bir yoruma gizlediği birkaç kelimeyle belirlenmiş olabilir. Cornell Tech'ten Tingwei Zhang, Harold Triedman ve Vitaly Shmatikov tarafından yayımlanan yeni bir ön baskı makale, derin araştırma yapan yapay zekâ ajanlarının, WARP (Web Ajanı Getirme Zehirlemesi - Web Agent Retrieval Poisoning) adı verilen bir saldırıyla endişe verici derecede kolay manipüle edilebildiğini gösteriyor .
STORM, Co-STORM ve OmniThink gibi derin araştırma ajanları, birbiriyle ilişkili çok sayıda arama sorgusu oluşturarak ve elde ettikleri bilgileri kapsamlı bir rapor halinde sentezleyerek çalışır. Cornell'li araştırmacılar bu sistemlerde kritik bir zayıflık tespit etti: Bu ajanlar, kullanıcı tarafından oluşturulan içeriğe (UGC) aşırı derecede bağımlı. Bir araştırma oturumu sırasında getirilen tüm URL'lerin %54 ila %71'i, başta Reddit ve Wikipedia olmak üzere UGC platformlarından geliyor .
Bu yoğunlaşma, istismar edilebilir bir saldırı yüzeyi yaratıyor. Saldırganın yapması gereken tek şey, popüler bir Reddit başlığı altına veya bir Wikipedia sayfasına, sahte bir ürün ya da dolandırıcı bir hizmet gibi belirli bir hedefi tanıtmak amacıyla özel olarak hazırlanmış bir yorum eklemek. Ajanlar, belirli bir konudaki farklı sorgular için aynı üst sıradaki UGC sayfalarını defalarca getirdiğinden, zehirlenmiş tek bir sayfa ajanın tüm araştırma bağlamını enfekte edebiliyor .
Sonuçlar, verimliliği açısından çarpıcı. Çalışma, 13 kelime gibi kısa bir zehirli metnin %38 ila %62 arasında bir "bahsedilme oranına" ulaşabildiğini ortaya koydu. Bu, saldırganın hedefindeki varlığın, o konudaki sorgularda ajanın nihai çıktısında doğrudan alıntılandığı anlamına geliyor. Makale, bu etkinliğin birden fazla sorgu kümesi ve farklı ajan mimarileri için geçerli olduğunu doğruluyor ve güvenlik açığının tek bir sisteme özgü değil, yapısal olduğunu gösteriyor .
Saldırı, genel raporun saçma veya düşük kaliteli görünmesine yol açmıyor. Enjekte edilen metin, meşru içerikle inandırıcı bir şekilde kaynaşıyor ve bu da dolandırıcı bir ürünün ustaca tanıtımını hem kullanıcıların hem de otomatik filtrelerin tespit etmesini zorlaştırıyor .
Sorunun özünde, "getirme örtüşmesi" yatıyor. Araştırmacılar, tek bir konu kümesi içindeki ilişkili sorguların %48'ine varan bir kısmı için arama sonuçlarında aynı Reddit sayfalarının göründüğünü gözlemledi. Bu, iyi trafik alan tek bir Reddit başlığını zehirlemenin, o konudaki tüm kullanıcı sorgularının neredeyse yarısını etkileyebileceği anlamına geliyor. "En iyi yol yardımı"ndan "en iyi arkadaşlık uygulamaları"na kadar birçok konuda bu yoğunlaşma, tek bir hata noktasını geniş çaplı bir güvenlik açığına dönüştürüyor .
Araştırma ekibi, üç basit savunma stratejisini test etti ve her birinin ya etkisiz ya da kendi kendine zarar veren bir yöntem olduğunu gördü .
UGC alan adlarını tamamen engellemek, zehirli Reddit ve Wikipedia sayfalarını getirme havuzundan çıkararak saldırıyı anında durdurur. Ancak bu savunma, hastalıktan daha beter bir tedavidir: UGC platformları, derin araştırma ajanlarını değerli kılan zengin, ayrıntılı ve deneyimsel bilgiyi sağlar. Bunları kaldırmak, ajanların kullanıcıların beklediği kapsamlı raporları üretemez hale gelmesine yol açar .
Ajanın kendi dil modelini kaynakları taramak için kullanmak bazen bariz zehirlemeleri yakalasa da temelde güvenilmezdir. Etrafındaki meşru yorumlarla aynı tonda yazılmış, iyi hazırlanmış bir zehirli metin bu kontrolleri kolayca atlatır. Ayrıca bu yaklaşım, güvenlikte orantılı bir kazanç sağlamadan önemli ölçüde işlem gecikmesi ve maliyet ekler .
Nihai çıktıya makuliyet kontrolleri uygulamak, bazı aşırı veya mantıksız tavsiyeleri işaretleyebilir. Sorun şu ki, WARP saldırıları fark edilmeyecek şekilde tasarlanmıştır. Zehirli enjeksiyon kısa, bağlama uygun ve raporun genel kalitesini düşürmez. Nihai belge, artık sessizce saldırganın seçtiği bir ürünü tavsiye etse de, bariz bir kırmızı bayrak olmadan makuliyet incelemelerini geçer .
Çalışmanın vardığı sonuç düşündürücü. Bu güvenlik açığı, bir yama ile düzeltilebilecek bir yazılım hatası değil; bu ajanların çalışmak üzere nasıl tasarlandığının temel bir sonucu. Az sayıda ve tekrar tekrar getirilen UGC sayfasına olan ağır bağımlılıkları, mevcut hiçbir savunmanın, ajanların temel işlevselliğini de bozmadan kapatamayacağı, yoğun ve istismar edilebilir bir saldırı yüzeyi yaratıyor .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Cornell Tech araştırmacıları, derin araştırma yapan yapay zekâ ajanlarının WARP adı verilen basit bir saldırıya karşı son derece savunmasız olduğunu buldu.
Cornell Tech araştırmacıları, derin araştırma yapan yapay zekâ ajanlarının WARP adı verilen basit bir saldırıya karşı son derece savunmasız olduğunu buldu. Saldırının başarısı, yapay zekâ ajanlarının, ilgili sorguların %48'ine varan bir oranda aynı kullanıcı tarafından oluşturulan içerik sayfalarını tekrar tekrar getirmesinden kaynaklanıyor.