Los resultados son sorprendentes por su eficacia. El estudio descubrió que un texto envenenado de tan solo 13 palabras fue suficiente para alcanzar tasas de mención del 38% al 62%, lo que significa que la entidad objetivo del atacante fue citada directamente en el resultado final del agente para ese rango de consultas. El documento confirma que esta efectividad se mantuvo en múltiples grupos de consultas y diferentes arquitecturas de agentes subyacentes, demostrando que la vulnerabilidad es estructural y no se limita a un solo sistema .
El ataque no hace que el informe general parezca absurdo o de baja calidad. El texto inyectado se mezcla de forma verosímil con el contenido legítimo, lo que dificulta que tanto los usuarios como los filtros automáticos detecten la sutil promoción de un producto fraudulento .
El núcleo del problema es el solapamiento en la recuperación de información. Los investigadores observaron que las mismas páginas de Reddit aparecían en los resultados de búsqueda de hasta el 48% de las consultas relacionadas dentro de un mismo grupo temático. Esto significa que envenenar un solo hilo de Reddit con mucho tráfico puede influir en casi la mitad de todas las consultas de los usuarios sobre ese tema, desde "mejor asistencia en carretera" hasta "cómo cancelar una suscripción" o "apps de citas mejor valoradas". Esta concentración convierte un único punto de fallo en una vulnerabilidad de amplio espectro .
El equipo de investigación probó tres estrategias de defensa directas y descubrió que cada una era ineficaz o contraproducente .
Bloquear por completo los dominios de UGC detiene el ataque de inmediato al eliminar las páginas contaminadas de Reddit y Wikipedia del conjunto de datos. Sin embargo, esta defensa es peor que la enfermedad: las plataformas de UGC proporcionan la información rica, detallada y basada en experiencias que hace que los agentes de investigación profunda sean valiosos en primer lugar. Eliminarlas inhabilita a los agentes para producir los informes completos que los usuarios esperan .
Usar el propio modelo de lenguaje del agente para filtrar las fuentes antes de la recuperación a veces detecta el envenenamiento más obvio, pero no es fiable en lo fundamental. Un texto envenenado bien elaborado, escrito con el mismo tono que los comentarios legítimos circundantes, evade estas comprobaciones con facilidad. Este enfoque también añade una latencia de procesamiento y un coste significativos sin una ganancia proporcional en seguridad .
Aplicar comprobaciones de verosimilitud al resultado final puede señalar algunas recomendaciones extremas o lógicamente inconsistentes. El problema es que los ataques WARP están diseñados para ser sutiles. La inyección envenenada es corta, apropiada para el contexto y no degrada la calidad general del informe. El documento final supera las revisiones de verosimilitud sin mostrar señales de alarma evidentes, aunque ahora recomiende silenciosamente un producto elegido por el atacante .
La conclusión del estudio es aleccionadora. La vulnerabilidad no es un fallo de software que pueda parcharse; es una consecuencia fundamental de cómo están diseñados para funcionar estos agentes. Su gran dependencia de un pequeño conjunto de páginas de UGC, recuperadas repetidamente, crea una superficie de ataque concentrada y explotable que ninguna defensa existente puede sellar sin inutilizar también la funcionalidad principal de los agentes .