Esto no fue un error aislado. Fue la demostración más dramática de una clase de vulnerabilidades previamente no documentada que Zenity llama "PleaseFix" — una familia de fallos de un solo clic que afectaban a todos los navegadores de agente comerciales importantes que los investigadores examinaron .
El ataque de prueba de concepto de Zenity eludió el sistema de seguridad de tres niveles de OpenAI utilizando tres técnicas :
La misma cadena de explotación también podría usarse para realizar compras no autorizadas en Amazon, lo que demuestra una capacidad más amplia de apropiación de cuentas . El cifrado de extremo a extremo de WhatsApp no se rompió; el agente de IA simplemente actuaba dentro de la sesión autenticada del usuario .
Zenity Labs reveló PleaseFix como una familia de vulnerabilidades de un solo clic que afectaban a todos los navegadores de agente comerciales principales que examinaron . Los fallos se demostraron en:
En total, Zenity encontró 20 fallos distintos en estas plataformas . El problema central es arquitectónico: los navegadores de agente están diseñados para leer contenido web de forma autónoma, seguir instrucciones y realizar acciones en nombre del usuario, y esa autonomía es en sí misma la superficie de ataque . Los atacantes secuestran agentes a través de contenido ordinario y acciones esperadas sin necesidad de malware, exploits ni clics del usuario .
Los resultados de ataque demostrados incluyeron :
Los investigadores de seguridad argumentan que el enfoque actual —superponer filtros de seguridad y barreras de protección a nivel de instrucciones sobre agentes de IA altamente autónomos— es estructuralmente inadecuado . La investigación de Zenity mostró que todos y cada uno de los navegadores de agente podían ser comprometidos utilizando la misma técnica fundamental: alimentar al agente con contenido malicioso que estaba diseñado para procesar .
El problema central es que los filtros de seguridad de IA probabilísticos (que adivinan si una acción es segura) no pueden detener de manera confiable a un atacante que puede crear entradas novedosas que se cuelan a través de esos filtros. Los investigadores piden barreras de seguridad deterministas —restricciones duras y ejecutables sobre lo que un agente de IA puede hacer, independientemente de cómo interprete las instrucciones . Algunos ejemplos incluyen:
Hasta que existan tales controles deterministas, la clase de fallos PleaseFix muestra que los navegadores de agente pueden ser armados contra sus propios usuarios simplemente publicando contenido web de aspecto ordinario .