Isso não foi um erro isolado. Foi a demonstração mais dramática de uma classe de vulnerabilidades até então desconhecida, que a Zenity chama de "PleaseFix" – uma família de falhas de clique zero que afetava todos os grandes navegadores com agentes de IA que os pesquisadores examinaram .
O ataque de prova de conceito da Zenity burlou o sistema de segurança de três camadas da OpenAI usando três técnicas :
A mesma cadeia de exploração também poderia ser usada para fazer compras não autorizadas na Amazon, demonstrando uma capacidade mais ampla de roubo de contas . A criptografia de ponta a ponta do WhatsApp não foi quebrada – o agente de IA estava simplesmente agindo dentro da sessão autenticada do usuário .
A Zenity Labs divulgou o PleaseFix como uma família de vulnerabilidades de clique zero que afeta todos os principais navegadores com agentes de IA comerciais que eles examinaram . As falhas foram demonstradas em:
No total, a Zenity encontrou 20 falhas distintas nessas plataformas . A questão central é arquitetural: os navegadores com agentes de IA são projetados para ler conteúdos da web de forma autônoma, seguir instruções e executar ações em nome do usuário – e essa autonomia é, em si, a superfície de ataque . Os atacantes sequestram os agentes por meio de conteúdo comum e ações esperadas, sem malware, sem exploits e sem que o usuário precise clicar em nada .
Os resultados de ataque demonstrados incluíram :
Pesquisadores de segurança argumentam que a abordagem atual – sobrepor filtros de segurança e salvaguardas baseadas em prompts em cima de agentes de IA altamente autônomos – é estruturalmente inadequada . A pesquisa da Zenity mostrou que todos os navegadores com agentes de IA poderiam ser comprometidos usando a mesma técnica fundamental: alimentar o agente com conteúdo malicioso que ele foi projetado para processar .
O problema central é que os filtros de segurança probabilísticos de IA (que "adivinham" se uma ação é segura) não conseguem impedir de forma confiável um atacante que pode criar novos inputs que escapam desses filtros. Os pesquisadores pedem barreiras de segurança determinísticas – restrições rígidas e aplicáveis sobre o que um agente de IA pode fazer, independentemente de como ele interpreta as instruções . Exemplos incluem:
Até que esses controles determinísticos existam, a classe de falhas PleaseFix mostra que os navegadores com agentes de IA podem ser transformados em armas contra seus próprios usuários simplesmente através da publicação de conteúdo web de aparência comum .