google/adk-pythonO repositório google/adk-python no GitHub continha duas classes de agentes de IA automatizados com diferentes níveis de privilégio :
/adk-issue-fix), que tinha acesso de escrita ao repositório e podia modificar pull requests.A cadeia de exploração ocorreu da seguinte forma:
/adk-issue-fix .GITHUB_TOKEN (expondo credenciais sensíveis) e adulterar revisões de pull requests — efetivamente envenenando a cadeia de suprimentos de software .Os pesquisadores descreveram isso como uma "falha no limite de privilégio entre agentes" — o agente de baixo privilégio conseguiu cruzar uma fronteira de confiança e invocar um workflow de alto privilégio que não deveria ser capaz de chamar . De acordo com o The Hacker News, os pesquisadores demonstraram execução remota de código na infraestrutura de integração contínua, com a conta adk-bot — identificada como um colaborador — servindo como ponte de autorização .
Após a divulgação das vulnerabilidades pela Pillar Security, o Google tomou as seguintes medidas:
O Google não contestou as descobertas e agiu rapidamente para remover a automação vulnerável .
O incidente destacou vários riscos sistêmicos que vão muito além do ADK do Google:
Limites de confiança entre agentes são fundamentalmente frágeis. Quando um agente pode invocar outro com privilégios mais altos, uma injeção de prompt no agente de menor privilégio se torna um vetor de ataque à cadeia de suprimentos . O agente de baixo privilégio e exposto à internet podia ser manipulado por injeção de prompt para cruzar essa fronteira e invocar o agente de alto privilégio em seu nome .
Injeção de prompt é uma falha sistêmica do framework, não apenas do modelo. Uma pesquisa da Check Point publicada simultaneamente encontrou quase uma dúzia de falhas críticas em grandes frameworks de agentes de IA, concluindo que "conteúdo controlado por prompt pode manipular o comportamento do agente de maneiras que burlam os controles de segurança pretendidos" . Os pesquisadores passaram um ano analisando frameworks de agentes e descobriram que, em muitos casos, o conteúdo controlado por prompt conseguia cruzar a fronteira para a própria lógica confiável do framework .
A classe de ataque é nova e não pode ser corrigida apenas pelos modelos. Mesmo que LLMs individuais sejam protegidos contra injeção de prompt, o design arquitetural de sistemas multiagente — onde agentes confiam implicitamente em mensagens de outros agentes — cria novas superfícies de ataque que exigem controles de segurança no nível do framework .
A definição de escopo de permissões padrão em frameworks de agentes geralmente é muito permissiva. Sem limites estritos de privilégio mínimo entre agentes, explorações semelhantes são prováveis em outras plataformas. Uma pesquisa da Palo Alto Networks publicada no início de 2026 descobriu que a definição de escopo de permissões padrão no Vertex AI do Google Cloud poderia permitir que um agente comprometido obtivesse acesso privilegiado a dados e infraestrutura .
À medida que as organizações implantam cada vez mais sistemas multiagente para revisão de código, CI/CD e automação interna, o incidente do ADK serve como um alerta crítico. O ataque demonstra que a IA baseada em agentes introduz novas superfícies de ataque que exigem controles de segurança no nível da arquitetura e do framework — não apenas no nível do modelo ou do prompt. Equipes que constroem sistemas de agentes devem implementar limites de privilégio rigorosos, validar a comunicação entre agentes e tratar a injeção de prompt como uma vulnerabilidade do framework, e não como uma peculiaridade do modelo.