GITHUB_TOKEN (um segredo com escopo no repositório) e, em um segundo caminho, alcançar execução remota de código no próprio runner do GitHub Actions . Isso poderia permitir que um atacante modificasse comentários de pull requests, aprovasse alterações maliciosas ou adulterasse o pipeline de CI do repositório .O repositório adk-python executava dois níveis de agentes de IA em seu pipeline de CI/CD :
| Nível | Agente | Privilégio | Acionado Por |
|---|---|---|---|
| Baixo | Agente de triagem (público) | Somente leitura; pode apenas comentar em issues/PRs | Qualquer issue pública ou pull request do GitHub |
| Alto | Agente de correção de código (apenas mantenedores) | Acesso de escrita no repositório; pode modificar código, aprovar PRs, acessar segredos | Comando /adk-issue-fix postado por um Colaborador do repositório |
Cadeia de ataque passo a passo :
/adk-issue-fix")./adk-issue-fix no thread da issue.GITHUB_TOKEN) e pode modificar código ou aprovar pull requests .A falha arquitetural central foi a ausência de uma barreira de privilégio entre agentes: o agente de nível mais alto confiou no comando porque ele veio de uma conta Colaborador, sem nunca verificar se a instrução se originava de um humano confiável ou de um agente de baixo privilégio comprometido .
adk-python que estavam envolvidos na cadeia agente-para-agente: issue-analyze.yml, issue-fix.yml e pr-analyze.yml .Pesquisadores e analistas de todo o setor tiraram várias conclusões importantes desta divulgação:
Confiança entre agentes é uma nova superfície de ataque. O modelo de segurança tradicional assume limites de confiança entre humanos e software; este caso demonstra que agentes de IA podem ser usados para atacar outros agentes de IA, com o ataque cruzando limites de privilégio de forma invisível . A Cloud Security Alliance (CSA) observa que isso é uma "falha na transferência de confiança" — agentes implicitamente confiam em entradas de outros agentes sem verificar a origem real dessas instruções .
Injeção de prompt é a nova classe de injeção. Assim como a injeção de SQL e a injeção de comando definiram os anos 2000 e 2010, a injeção de prompt entre agentes — onde a saída de um agente se torna a entrada confiável de outro — é agora um vetor de ataque comprovado e viável em produção que as arquiteturas de segurança devem considerar .
Identidade e autorização de agentes são problemas não resolvidos. Atualmente, não há uma maneira padronizada para um agente de IA verificar a verdadeira identidade ou nível de privilégio de outro agente antes de agir com base em suas instruções. O ataque teve sucesso porque o sistema confiou na identidade da conta (Colaborador) em vez da origem da instrução (atacante público) . Pesquisadores da CSA pedem "frameworks de autorização entre agentes" como um primitivo de segurança fundamental .
Pipelines de CI/CD que usam agentes de IA exigem separação de privilégios. Arquitentos de segurança agora pedem: (a) agentes somente leitura que não possam emitir comandos operacionais, (b) verificação criptográfica de requisições entre agentes, (c) portões com intervenção humana para qualquer comando que escale privilégio, e (d) restrição das saídas dos agentes para evitar que emitam comandos de disparo que sistemas downstream executarão cegamente .
Este é um canário para o ecossistema agêntico mais amplo. O The Register, CSO, CSA e vários analistas enquadram isso como um ataque "primeiro de seu tipo" que quase certamente será replicado em outros frameworks multiagente (ex.: LangChain, AutoGen, CrewAI, Microsoft Copilot Studio) a menos que o setor construa segurança desde a arquitetura .