google/adk-pythonEl repositorio google/adk-python en GitHub contenía dos clases de agentes de IA automatizados con diferentes niveles de privilegio :
/adk-issue-fix), que tenía acceso de escritura al repositorio y podía modificar pull requests.La cadena de explotación se desarrolló de la siguiente manera:
/adk-issue-fix .GITHUB_TOKEN (exponiendo credenciales sensibles) y manipular las revisiones de pull requests, envenenando efectivamente la cadena de suministro de software .Los investigadores describieron esto como una "falla en los límites de privilegios entre agentes" — el agente de bajo privilegio podía cruzar un límite de confianza e invocar un flujo de trabajo de alto privilegio que no debería haber podido llamar . Según The Hacker News, los investigadores demostraron la ejecución de código arbitrario en la infraestructura de integración continua, con la cuenta adk-bot —identificada como colaboradora— sirviendo como puente de autorización .
Después de que Pillar Security divulgara las vulnerabilidades, Google tomó las siguientes acciones:
Google no cuestionó los hallazgos y actuó rápidamente para eliminar la automatización vulnerable .
El incidente puso de manifiesto varios riesgos sistémicos que se extienden mucho más allá del ADK de Google:
Los límites de confianza entre agentes son fundamentalmente débiles. Cuando un agente puede invocar a otro con privilegios más altos, la inyección de prompt en el agente de menor privilegio se convierte en un vector de ataque a la cadena de suministro . El agente de bajo privilegio expuesto a internet podía ser manipulado mediante inyección de prompt para cruzar este límite e invocar al agente de alto privilegio en su nombre .
La inyección de prompt es un fallo sistémico del marco, no solo un fallo del modelo. La investigación de Check Point publicada simultáneamente encontró casi una docena de fallos críticos en los principales marcos de agentes de IA, concluyendo que "el contenido controlado por prompt puede manipular el comportamiento del agente de maneras que evaden los controles de seguridad previstos" . Los investigadores pasaron un año analizando marcos de agentes y descubrieron que, en muchos casos, el contenido controlado por prompt podía cruzar el límite hacia la lógica del marco de confianza en sí mismo .
La clase de ataque es novedosa e irreparable solo con modelos. Incluso si los LLM individuales están asegurados contra la inyección de prompt, el diseño arquitectónico de los sistemas multiagente —donde los agentes confían implícitamente en los mensajes de otros agentes— crea nuevas superficies de ataque que requieren controles de seguridad a nivel de marco .
El ámbito de permisos predeterminado en los marcos de agentes suele ser demasiado permisivo. Sin límites estrictos de privilegio mínimo entre agentes, es probable que se produzcan exploits similares en otras plataformas. La investigación de Palo Alto Networks publicada a principios de 2026 encontró que el ámbito de permisos predeterminado en Vertex AI de Google Cloud podía permitir que un agente comprometido obtuviera acceso privilegiado a datos e infraestructura .
A medida que las organizaciones implementan cada vez más sistemas multiagente para la revisión de código, CI/CD y automatización interna, el incidente del ADK sirve como una advertencia crítica. El ataque demuestra que la IA agentiva introduce nuevas superficies de ataque que requieren controles de seguridad a nivel de arquitectura y marco — no solo a nivel de modelo o prompt. Los equipos que construyen sistemas agentivos deben implementar límites de privilegios estrictos, validar la comunicación entre agentes y tratar la inyección de prompt como una vulnerabilidad del marco, no como una peculiaridad del modelo.