google/adk-pythonIl repository GitHub google/adk-python conteneva due classi di agenti AI automatizzati con diversi livelli di privilegio :
/adk-issue-fix) che aveva accesso in scrittura al repository e poteva modificare le pull request.La catena di sfruttamento si è sviluppata come segue:
/adk-issue-fix .GITHUB_TOKEN (esponendo credenziali sensibili) e la manomissione delle revisioni delle pull request — di fatto avvelenando la supply chain del software .I ricercatori hanno descritto questa vulnerabilità come un "fallimento del confine di privilegio tra agenti" — l'agente a bassi privilegi poteva oltrepassare un confine di fiducia e invocare un workflow ad alti privilegi che non avrebbe dovuto essere in grado di chiamare . Secondo The Hacker News, i ricercatori hanno dimostrato l'esecuzione di codice arbitrario sull'infrastruttura di integrazione continua, con l'account adk-bot — identificato come collaboratore — che fungeva da ponte di autorizzazione .
Dopo che Pillar Security ha divulgato le vulnerabilità, Google ha adottato le seguenti misure:
Google non ha contestato i risultati e si è mossa rapidamente per rimuovere l'automazione vulnerabile .
L'incidente ha evidenziato diversi rischi sistemici che vanno ben oltre l'ADK di Google:
I confini di fiducia tra agenti sono fondamentalmente deboli. Quando un agente può invocarne un altro con privilegi più elevati, l'iniezione di prompt nell'agente a bassi privilegi diventa un vettore di attacco alla supply chain . L'agente a bassi privilegi, esposto a Internet, poteva essere manipolato tramite iniezione di prompt per oltrepassare questo confine e invocare l'agente ad alti privilegi per suo conto .
L'iniezione di prompt è un difetto sistemico del framework, non solo un difetto del modello. Una ricerca di Check Point pubblicata contemporaneamente ha trovato quasi una dozzina di vulnerabilità critiche nei principali framework di agenti AI, concludendo che "il contenuto controllato dai prompt può manipolare il comportamento degli agenti in modi che eludono i controlli di sicurezza previsti" . I ricercatori hanno trascorso un anno ad analizzare i framework di agenti e hanno scoperto che in molti casi, il contenuto controllato dai prompt poteva oltrepassare il confine e entrare nella logica del framework stesso, considerata affidabile .
La classe di attacco è nuova e non correggibile dai soli modelli. Anche se i singoli LLM vengono protetti contro l'iniezione di prompt, la progettazione architetturale dei sistemi multi-agente — in cui gli agenti si fidano implicitamente dei messaggi provenienti da altri agenti — crea nuove superfici d'attacco che richiedono controlli di sicurezza a livello di framework .
La definizione dell'ambito delle autorizzazioni predefinite nei framework di agenti è spesso troppo permissiva. Senza confini di privilegio minimo tra gli agenti, sfruttamenti simili sono probabili in altre piattaforme. Una ricerca di Palo Alto Networks pubblicata all'inizio del 2026 ha scoperto che l'ambito delle autorizzazioni predefinite in Vertex AI di Google Cloud poteva consentire a un agente compromesso di ottenere accesso privilegiato a dati e infrastrutture .
Poiché le organizzazioni implementano sempre più sistemi multi-agente per la revisione del codice, CI/CD e automazione interna, l'incidente ADK funge da avvertimento critico. L'attacco dimostra che l'AI agente introduce nuove superfici d'attacco che richiedono controlli di sicurezza a livello di architettura e framework — non solo a livello di modello o di prompt. I team che costruiscono sistemi agente dovrebbero implementare confini di privilegio rigorosi, validare la comunicazione tra agenti e trattare l'iniezione di prompt come una vulnerabilità del framework, non come una stranezza del modello.