google/adk-pythonDas GitHub-Repository google/adk-python enthielt zwei Klassen automatisierter KI-Agenten mit unterschiedlichen Berechtigungsstufen :
/adk-issue-fix), der Schreibzugriff auf das Repository hatte und Pull Requests ändern konnte.Die Ausnutzungskette verlief wie folgt:
/adk-issue-fix postete .GITHUB_TOKEN (Offenlegung sensibler Anmeldedaten) und die Manipulation von Pull-Request-Reviews umfassen konnte – eine effektive Vergiftung der Software-Lieferkette .Die Forscher bezeichneten dies als „Agent-to-Agent-Privilegien-Grenzverletzung“ – der Agent mit niedrigen Rechten konnte eine Vertrauensgrenze überschreiten und einen Workflow mit hohen Rechten aufrufen, den er eigentlich nicht hätte auslösen dürfen . Laut The Hacker News demonstrierten die Forscher die Ausführung beliebigen Codes auf der Continuous-Integration-Infrastruktur, wobei das Konto adk-bot – identifiziert als Collaborator – als Autorisierungsbrücke diente .
Nachdem Pillar Security die Schwachstellen gemeldet hatte, ergriff Google folgende Maßnahmen:
Google bestritt die Ergebnisse nicht und handelte schnell, um die anfällige Automatisierung zu entfernen .
Der Vorfall verdeutlichte mehrere systemische Risiken, die weit über Googles ADK hinausgehen:
Agent-to-Agent-Vertrauensgrenzen sind grundlegend schwach. Wenn ein Agent einen anderen mit höheren Rechten aufrufen kann, wird eine Prompt-Injection im Agenten mit niedrigeren Rechten zu einem Supply-Chain-Angriffsvektor . Der niedrig privilegierte, internetzugängliche Agent konnte durch Prompt-Injection manipuliert werden, um diese Grenze zu überschreiten und den hoch privilegierten Agenten in seinem Namen aufzurufen .
Prompt-Injection ist ein systemischer Framework-Fehler, nicht nur ein Modellfehler. Eine zeitgleich veröffentlichte Check-Point-Studie fand fast ein Dutzend kritischer Schwachstellen in großen KI-Agenten-Frameworks und kam zu dem Schluss, dass „Prompt-gesteuerter Inhalt das Agentenverhalten auf eine Weise manipulieren kann, die die beabsichtigten Sicherheitskontrollen umgeht“ . Die Forscher analysierten ein Jahr lang Agenten-Frameworks und stellten fest, dass in vielen Fällen Prompt-gesteuerter Inhalt die Grenze zur vertrauenswürdigen Framework-Logik selbst überschreiten konnte .
Die Angriffsklasse ist neu und durch Modelle allein nicht reparabel. Selbst wenn einzelne LLMs gegen Prompt-Injection gesichert sind, schafft die architektonische Gestaltung von Multi-Agenten-Systemen – in denen Agenten implizit Nachrichten anderer Agenten vertrauen – neue Angriffsflächen, die Sicherheitskontrollen auf Framework-Ebene erfordern .
Die standardmäßige Berechtigungsvergabe in Agenten-Frameworks ist oft zu großzügig. Ohne strikte Least-Privilege-Grenzen zwischen Agenten sind ähnliche Exploits auf anderen Plattformen wahrscheinlich. Eine Anfang 2026 veröffentlichte Palo-Alto-Networks-Studie ergab, dass die standardmäßige Berechtigungsvergabe in Google Clouds Vertex AI es einem kompromittierten Agenten ermöglichen könnte, privilegierten Zugriff auf Daten und Infrastruktur zu erlangen .
Da Organisationen zunehmend Multi-Agenten-Systeme für Code-Reviews, CI/CD und interne Automatisierung einsetzen, dient der ADK-Vorfall als kritische Warnung. Der Angriff zeigt, dass agentische KI neue Angriffsflächen schafft, die Sicherheitskontrollen auf Architektur- und Framework-Ebene erfordern – nicht nur auf Modell- oder Prompt-Ebene. Teams, die agentische Systeme entwickeln, sollten strenge Privilegien-Grenzen implementieren, die Kommunikation zwischen Agenten validieren und Prompt-Injection als Framework-Schwachstelle behandeln, nicht als Modell-Eigenart.