Die Forscher beschrieben einen Angriff in fünf Stufen. Die technische Demonstration wird hier bewusst auf hoher Ebene zusammengefasst:
Joe Hladik, Leiter von Rubrik Zero Labs, beschrieb das Ergebnis als „interaktiven Zugriff auf KI-Assistenten“ und als Möglichkeit, „beliebigen Code auf dem Rechner eines Opfers auszuführen“ .
Ori Lahav fasste die technische Kette auf LinkedIn als Folge von Prompt-Injection, Rechteausweitung, Pfadüberlauf, .toml-Injection und einem LD_PRELOAD-Exploit zusammen .
Rubrik meldete die Schwachstelle im Februar 2026 verantwortungsvoll an Microsoft. Nach den vorliegenden Berichten war die konkrete Lücke bis Mitte März serverseitig behoben . Andere Angaben verweisen auf die Veröffentlichung der entsprechenden AKS-Korrektur im Sicherheitsupdate vom Juni 2026 . Für Kunden von Microsoft 365 Copilot war jedenfalls kein eigener neuer Client-Patch erforderlich: Die Korrektur erfolgte auf der Serverseite .
Wichtig ist die Einschränkung: Die konkrete Schwachstelle gilt als behoben. Die grundsätzliche Angriffsidee – der Ausbruch aus einer KI-Sandbox mit anschließendem Zugriff auf Backend-Ressourcen – könnte laut Rubrik jedoch auch für andere Copiloten relevant sein .
Die Black Hat USA 2026 machte deutlich, dass die Angriffsfläche nicht auf einen einzelnen Assistenten beschränkt ist.
Zenity Labs demonstrierte unter dem Namen „PleaseFix“ Zero-Click-Angriffsketten für Claude in Chrome, Gemini in Chrome, Perplexity Comet, ChatGPT Atlas und Copilot Edge. Die Szenarien reichten von unbemerktem Daten- und Diebstahl von Zugangsdaten bis zur Kontoübernahme und Fernsteuerung eines Geräts . Versteckte Anweisungen konnten unter anderem in E-Mails, Kalendereinladungen oder Webseiten platziert werden .
Mit „AgentForger“ zeigte Zenity außerdem eine kritische Schwachstelle in OpenAI ChatGPT Workspace Agents. Ein einziger manipulierte Link konnte demnach einen von Angreifern kontrollierten KI-Agenten im Konto eines Mitarbeiters anlegen, autorisieren und starten. Der Agent nutzte dabei die Identität, Zugangsdaten und verbundenen Anwendungen des Opfers .
Eine weitere Kampagne zielte auf skills.sh, ein öffentliches Verzeichnis für Erweiterungen und sogenannte Skills von KI-Agenten. Angreifer stellten täuschend ähnliche, typosquattete Versionen beliebter Skills bereit. Eine betroffene Skill-Familie kam laut Zenity auf mehr als 1,7 Millionen kumulierte Installationen – eine Zahl, die Downloads und nicht unbedingt einzelne Nutzer bezeichnet . Die manipulierten Komponenten konnten anschließend Zugangsdaten stehlen.
In Honeypots beobachtete Zenity zudem Angreifer, die ungeschützte Ollama- und LiteLLM-Instanzen übernahmen. Sie nutzten die fremde KI-Infrastruktur, um autonome Penetrationstests und weitere offensive Werkzeuge gegen Dritte auszuführen .
Erstens: Eine Sandbox ist kein uneinnehmbarer Schutzwall. Der ChatMate-Fund macht den Ausbruch aus einer isolierten KI-Umgebung zu einem praktisch demonstrierten Risiko – vor allem dort, wo Assistenten Dokumente verarbeiten .
Zweitens: Ein Dokument-Upload kann als Einstiegspunkt genügen. Dafür braucht es in dem beschriebenen Szenario weder einen zusätzlichen Phishing-Klick noch Makros oder eine weitere bewusste Handlung des Mitarbeiters . Sicherheitskontrollen für E-Mail- und Dateiverarbeitung müssen deshalb auch berücksichtigen, dass KI-Assistenten Inhalte nicht nur lesen, sondern daraus Aktionen ableiten können.
Drittens: Prompt-Injection ist nicht allein ein Problem von Datenabfluss oder falschen Antworten. In einer verketteten Attacke kann sie der erste Schritt zu einer vollständigen Kompromittierung des Hosts werden . Unternehmen sollten daher neben Prävention auch „agentische Resilienz“ aufbauen: Aktionen müssen nachvollziehbar, begrenzbar, erkennbar und im Idealfall rückgängig zu machen sein .
Viertens: Die Lieferkette für KI-Agenten entwickelt sich zu einem eigenen Sicherheitsbereich. Öffentliche Skill-Verzeichnisse erinnern funktional an App-Stores – einschließlich des Problems, dass Nutzer Erweiterungen oft aufgrund von Namen, Bewertungen oder Installationszahlen vertrauen .
Schließlich fehlt vielen Organisationen noch der Überblick. Rubrik Zero Labs zufolge verfügen nur 23 Prozent der Unternehmen über vollständige Transparenz hinsichtlich ihrer KI-Agenten . Ohne Inventar, Protokollierung und klare Berechtigungsgrenzen dürfte es entsprechend schwer sein, einen kompromittierten Assistenten oder Agenten rechtzeitig zu erkennen.