Une attaque pouvait se dérouler en quelques étapes discrètes :
/proc/self/environ sk-ant-) de la clé ANTHROPIC_API_KEY afin d’éviter les détecteurs automatiques de secrets Cette surface d’attaque – où des instructions en langage naturel injectées dans des données deviennent des commandes exécutables – est au cœur de l’injection de prompt, un vecteur de menace qui redéfinit rapidement le paysage de la sécurité pour les agents IA.
Un détail crucial est qu’il s’agissait d’une divulgation coordonnée où le correctif a précédé l’annonce.
Cette divulgation est intervenue dans un contexte d’évaluation de sécurité plus large. La veille, le 4 juin 2026, la Red Team IA de Microsoft publiait la version 2.0 de sa Taxonomie des modes de défaillance dans les systèmes d’IA agentique . Cette mise à jour majeure, basée sur douze mois d’exercices réels de red teaming contre des agents en production, a ajouté sept catégories de défaillance entièrement nouvelles.
Ces nouveaux modes représentent une escalade significative dans la manière dont les chercheurs en sécurité pensent les systèmes autonomes :
Cette taxonomie étendue a fait passer le cadre de 27 à 34 modes de défaillance, reflétant la complexité et l’empreinte réelle croissantes des systèmes agentiques .
En réponse au cas Claude Code et à la mise à jour plus large de la taxonomie, Microsoft a défini un ensemble de recommandations de sécurité pour toute équipe intégrant des agents IA dans ses pipelines de construction. Le message est clair : une isolation partielle est une fausse sécurité.
Au cœur de ces recommandations se trouve un principe architectural fondamental que la communauté de la sécurité appelle la « Règle des Deux » (Rule of Two). Issue du cadre de Meta d’octobre 2025 pour la sécurité pratique des agents, cette règle stipule qu’un agent ne doit satisfaire pas plus de deux des trois conditions suivantes : traiter des entrées non fiables, avoir accès à des données sensibles, et posséder la capacité d’exécuter des actions qui modifient l’état externe . La vulnérabilité de Claude Code était une violation classique de ce principe, car l’agent gérait simultanément des entrées provenant d’une PR non fiable et détenait des informations d’identification puissantes.