Défense en profondeur par couches — Le blog sécurité de Microsoft (mai 2026) définit quatre couches d'atténuation : la couche modèle (données d'entraînement, réglages fins, comportements de refus), la couche système de sécurité (filtrage de contenu en temps d'exécution, garde-fous, journalisation, observabilité), la couche application (autorisations, workflows, chemins d'escalade) et la couche de positionnement (documentation de transparence et divulgations UX) . Un article de blog ultérieur en juin ajoute une vue plus granulaire en quatre couches : la couche modèle, la couche système de sécurité, la couche de métaprompt et d'ancrage, et la couche agentique (autorisations d'utilisation des outils et contrôles humains dans la boucle) .
Listes blanches au niveau locataire pour les serveurs MCP — Les organisations doivent maintenir une liste approuvée d'éditeurs et de serveurs MCP (Model Context Protocol). Le catalogue MCP de Microsoft fournit des serveurs propriétaires vérifiés, et tous les composants externes sont traités comme faisant partie de la chaîne d'approvisionnement logicielle. La recommandation est de désactiver « Tout autoriser » sur les connexions MCP et d'activer uniquement les outils spécifiques dont un agent a besoin .
Génération de SBOM pour les déploiements d'agents — Une nomenclature logicielle (SBOM) incluant les dépendances des outils, avec vérification de la signature et de la provenance des serveurs MCP avant l'installation. Microsoft recommande également l'analyse des registres pour détecter des instructions cachées dans les descriptions d'outils, le verrouillage des versions avec suivi des modifications pour toutes les définitions d'outils externes .
Garde-fous basés sur les politiques — Au-delà de la surveillance, les organisations peuvent appliquer des contrôles basés sur des politiques pour définir ce que les agents sont autorisés à faire, appliqués via le SDK Agent 365 et l'infrastructure de politique Windows . Le blog des développeurs Windows de Microsoft déclare : « Le confinement limite ce que les agents peuvent accéder et faire, de sorte que le comportement non déterministe ne se traduise pas par un risque incontrôlable » .
Gouvernance du plan de contrôle — Propriété centralisée, gestion du cycle de vie des identités et application de la conformité pour tous les agents d'une organisation. Le cadre d'adoption du cloud Azure de Microsoft recommande d'établir une base de référence de gouvernance et de sécurité centralisée et exécutoire, alignée sur les pratiques existantes d'identité, de gouvernance des données et de sécurité .
Le cadre cible l'ensemble de la chaîne d'attaque : l'empoisonnement de la chaîne d'approvisionnement (via les listes blanches et les SBOM), l'escalade de privilèges (via l'isolation MXC), l'exfiltration de données (via les garde-fous d'exécution et le filtrage de contenu) et l'utilisation non autorisée d'outils (via les contrôles d'autorisation et les boucles de vérification humaine) . La taxonomie de Microsoft des modes de défaillance après un an de simulation d'attaques sur les systèmes agentiques ajoute une architecture de confiance zéro entre agents : pour les scénarios à haut risque, l'identité de l'agent doit être établie cryptographiquement, et non supposée à partir de sa position dans un workflow .
Deux initiatives majeures au milieu de l'année 2026 illustrent le pivotement du secteur vers l'utilisation d'agents IA de manière offensive et défensive en cybersécurité, tout en imposant simultanément des garde-fous plus stricts.
Annoncé le 27 juillet 2026, Project Perception est un système de sécurité agentique qui va au-delà de la simple génération d'alertes pour passer à une action automatisée continue . Microsoft l'a décrit comme un « système de défense en apprentissage continu » capable de « raisonner, prioriser et agir à la vitesse de la machine tout en gardant les humains fermement aux commandes » .
Pourquoi c'est important : C'est un exemple concret d'agents IA se voyant attribuer des rôles actifs et autonomes dans la cyberdéfense : sonder les systèmes, corriger les vulnérabilités et répondre aux menaces sans attendre les instructions humaines. Le contrôle plus strict provient des règles de confinement ci-dessus : les agents de Project Perception opèrent toujours dans des conteneurs MXC, sous des garde-fous basés sur des politiques, avec observabilité et supervision humaine .
Formée le 27 juillet 2026 — quelques jours après un incident très médiatisé chez Hugging Face qui a mis en lumière les risques de perdre le contrôle d'agents IA autonomes — l'OSAA est une coalition industrielle qui construit des outils de sécurité open source pour les agents IA .
Pourquoi c'est important : L'OSAA représente une reconnaissance collective du secteur qu'aucun fournisseur unique ne peut sécuriser les agents autonomes seul. L'accent mis par l'alliance sur les modèles ouverts et les outils partagés est un contrepoint délibéré aux approches propriétaires fermées : le pari est qu'un accès communautaire plus large aux outils de sécurité devancera les attaquants . Nvidia a déclaré : « Les modèles ouverts démocratisent les capacités défensives, augmentent la transparence pour les défenseurs, permettent la cyberdéfense tout en protégeant les données, et complètent les modèles fermés de pointe avec des contrôles personnalisables et localisés » .
| Dimension | Microsoft | Industrie (OSAA / Nvidia) |
|---|---|---|
| Philosophie de contrôle | Contenants au niveau OS (MXC), garde-fous politiques, contrôles de chaîne d'approvisionnement | Outils partagés open source, directives transparentes (SAFE), défense menée par la communauté |
| Défense active | Project Perception — agents rouges/bleus/verts autonomes qui détectent, corrigent et remédient | Harnais d'agents ouverts et garde-fous d'exécution permettant des opérations agentiques sûres |
| Risque adressé | Actions non autorisées des agents, exfiltration de données, empoisonnement de la chaîne d'approvisionnement | Perte de contrôle des agents, divulgation opaque des vulnérabilités, outils de sécurité fragmentés |
| Contrainte clé | Les agents fonctionnent dans des conteneurs verrouillés sous une politique définie par l'humain | Des bases de référence de sécurité partagées et des cadres ouverts empêchent le verrouillage propriétaire tout en élevant le niveau général |
Le schéma est évident : les mêmes entreprises qui poussent les agents IA vers des rôles de cyberdéfense actifs et autonomes sont aussi celles qui construisent en urgence les structures de confinement et de gouvernance pour empêcher ces agents de devenir la prochaine génération de menaces de sécurité.