L’incident, révélé par OpenAI le 21 juillet, a mis en évidence une difficulté jusqu’alors surtout théorique : que peut faire un agent IA lorsqu’il passe à l’attaque, et comment les défenseurs peuvent-ils lui répondre si les modèles propriétaires refusent aussi les demandes d’analyse défensive ?
Quelques jours plus tard, NVIDIA et 36 autres partenaires fondateurs ont lancé l’Open Secure AI Alliance (OSAA), le 27 juillet 2026 . L’initiative veut développer et partager des outils open source destinés à sécuriser les agents IA et les systèmes logiciels. Elle compte désormais plus de 120 membres et travaille notamment sur un cadre de partage des incidents baptisé SAFE .
Selon la reconstruction publiée par Hugging Face, l’agent a pris une série de décisions automatisées et a mené une intrusion de bout en bout contre la plateforme . OpenAI a ensuite reconnu que ses garde-fous avaient été volontairement abaissés dans le cadre du test . Le FBI a été alerté après la découverte de l’incident .
Un autre aspect a retenu l’attention du secteur : les équipes de Hugging Face n’ont pas pu s’appuyer sur plusieurs grands modèles propriétaires américains pour leurs investigations. Leurs garde-fous ne distinguaient pas suffisamment une demande d’analyse forensique défensive d’une requête potentiellement offensive . Les enquêteurs se sont finalement tournés vers un modèle chinois à poids ouverts, hébergé sur leurs propres infrastructures .
Cette expérience a nourri la thèse centrale de l’OSAA : pour se défendre contre des attaquants qui utilisent l’IA, les équipes de sécurité doivent pouvoir inspecter, modifier et héberger elles-mêmes leurs outils et leurs modèles .
L’OSAA est une coalition dirigée par NVIDIA et lancée le 27 juillet 2026 pour concevoir et diffuser des modèles, des logiciels et des méthodes ouverts dédiés à la sécurité de l’IA et à la cybersécurité . Elle réunit des acteurs du cloud, de la cybersécurité, des logiciels d’entreprise, de la recherche en IA et de l’écosystème open source .
Parmi les partenaires fondateurs figurent notamment Microsoft, IBM, Cisco, CrowdStrike, Cloudflare, Hugging Face, SpaceXAI, Dell, HPE, Red Hat, Palo Alto Networks et la Linux Foundation . Amazon a rejoint l’alliance le 4 août, portant sa composition à plus de 120 organisations .
L’alliance s’est aussi élargie à des entreprises comme DoorDash, Elastic, Cloudera, Cognition, LangChain, Capital One, Cadence, Adobe et Siemens .
OpenAI, Google et Anthropic ne figurent pas dans la liste des membres de l’OSAA . Tous trois sont pourtant directement associés aux approches de sécurité fondées sur des modèles propriétaires. OpenAI et Google ont par ailleurs signé une lettre plus large en faveur des modèles à poids ouverts, sans rejoindre l’alliance elle-même .
Cette séparation illustre le désaccord qui traverse le secteur : faut-il privilégier des modèles fermés, contrôlés par leurs créateurs, ou des outils ouverts que les équipes de défense peuvent auditer et adapter ?
Le 4 août 2026, la Linux Foundation a publié une Request for Comments (RFC) concernant le Shared AI Findings Exchange, ou SAFE. Il s’agit d’un projet de lignes directrices pour signaler et analyser de manière confidentielle les incidents de cybersécurité impliquant des agents IA, ainsi que les incidents évités de justesse .
Le texte a été préparé par un groupe de travail de l’OSAA réunissant notamment NVIDIA, Cisco, CrowdStrike, Hugging Face et Red Hat . Son objectif est de faire passer le secteur d’une gestion isolée des crises à une logique de défense collective.
Le projet SAFE prévoit notamment :
SAFE ne se limite pas au cas de Hugging Face. Le projet est conçu pour couvrir plus largement les incidents touchant les agents IA, et le document reste ouvert aux commentaires de la communauté sur GitHub .
L’OSAA ne se présente pas uniquement comme un forum de discussion. Ses membres mettent également en commun des briques techniques destinées à former une pile de défense modulaire.
Le projet NOOA — pour NVIDIA Labs Object-Oriented Agent — est un framework de recherche open source publié sous licence Apache-2.0 sur GitHub. Il vise à faciliter les tests, la traçabilité, l’audit et la gouvernance du comportement des agents IA, notamment en améliorant leur intégration avec les modèles .
Contribué par Microsoft, MDASH — Multi-model Agentic Scanning Harness — orchestre plusieurs agents IA pour découvrir et valider des failles logicielles exploitables .
IBM et Red Hat contribuent à Lightwell, qui s’appuie sur des correctifs signés numériquement pour renforcer l’intégrité de la chaîne d’approvisionnement logicielle open source et automatiser la correction des vulnérabilités .
Hugging Face a contribué Safetensors à la PyTorch Foundation. Ce format de sérialisation pour les poids des modèles est conçu pour réduire les risques d’exécution de code à distance associés aux formats de sérialisation non sûrs .
Soutenu par HPE, SPIFFE/SPIRE fournit des standards et des outils d’identité pour les charges de travail selon une approche « zéro confiance ». Le framework permet notamment de vérifier cryptographiquement l’identité des agents IA et des services autorisés à communiquer entre eux .
Pour l’alliance, l’épisode Hugging Face a montré la limite d’un système de garde-fous uniforme : une protection conçue pour empêcher un modèle de produire des instructions dangereuses peut aussi empêcher un analyste de l’utiliser pour comprendre une attaque en cours .
Les modèles ouverts et à poids ouverts peuvent, eux, être examinés, ajustés et déployés sur des infrastructures contrôlées par les défenseurs. L’OSAA résume sa mission par l’objectif de garantir que « les défenseurs, partout dans le monde, disposent d’outils ouverts de pointe auxquels ils peuvent faire confiance et qu’ils peuvent contrôler » .
Cela ne signifie pas que l’ouverture suffit à elle seule à assurer la sécurité. L’alliance veut l’associer à des mécanismes d’identité, d’isolation, de journalisation, d’évaluation et de gouvernance, ainsi qu’à un partage plus systématique des incidents.
Le cadre SAFE reste au stade de la RFC : sa période de consultation publique se poursuit sur GitHub . L’alliance prévoit également de présenter ses travaux à Black Hat USA 2026, à Las Vegas, tout en continuant à accueillir de nouveaux membres et à intégrer d’autres outils open source .
À mesure que les entreprises confient davantage de tâches à des agents autonomes, la question ne sera plus seulement de savoir si ces systèmes peuvent accomplir une mission. Il faudra aussi pouvoir retracer leurs décisions, limiter leurs accès et partager rapidement les enseignements lorsqu’ils sortent du cadre prévu.