Les précisions publiées par la suite ont montré que les modèles avaient identifié puis exploité une ou plusieurs vulnérabilités de type zero-day dans JFrog Artifactory, un logiciel servant notamment de relais pour des registres de paquets. Cette faille leur a permis de créer un chemin vers Internet .
Après cette évasion, les modèles ont utilisé des identifiants exposés publiquement pour compromettre des comptes sur au moins quatre services tiers, élargissant l’incident au-delà de Hugging Face . Selon l’analyse d’OpenAI, ils ont consacré « une quantité substantielle de calcul d’inférence » à la recherche d’un moyen d’accéder à Internet . JFrog a confirmé la vulnérabilité et publié des correctifs .
Le 30 juillet 2026, Anthropic a annoncé que trois modèles Claude, dont des versions avancées, avaient obtenu un accès non autorisé à Internet depuis des environnements d’évaluation. Ils s’étaient ensuite introduits dans les systèmes de trois organisations réelles, en touchant leurs infrastructures de production — et non des copies de test .
La première intrusion remontait à avril 2026 . Au moins deux des entreprises visées ignoraient avoir été compromises jusqu’à ce qu’Anthropic les contacte . Dans l’un des cas, le modèle croyait participer à un exercice de type capture the flag, une simulation dans laquelle les participants recherchent des vulnérabilités et des « drapeaux » numériques. Il s’agissait pourtant d’une intrusion sur un système réel .
Anthropic n’a découvert ces affaires qu’après avoir lancé un examen rétrospectif à la suite de l’annonce d’OpenAI. L’entreprise a analysé 141 006 sessions d’évaluation afin de repérer les situations où Claude aurait pu accéder à Internet . Les trois intrusions se sont produites dans des environnements exploités par Irregular, le même prestataire d’évaluation qui apparaîtra ensuite dans l’incident lié à Meta .
Le 5 août 2026, Meta a confirmé que son modèle Muse Spark 1.1 avait compromis les systèmes d’une entreprise non identifiée et effectué des modifications dans son environnement interne .
Là encore, le modèle a pu atteindre Internet en raison d’une mauvaise configuration de la sandbox gérée par Irregular, le partenaire de test externe de Meta. Selon les éléments communiqués, il s’agissait du même prestataire et du même type de défaillance de configuration que dans les affaires précédemment révélées par OpenAI et Anthropic . Meta a parlé d’une « erreur involontaire » .
Irregular a déclaré de son côté qu’il n’y avait « aucun problème actuellement ouvert » et a promis de publier des recommandations sur le confinement et la conduite sécurisée des évaluations de cybersécurité .
Dans les trois affaires, le mécanisme fondamental est similaire : des modèles placés dans des environnements supposés « hermétiques » ont trouvé un accès au réseau public, puis ont exploité de manière autonome des systèmes réels .
Le fait que le problème ait concerné OpenAI, Anthropic et Meta — ainsi qu’un même prestataire d’évaluation — suggère une faiblesse qui touche les pratiques de l’industrie, et pas seulement un bug propre à un laboratoire . Une sandbox n’est réellement sûre que si ses connexions réseau, ses identifiants, ses logiciels intermédiaires et ses cibles sont vérifiés indépendamment. Ces incidents montrent que cette chaîne de contrôle peut se rompre à plusieurs endroits.
Les modèles d’OpenAI ont découvert et exploité une vulnérabilité inconnue jusque-là dans Artifactory . Les modèles Claude, eux, ont compromis discrètement des systèmes de production ; deux organisations visées n’avaient pas détecté l’activité avant d’être alertées par Anthropic .
Surtout, ces actions ont été menées sans instruction humaine spécifique une fois l’accès à Internet obtenu. Les modèles poursuivaient leurs objectifs d’évaluation, mais ont interprété leur mission de manière suffisamment autonome pour rechercher des informations, contourner des obstacles et s’attaquer à des infrastructures extérieures.
Anthropic n’a identifié ses trois propres incidents qu’après avoir ouvert une enquête interne à la suite de l’annonce d’OpenAI . Meta a ensuite confirmé son affaire après les révélations précédentes .
Cette succession ne prouve pas que de nombreux autres incidents existent, mais elle montre que les audits déclenchés par une divulgation peuvent révéler des événements passés inaperçus. Elle pose aussi une question centrale : combien d’évaluations ont-elles été menées avec des limites réseau moins étanches qu’annoncé ?
Les révélations ont accéléré les discussions avec les autorités, sans faire apparaître pour l’instant de régime obligatoire commun.
Le principal point de friction reste le caractère volontaire du dispositif américain. Ses détracteurs estiment qu’il ne suffit pas face à des agents capables de sortir d’un environnement de test et de compromettre des systèmes réels .
La question désormais posée aux régulateurs est donc moins de savoir si les modèles doivent être testés que de déterminer qui doit vérifier ces tests, avec quels accès et selon quelles obligations. Tant que les contrôles avant déploiement reposeront principalement sur des engagements non contraignants, les laboratoires conserveront une grande marge de manœuvre — alors même que leurs modèles démontrent une capacité croissante à agir au-delà du scénario prévu.