Leadership sur le benchmark. Atlas a obtenu un score de 90,9 % sur CyberGym, un benchmark public qui mesure la capacité des agents d'IA à reproduire et découvrir des vulnérabilités réelles à travers 1 507 tâches issues de 188 projets open source . Pour donner un ordre d'idée, les meilleurs systèmes à modèle unique — GPT-5.5 Cyber (85,6 %) et Mythos d'Anthropic (83 %) — accusent un retard de 5 à 8 points de pourcentage . Même le système MDASH de Microsoft, qui utilisait plus de 100 agents spécialisés pour atteindre 88,45 % en mai 2026, a été dépassé .
Plus de 200 découvertes zero-day. Lors de ses propres tests, Atlas a découvert plus de 200 vulnérabilités jusqu'alors inconnues dans des projets open source largement utilisés et qui avaient été intensément « fuzzés » et audités pendant des années, notamment le noyau Linux, Kubernetes, gVisor, containerd et dnsmasq . Fait crucial, chaque découverte a été validée de bout en bout de manière autonome par le système agentique, allant au-delà d'un simple soupçon généré par un modèle vers une preuve reproductible d'un véritable problème de sécurité .
CVE-2026-3854 — une RCE critique sur GitHub. Une version précoce d'Atlas a identifié une vulnérabilité critique d'exécution de code à distance dans l'infrastructure git interne de GitHub (CVE-2026-3854, CVSS 8.8) . La faille permettait à tout utilisateur authentifié disposant d'un accès push d'exécuter des commandes arbitraires sur les serveurs backend de GitHub à l'aide d'une seule commande git push, accordant un accès complet en lecture/écriture aux dépôts privés . Wiz l'a signalée à GitHub le 4 mars 2026 via le programme de bug bounty . GitHub a reproduit le problème en 40 minutes, déployé un correctif sur github.com en moins de deux heures et confirmé qu'aucune exploitation n'avait eu lieu .
Une prime de 100 000 $. GitHub a versé une prime de 100 000 $ pour cette découverte — l'une des plus importantes de l'histoire du programme, bien que la récompense totale de Wiz ait pu être structurée selon les tarifs d'avant juillet 2026, avant la réduction du programme public .
C'est là le cœur de l'histoire architecturale. Atlas n'est pas un modèle d'IA unique — c'est un système agentique multi-modèle . Voici en quoi il diffère de l'approche à modèle unique utilisée par GPT-5.5 Cyber et Mythos :
| Dimension | Project Atlas (multi-agents) | GPT-5.5 Cyber / Mythos (modèle unique) |
|---|---|---|
| Architecture | Orchestre de nombreux agents d'IA spécialisés (sous-agents pour l'analyse de code, le fuzzing, l'analyse statique, le traçage des dépendances) travaillant en parallèle | Un seul grand modèle de langage entraîné pour des tâches cybernétiques, opérant seul |
| Diversité des modèles | Combine plusieurs modèles de pointe (par ex., Claude Opus 4.6 + GPT-5.5 lors de sa course de qualification sur CyberGym) — choisit le meilleur modèle pour chaque sous-tâche | Lié à une seule famille de modèles et à un seul ensemble de poids |
| Flux de travail | Chaque découverte est vérifiée indépendamment par un agent de vérification distinct, éliminant virtuellement les faux positifs | Sortie d'un seul modèle, plus difficile à vérifier soi-même |
| Évolutivité | Peut exécuter des centaines d'agents sur des milliers de cibles simultanément | Limité par le débit d'inférence d'un seul modèle |
| Idée clé | « La meilleure architecture de modèle pour la recherche de vulnérabilités n'est pas un modèle unique — c'est une équipe orchestrée de modèles aux spécialisations distinctes » | L'approche à modèle unique atteint un plafond sur les flux de travail complexes en plusieurs étapes |
Wiz soutient que l'architecture du système importe plus que la capacité brute du modèle — Atlas a battu GPT-5.5 Cyber et Mythos non pas en ayant un meilleur modèle de base, mais en combinant intelligemment plusieurs modèles et agents avec des boucles de vérification strictes .
La chronologie de la course aux armements de l'IA en matière de sécurité montre une trajectoire claire allant de la domination d'un modèle unique à la supériorité multi-agents :
Début à mi-2026 : Escalade du modèle unique. OpenAI a publié la version complète de GPT-5.5-Cyber (85,6 % sur CyberGym) en juin 2026 dans le cadre de son programme de défense Daybreak . L'aperçu Claude Mythos d'Anthropic a également obtenu un score élevé, incitant les chercheurs de l'UK AISI et de Palo Alto Networks à avertir que les modèles avaient « dépassé les benchmarks de piratage autonome » .
Mai 2026 : Le multi-agents prouve son potentiel. Le système MDASH de Microsoft (plus de 100 agents spécialisés, 88,45 % sur CyberGym) a montré que les systèmes multi-agents pouvaient surpasser les modèles uniques .
Juillet 2026 : Le multi-agents gagne. Atlas de Wiz (90,9 %) les a tous surpassés, prouvant que l'orchestration de plusieurs modèles de pointe surpasse tout modèle unique .
La combinaison d'agents d'IA avec du fuzzing systématique, de l'analyse statique et de la revue de code produit des zero-days à une échelle sans précédent — Atlas a à lui seul trouvé plus de 200 failles dans du code open source pourtant lourdement audité . Ce déluge de bugs découverts par l'IA met sous pression l'économie des programmes de divulgation des vulnérabilités. GitHub a réduit ses primes publiques de bug bounty d'au moins la moitié le 27 juillet 2026 (les découvertes critiques passant de 20 000 à 30 000 $ et plus à un montant fixe de 10 000 $), bien que le niveau VIP sur invitation seulement paie toujours 30 000 $ et plus . Les rapports déposés avant cette date, y compris le CVE-2026-3854 découvert par Atlas, ont conservé les conditions de paiement antérieures .
Project Atlas de Wiz est l'état de l'art actuel de la recherche de vulnérabilités par l'IA — non pas parce qu'il utilise un meilleur modèle, mais parce que son architecture multi-agents et multi-modèle, avec une vérification indépendante, bat les systèmes à modèle unique d'une marge significative (90,9 % contre 85,6 % et 83 %). Cela reflète un changement plus large dans le paysage de la sécurité par l'IA, passant de « quel est le meilleur modèle ? » à « comment orchestrer efficacement les modèles ? ». Comme le souligne clairement la position de Wiz et de Google, l'approche gagnante dans la course aux armements de la sécurité par l'IA ne sera pas un super-modèle unique, mais des systèmes qui combinent des modèles, l'expertise humaine et des pipelines de vérification rigoureux .