Koploper in benchmarks. Atlas scoorde 90,9% op CyberGym, een openbare benchmark die meet hoe goed AI-agenten echte kwetsbaarheden kunnen reproduceren en ontdekken in 1.507 taken uit 188 open-sourceprojecten . Ter vergelijking: de beste systemen met één model – GPT-5.5 Cyber (85,6%) en Anthropic's Mythos (83%) – blijven 5 tot 8 procentpunten achter . Zelfs Microsofts MDASH-systeem, dat in mei 2026 met meer dan 100 gespecialiseerde agenten een score van 88,45% behaalde, werd overtroffen .
Meer dan 200 zero-days ontdekt. In eigen tests ontdekte Atlas meer dan 200 voorheen onbekende kwetsbaarheden in veelgebruikte open-sourceprojecten die jarenlang zwaar waren getest en gecontroleerd, waaronder de Linux-kernel, Kubernetes, gVisor, containerd en dnsmasq . Elk bewijsstuk werd autonoom van begin tot eind gevalideerd door het agentische systeem, waarmee het verder ging dan alleen een vermoeden van een model naar reproduceerbaar bewijs van een echt beveiligingsprobleem .
CVE-2026-3854 – kritieke GitHub RCE. Een vroege versie van Atlas identificeerde een kritieke kwetsbaarheid voor het uitvoeren van externe code in de interne git-infrastructuur van GitHub (CVE-2026-3854, CVSS 8.8) . De fout stelde elke geverifieerde gebruiker met push-toegang in staat om willekeurige opdrachten uit te voeren op de back-endservers van GitHub met een enkele git push-opdracht, waardoor volledige lees-/schrijftoegang tot privé-repositories werd verkregen . Wiz meldde dit op 4 maart 2026 aan GitHub via het bugbountyprogramma . GitHub reproduceerde het probleem binnen 40 minuten, implementeerde binnen twee uur een oplossing op github.com en bevestigde dat er geen misbruik in het wild had plaatsgevonden .
$100.000 bounty. GitHub kende een $100.000 bounty toe voor deze vondst – een van de hoogste uitbetalingen in de geschiedenis van het programma, hoewel Wiz's totale beloning mogelijk via tarieven van vóór juli 2026 was gestructureerd, voordat het openbare programma werd verlaagd .
Dit is het kerneverhaal op architectuurgebied. Atlas is geen enkel AI-model – het is een multi-model, agentisch systeem . Hier ziet u hoe het verschilt van de aanpak met één model die wordt gebruikt door GPT-5.5 Cyber en Mythos:
| Dimensie | Project Atlas (multi-agent) | GPT-5.5 Cyber / Mythos (één model) |
|---|---|---|
| Architectuur | Orkestreert vele gespecialiseerde AI-agenten (subagenten voor code-analyse, fuzzing, statische analyse, afhankelijkheidsanalyse) die parallel werken | Eén groot taalmodel getraind voor cyber-taken, dat alleen opereert |
| Modeldiversiteit | Combineert meerdere frontier-modellen (bijv. Claude Opus 4.6 + GPT-5.5 in de kwalificerende CyberGym-run) – kiest per subtaak het beste model | Gebonden aan één modelfamilie en één set gewichten |
| Werkstroom | Elke vondst wordt onafhankelijk geverifieerd door een aparte verificatie-agent, waardoor valse positieven vrijwel worden geëlimineerd | Output van één model, moeilijker zelf te verifiëren |
| Schaalbaarheid | Kan honderden agenten tegelijkertijd op duizenden doelen inzetten | Beperkt door de inferentie-doorvoer van één model |
| Kerninzicht | "De beste modelarchitectuur voor kwetsbaarheidsonderzoek is niet één model, maar een georkestreerd team van modellen met verschillende specialisaties" | De aanpak met één model stuit op een plafond bij complexe meerstapsprocessen |
Wiz stelt dat systeemarchitectuur belangrijker is dan ruwe modelcapaciteit – Atlas versloeg GPT-5.5 Cyber en Mythos niet door een beter basismodel, maar door intelligent meerdere modellen en agenten te combineren met strakke verificatielussen .
De tijdlijn van de AI-wapenwedloop op het gebied van beveiliging laat een duidelijke ontwikkeling zien van dominantie van één model naar superioriteit van meerdere agenten:
Begin tot medio 2026: Escalatie van één model. OpenAI bracht in juni 2026 de volledige GPT-5.5-Cyber uit (85,6% op CyberGym) als onderdeel van zijn Daybreak-verdedigingsprogramma . Anthropic's Claude Mythos Preview scoorde ook hoog, waardoor onderzoekers van het UK AISI en Palo Alto Networks waarschuwden dat modellen "autonome hackbenchmarks hadden overtroffen" .
Mei 2026: Multi-agent bewijst zijn potentieel. Microsofts MDASH-systeem (100+ gespecialiseerde agenten, 88,45% op CyberGym) toonde aan dat multi-agentsystemen beter kunnen presteren dan één model .
Juli 2026: Multi-agent wint. Wiz's Atlas (90,9%) overtrof beide en bewees dat de orkestratie van meerdere frontier-modellen beter presteert dan elk afzonderlijk model .
De combinatie van AI-agenten met systematische fuzzing, statische analyse en codebeoordeling levert zero-days op een ongekende schaal op – Atlas vond er alleen al 200+ in zwaar gecontroleerde open-sourcecode . Deze stroom aan AI-ontdekte bugs zet de economie van kwetsbaarheidsdiscloseprogramma's onder druk. GitHub verlaagde zijn openbare bugbounty-uitbetalingen op 27 juli 2026 met minstens de helft (kritieke vondsten daalden van $20k–$30k+ naar een vast bedrag van $10k), hoewel de exclusieve VIP-tier nog steeds $30k+ betaalt . Meldingen die vóór die datum zijn ingediend, waaronder de door Atlas ontdekte CVE-2026-3854, behielden de vorige betalingsvoorwaarden .
Wiz's Project Atlas is de huidige state-of-the-art op het gebied van AI-onderzoek naar kwetsbaarheden – niet omdat het een beter model gebruikt, maar omdat de multi-agent, multi-model architectuur met onafhankelijke verificatie systemen met één model met een aanzienlijke marge verslaat (90,9% versus 85,6% en 83%). Dit weerspiegelt een bredere verschuiving in het AI-beveiligingslandschap van "welk model is het beste" naar "hoe orkestreer je modellen effectief." Zoals Wiz en Google duidelijk stellen, zal de winnende aanpak in de AI-wapenwedloop op het gebied van beveiliging niet één supermodel zijn, maar systemen die modellen, menselijke expertise en rigoureuze verificatiepijplijnen combineren .