Benchmark-føring. Atlas opnåede 90,9 % på CyberGym, et offentligt benchmark, der måler AI-agenters evne til at reproducere og opdage virkelige sårbarheder på tværs af 1.507 opgaver fra 188 open source-softwareprojekter . Til sammenligning halter de bedste enkeltmodelsystemer – GPT-5.5 Cyber (85,6 %) og Anthropics Mythos (83 %) – 5 til 8 procentpoint efter . Selv Microsofts MDASH-system, der med over 100 specialiserede agenter scorede 88,45 % i maj 2026, er nu overgået .
Over 200 zero-days opdaget. I sine egne test afslørede Atlas mere end 200 hidtil ukendte sårbarheder i udbredte open source-projekter, der i årevis var blevet grundigt fuzzet og revideret – herunder Linux-kernen, Kubernetes, gVisor, containerd og dnsmasq . Hvert fund blev autononmt valideret fra ende til anden af det agentiske system, hvilket går videre end modelgenereret mistanke til reproducerbare beviser for et reelt sikkerhedsproblem .
CVE-2026-3854 – kritisk GitHub RCE. En tidlig version af Atlas identificerede en kritisk fjernudførelsessårbarhed i GitHub's interne git-infrastruktur (CVE-2026-3854, CVSS 8,8) . Fejlen gjorde det muligt for enhver autentificeret bruger med push-adgang at udføre vilkårlige kommandoer på GitHub's backend-servere med en enkelt git push-kommando, hvilket gav fuld læse-/skriveadgang til private repositories . Wiz rapporterede det til GitHub den 4. marts 2026 via bug bounty-programmet . GitHub reproducerede problemet på 40 minutter, implementerede en rettelse på github.com på under to timer og bekræftede, at der ikke var sket udnyttelse i praksis .
Dusør på 100.000 dollars. GitHub udbetalte en dusør på 100.000 dollars for fundet – en af de største udbetalinger i programmets historie, selvom Wiz' samlede belønning kan være struktureret efter satser før juli 2026, før det offentlige program blev reduceret .
Dette er den centrale arkitektoniske historie. Atlas er ikke en enkelt AI-model – det er et multi-model, agentisk system . Sådan adskiller det sig fra enkeltmodelstilgangen brugt af GPT-5.5 Cyber og Mythos:
| Dimension | Project Atlas (multi-agent) | GPT-5.5 Cyber / Mythos (enkeltmodel) |
|---|---|---|
| Arkitektur | Orkestrerer mange specialiserede AI-agenter (underagenter til kodeanalyse, fuzzing, statisk analyse, afhængighedssporing), der arbejder parallelt | En enkelt stor sprogmodel trænet til cybersikkerhedsopgaver, der arbejder alene |
| Modeldiversitet | Kombinerer flere frontmodeller (f.eks. Claude Opus 4.6 + GPT-5.5 i sin kvalificerende CyberGym-kørsel) – vælger den bedste model til hver delopgave | Bundet til én modelfamilie og ét sæt vægte |
| Arbejdsgang | Hvert fund verificeres uafhængigt af en separat verifikationsagent, hvilket stort set eliminerer falske positiver | Output fra en enkelt model, sværere at selv-verificere |
| Skalerbarhed | Kan køre hundredvis af agenter på tværs af tusindvis af mål samtidigt | Begrænset af inferensgennemstrømning for en enkelt model |
| Nøgleindsigt | "Den bedste modelarkitektur til sårbarhedsforskning er ikke en enkelt model – det er et orkestreret team af modeller med distinkte specialiseringer" | Enkeltmodelstilgangen rammer et loft ved komplekse arbejdsgange med flere trin |
Wiz argumenterer for, at systemarkitektur betyder mere end rå modelkapacitet – Atlas overgik GPT-5.5 Cyber og Mythos ikke ved at have en bedre basismodel, men ved intelligent at kombinere flere modeller og agenter med stramme verifikationssløjfer .
Tidslinjen for AI-sikkerhedskapløbet viser en klar udvikling fra enkeltmodeldominans til multi-agent-overlegenhed:
Tidligt til midten af 2026: Enkeltmodel-eskalering. OpenAI udgav den fulde GPT-5.5-Cyber (85,6 % på CyberGym) i juni 2026 som en del af sit Daybreak-forsvarsprogram . Anthropics Claude Mythos Preview scorede også højt, hvilket fik forskere fra UK AISI og Palo Alto Networks til at advare om, at modellerne havde "overskredet autonome hacking-benchmarks" .
Maj 2026: Multi-agent beviser sit potentiale. Microsofts MDASH-system (100+ specialiserede agenter, 88,45 % på CyberGym) viste, at multi-agent-systemer kunne overgå enkeltmodeller .
Juli 2026: Multi-agent vinder. Wiz' Atlas (90,9 %) overgik dem begge og beviste, at orkestrering af flere frontmodeller overgår enhver enkelt model .
Kombinationen af AI-agenter med systematisk fuzzing, statisk analyse og kodegennemgang producerer zero-days i hidtil uset omfang – Atlas alene fandt 200+ i hårdt revideret open source-kode . Denne strøm af AI-opdagede fejl lægger pres på økonomien i sårbarhedsdisclosuresprogrammer. GitHub reducerede den 27. juli 2026 sine offentlige bug bounty-udbetalinger med mindst det halve (kritiske fund faldt fra 20.000–30.000+ dollars til et fast beløb på 10.000 dollars), selvom den lukkede VIP-gruppe stadig betaler 30.000+ dollars . Rapporter indgivet før denne dato, herunder Atlas-opdagede CVE-2026-3854, bibeholdt de tidligere udbetalingsvilkår .
Wiz' Project Atlas er den nuværende state-of-the-art inden for AI-sårbarhedsforskning – ikke fordi den bruger en bedre model, men fordi dens multi-agent, multi-model-arkitektur med uafhængig verifikation overgår enkeltmodelsystemer med en betydelig margin (90,9 % vs. 85,6 % og 83 %). Dette afspejler et bredere skift i AI-sikkerhedslandskabet fra 'hvilken model er bedst' til 'hvordan orkestrerer man modeller effektivt.' Som Wiz og Googles holdning gør klart, vil den vindende tilgang i AI-sikkerhedskapløbet ikke være en enkelt supermodel, men systemer, der kombinerer modeller, menneskelig ekspertise og strenge verifikationspipeliner .