Vertailun kärjessä. Atlas sai 90,9 % CyberGymistä, julkisesta vertailusta, joka mittaa tekoälyagenttien kykyä toistaa ja löytää todellisia haavoittuvuuksia 1 507 tehtävästä 188 avoimen lähdekoodin projektista . Vertailun vuoksi parhaat yksittäiset mallijärjestelmät – GPT-5.5 Cyber (85,6 %) ja Anthropicin Mythos (83 %) – jäävät 5–8 prosenttiyksikön päähän . Jopa Microsoftin MDASH-järjestelmä, joka käytti yli 100 erikoistunutta agenttia saavuttaakseen 88,45 % toukokuussa 2026, jäi taakse .
Yli 200 nollapäivähaavoittuvuutta. Omassa testauksessaan Atlas paljasti yli 200 ennestään tuntematonta haavoittuvuutta laajalti käytetyistä avoimen lähdekoodin projekteista, joita oli fuzzattu ja tarkastettu vuosia, mukaan lukien Linux-ydin, Kubernetes, gVisor, containerd ja dnsmasq . Jokainen löydös validoitiin autonomisesti päästä päähän agenttijärjestelmällä, mikä menee mallin tuottamaa epäilyä pidemmälle toistettavaan todisteeseen todellisesta tietoturvaongelmasta .
CVE-2026-3854 – kriittinen GitHubin etäkoodin suoritus. Varhainen versio Atlaksesta tunnisti kriittisen etäkoodin suorittamisen mahdollistavan haavoittuvuuden GitHubin sisäisessä git-infrastruktuurissa (CVE-2026-3854, CVSS 8.8) . Haavoittuvuus antoi mille tahansa todennetulle käyttäjälle, jolla on push-oikeudet, mahdollisuuden suorittaa mielivaltaisia komentoja GitHubin taustapalvelimilla yhdellä git push -komennolla, myöntäen täydet luku-/kirjoitusoikeudet yksityisiin repositorioihin . Wiz ilmoitti siitä GitHubille 4. maaliskuuta 2026 bugipalkkio-ohjelman kautta . GitHub toisti ongelman 40 minuutissa, otti korjauksen käyttöön github.comissa alle kahdessa tunnissa ja vahvisti, ettei haavoittuvuutta ollut hyödynnetty käytännössä .
100 000 dollarin palkkio. GitHub myönsi 100 000 dollarin palkkion löydöstä – yhden ohjelman historian suurimmista, vaikka Wizin kokonaispalkkio on saattanut olla rakennettu ennen heinäkuuta 2026 voimassa olleiden hintojen mukaan ennen kuin julkinen ohjelma leikkasi maksuja .
Tämä on arkkitehtuurin ydin. Atlas ei ole yksittäinen tekoälymalli – se on monimallinen, agenttijärjestelmä . Näin se eroaa GPT-5.5 Cyberin ja Mythoksen käyttämästä yksittäismallien lähestymistavasta:
| Ulottuvuus | Project Atlas (moniagentti) | GPT-5.5 Cyber / Mythos (yksittäismalli) |
|---|---|---|
| Arkkitehtuuri | Orkestroi monia erikoistuneita tekoälyagentteja (koodianalyysi, fuzzaus, staattinen analyysi, riippuvuuksien jäljitys), jotka työskentelevät rinnakkain | Yksi suuri kielimalli, joka on koulutettu kybertehtäviin, toimii yksin |
| Mallien monimuotoisuus | Yhdistää useita huippumalleja (esim. Claude Opus 4.6 + GPT-5.5 pätevässä CyberGym-ajossaan) – valitsee parhaan mallin kuhunkin osatehtävään | Sidottu yhteen malliperheeseen ja yhteen painosarjaan |
| Työnkulku | Jokainen löydös varmennetaan itsenäisesti erillisellä varmennusagentilla, mikä käytännössä eliminoi vääriä positiivisia | Yksittäismallin tuotos, vaikeampi itsevarmennettava |
| Skaalautuvuus | Voi ajaa satoja agentteja tuhansia kohteita vastaan samanaikaisesti | Rajoitettu yksittäismallin päättelyn läpäisykykyyn |
| Keskeinen oivallus | "Paras malliarkkitehtuuri haavoittuvuustutkimukseen ei ole yksittäinen malli – se on orkestroitu tiimi malleja, joilla on erillisiä erikoisaloja" | Yksittäismallin lähestymistapa osuu kattoon monimutkaisissa monivaiheisissa työnkuluissa |
Wiz väittää, että järjestelmäarkkitehtuuri on tärkeämpää kuin raaka mallikyvykkyys – Atlas voitti GPT-5.5 Cyberin ja Mythoksen, ei siksi, että sillä olisi parempi perusmalli, vaan yhdistämällä älykkäästi useita malleja ja agentteja tiukoilla varmennussilmukoilla .
Tekoälyn turvallisuuskilpailun aikajana osoittaa selvän kehityskulun yksittäismallien dominoinnista moniagenttien ylivoimaan:
Alku–keski 2026: Yksittäismallien eskalaatio. OpenAI julkaisi täyden GPT-5.5-Cyberin (85,6 % CyberGymissä) kesäkuussa 2026 osana Daybreak-puolustusohjelmaansa . Myös Anthropicin Claude Mythos Preview sai korkeat pisteet, mikä sai Ison-Britannian AISI:n ja Palo Alto Networksin tutkijat varoittamaan, että mallit olivat "ylittäneet autonomiset hakkerointivertailut" .
Toukokuu 2026: Moniagenttien potentiaali todistetaan. Microsoftin MDASH-järjestelmä (yli 100 erikoistunutta agenttia, 88,45 % CyberGymissä) osoitti, että moniagenttijärjestelmät voivat suoriutua yksittäisiä malleja paremmin .
Heinäkuu 2026: Moniagentit voittavat. Wizin Atlas (90,9 %) päihitti molemmat, todistaen, että useiden huippumallien orkestrointi ylittää minkä tahansa yksittäisen mallin .
Tekoälyagenttien yhdistelmä systemaattisen fuzzauksen, staattisen analyysin ja koodin tarkastelun kanssa tuottaa nollapäivähaavoittuvuuksia ennennäkemättömässä mittakaavassa – Atlas yksinään löysi yli 200 perusteellisesti tarkastetusta avoimen lähdekoodin koodista . Tämä tekoälyn löytämien bugien tulva painostaa haavoittuvuuksien paljastusohjelmien taloutta. GitHub leikkasi julkisia bugipalkkioitaan vähintään puolella 27. heinäkuuta 2026 (kriittiset löydökset laskivat 20 000–30 000+ dollarista kiinteään 10 000 dollariin), vaikka kutsuvip-taso maksaa edelleen yli 30 000 dollaria . Ennen tätä päivämäärää tehdyt raportit, mukaan lukien Atlaksen löytämä CVE-2026-3854, säilyttivät aiemmat maksuehdot .
Wizin Project Atlas on tekoälyn haavoittuvuustutkimuksen nykyinen huipputaso – ei siksi, että se käyttää parempaa mallia, vaan koska sen moniagentti-, monimalliarkkitehtuuri itsenäisellä varmennuksella voittaa yksittäismallijärjestelmät merkittävällä erolla (90,9 % vs. 85,6 % ja 83 %). Tämä heijastaa laajempaa muutosta tekoälyn turvallisuusmaisemassa kysymyksestä "mikä malli on paras" kysymykseen "miten malleja orkestroidaan tehokkaasti." Kuten Wizin ja Googlin ilmaisema kanta tekee selväksi, voittava lähestymistapa tekoälyn turvallisuuskilpailussa ei ole yksittäinen supermalli, vaan järjestelmät, jotka yhdistävät malleja, ihmisasiantuntemusta ja tiukkoja varmennusputkia .