बेंचमार्क में अग्रणी। Atlas ने CyberGym पर 90.9% स्कोर किया। CyberGym एक सार्वजनिक बेंचमार्क है जो AI एजेंटों की वास्तविक दुनिया की वल्नरेबिलिटीज़ को खोजने और दोहराने की क्षमता को मापता है। इसमें 188 ओपन-सोर्स सॉफ्टवेयर प्रोजेक्ट्स के 1,507 कार्य शामिल हैं । तुलना के लिए, सर्वश्रेष्ठ सिंगल-मॉडल सिस्टम — GPT-5.5 Cyber (85.6%) और Anthropic का Mythos (83%) — 5 से 8 प्रतिशत अंक पीछे हैं । यहां तक कि Microsoft का MDASH सिस्टम, जिसने मई 2026 में 100 से अधिक विशेष एजेंटों के साथ 88.45% स्कोर किया था, वह भी पीछे रह गया ।
200 से अधिक जीरो-डे की खोज। अपने परीक्षण में, Atlas ने व्यापक रूप से उपयोग किए जाने वाले ओपन-सोर्स प्रोजेक्ट्स में 200 से अधिक अज्ञात वल्नरेबिलिटीज़ का पता लगाया, जिन्हें वर्षों से फ़ज़ और ऑडिट किया जा रहा था — जिसमें Linux कर्नेल, Kubernetes, gVisor, containerd, और dnsmasq शामिल हैं । महत्वपूर्ण बात यह है कि प्रत्येक खोज को एजेंटिक सिस्टम द्वारा स्वायत्त रूप से शुरू से अंत तक मान्य किया गया, जो मॉडल-जनित संदेह से आगे बढ़कर एक वास्तविक सुरक्षा मुद्दे का प्रतिलिपि प्रस्तुत करने योग्य प्रमाण प्रदान करता है ।
CVE-2026-3854 — GitHub में गंभीर RCE। Atlas के शुरुआती संस्करण ने GitHub के आंतरिक git इंफ्रास्ट्रक्चर में एक गंभीर रिमोट कोड एग्जीक्यूशन वल्नरेबिलिटी (CVE-2026-3854, CVSS 8.8) की पहचान की । यह खामी किसी भी प्रमाणित उपयोगकर्ता को एक ही git push कमांड से GitHub के बैकएंड सर्वर पर मनमाने कमांड निष्पादित करने की अनुमति देती थी, जिससे प्राइवेट रिपॉजिटरी तक पूर्ण रीड/राइट एक्सेस मिल जाता था । Wiz ने 4 मार्च 2026 को बग बाउंटी प्रोग्राम के माध्यम से इसकी सूचना GitHub को दी । GitHub ने 40 मिनट में इस मुद्दे को दोहराया, दो घंटे से भी कम समय में github.com पर एक फिक्स तैनात किया, और पुष्टि की कि इसका कोई शोषण नहीं हुआ था ।
$100,000 का इनाम। GitHub ने इस खोज के लिए $100,000 का बाउंटी जारी किया — जो अपने प्रोग्राम के इतिहास में सबसे बड़े भुगतानों में से एक है, हालांकि Wiz का कुल पुरस्कार जुलाई 2026 से पहले की दरों के तहत संरचित किया गया हो सकता है ।
यह मुख्य आर्किटेक्चरल कहानी है। Atlas कोई एक AI मॉडल नहीं है — यह एक मल्टी-मॉडल, एजेंटिक सिस्टम है । यहां बताया गया है कि यह GPT-5.5 Cyber और Mythos द्वारा उपयोग किए जाने वाले सिंगल-मॉडल दृष्टिकोण से कैसे अलग है:
| आयाम | Project Atlas (मल्टी-एजेंट) | GPT-5.5 Cyber / Mythos (सिंगल-मॉडल) |
|---|---|---|
| आर्किटेक्चर | कई विशेषज्ञ AI एजेंटों को ऑर्केस्ट्रेट करता है (कोड विश्लेषण, फ़ज़िंग, स्टैटिक एनालिसिस, डिपेंडेंसी ट्रेसिंग के लिए उप-एजेंट) जो समानांतर में काम करते हैं | एक एकल बड़ा भाषा मॉडल जो साइबर कार्यों के लिए प्रशिक्षित है, अकेले काम कर रहा है |
| मॉडल विविधता | कई फ्रंटियर मॉडलों को जोड़ता है (जैसे, अपने योग्यता CyberGym रन में Claude Opus 4.6 + GPT-5.5) — प्रति उप-कार्य सर्वश्रेष्ठ मॉडल चुनता है | एक मॉडल परिवार और वज़न के एक सेट से बंधा हुआ |
| वर्कफ़्लो | प्रत्येक खोज को एक अलग वेरिफिकेशन एजेंट द्वारा स्वतंत्र रूप से सत्यापित किया जाता है, जिससे गलत सकारात्मक परिणाम लगभग समाप्त हो जाते हैं | एकल मॉडल आउटपुट, स्वयं-सत्यापित करना कठिन |
| स्केलेबिलिटी | एक साथ हजारों लक्ष्यों पर सैकड़ों एजेंट चला सकता है | एकल-मॉडल इन्फ्रेंस थ्रूपुट तक सीमित |
| मुख्य अंतर्दृष्टि | "वल्नरेबिलिटी रिसर्च के लिए सबसे अच्छा मॉडल आर्किटेक्चर एक एकल मॉडल नहीं है — यह विशिष्ट विशेषज्ञताओं वाली मॉडलों की एक ऑर्केस्ट्रेटेड टीम है" | सिंगल मॉडल दृष्टिकोण जटिल मल्टी-स्टेप वर्कफ़्लो पर एक सीमा तक पहुंचता है |
Wiz का तर्क है कि सिस्टम आर्किटेक्चर, रॉ मॉडल क्षमता से अधिक मायने रखता है — Atlas ने GPT-5.5 Cyber और Mythos को बेहतर बेस मॉडल होने के कारण नहीं, बल्कि कई मॉडलों और एजेंटों को कड़े वेरिफिकेशन लूप्स के साथ बुद्धिमानी से जोड़कर हराया ।
AI सुरक्षा प्रतिस्पर्धा की समयरेखा सिंगल-मॉडल आधिपत्य से मल्टी-एजेंट श्रेष्ठता की ओर एक स्पष्ट प्रक्षेपवक्र दिखाती है:
2026 की शुरुआत-मध्य: सिंगल-मॉडल एस्केलेशन। OpenAI ने अपने Daybreak रक्षा कार्यक्रम के हिस्से के रूप में जून 2026 में पूर्ण GPT-5.5-Cyber (CyberGym पर 85.6%) जारी किया । Anthropic के Claude Mythos Preview ने भी उच्च स्कोर किया, जिससे UK AISI और Palo Alto Networks के शोधकर्ताओं ने चेतावनी दी कि मॉडलों ने "स्वायत्त हैकिंग बेंचमार्क को पार कर लिया है" ।
मई 2026: मल्टी-एजेंट अपनी क्षमता साबित करता है। Microsoft के MDASH सिस्टम (100+ विशेष एजेंट, CyberGym पर 88.45%) ने दिखाया कि मल्टी-एजेंट सिस्टम सिंगल मॉडल से बेहतर प्रदर्शन कर सकते हैं ।
जुलाई 2026: मल्टी-एजेंट जीतता है। Wiz का Atlas (90.9%) ने दोनों को पीछे छोड़ते हुए साबित कर दिया कि कई फ्रंटियर मॉडलों का ऑर्केस्ट्रेशन किसी एकल मॉडल से बेहतर प्रदर्शन करता है ।
AI एजेंटों का व्यवस्थित फ़ज़िंग, स्टैटिक एनालिसिस और कोड समीक्षा के साथ संयोजन अभूतपूर्व पैमाने पर जीरो-डे का उत्पादन कर रहा है — अकेले Atlas ने भारी ऑडिट किए गए ओपन-सोर्स कोड में 200+ पाए । AI-खोजित बग्स की यह बाढ़ वल्नरेबिलिटी डिस्क्लोज़र प्रोग्राम की अर्थव्यवस्था पर दबाव डाल रही है। GitHub ने 27 जुलाई 2026 को अपने सार्वजनिक बग बाउंटी भुगतानों को कम से कम आधा कर दिया (महत्वपूर्ण खोजें $20k–$30k+ से घटकर $10k हो गईं), हालांकि इनवाइट-ओनली VIP टियर अभी भी $30k+ का भुगतान करता है । इस तिथि से पहले दायर रिपोर्ट, जिसमें Atlas-खोजित CVE-2026-3854 शामिल है, ने पिछली भुगतान शर्तों को बरकरार रखा ।
Wiz का Project Atlas AI वल्नरेबिलिटी रिसर्च में वर्तमान में सबसे उन्नत सिस्टम है — इसलिए नहीं कि यह एक बेहतर मॉडल का उपयोग करता है, बल्कि इसलिए कि स्वतंत्र वेरिफिकेशन के साथ इसका मल्टी-एजेंट, मल्टी-मॉडल आर्किटेक्चर सिंगल-मॉडल सिस्टम को एक महत्वपूर्ण अंतर (90.9% बनाम 85.6% और 83%) से हराता है। यह AI सुरक्षा परिदृश्य में एक व्यापक बदलाव को दर्शाता है — 'कौन सा मॉडल सबसे अच्छा है' से 'मॉडलों को प्रभावी ढंग से कैसे ऑर्केस्ट्रेट किया जाए' तक। जैसा कि Wiz और Google का कहना है, AI सुरक्षा प्रतिस्पर्धा में विजयी दृष्टिकोण एक एकल सुपर-मॉडल नहीं होगा, बल्कि वे सिस्टम होंगे जो मॉडलों, मानव विशेषज्ञता और कठोर वेरिफिकेशन पाइपलाइनों को जोड़ते हैं ।