Лідерство в бенчмарку. Atlas набрав 90,9% на CyberGym — публічному бенчмарку, який вимірює здатність ШІ-агентів відтворювати та знаходити реальні вразливості з 1 507 завдань зі 188 проєктів з відкритим кодом . Для порівняння: найкращі одномодельні системи — GPT-5.5 Cyber (85,6%) і Mythos від Anthropic (83%) — відстають на 5–8 відсоткових пунктів . Навіть система MDASH від Microsoft, яка використовувала понад 100 спеціалізованих агентів і набрала 88,45% у травні 2026 року, була перевершена .
Понад 200 zero-day-вразливостей. У власному тестуванні Atlas виявив понад 200 раніше невідомих вразливостей у широко використовуваних проєктах з відкритим кодом, які роками ретельно фаззили та аудитували, зокрема в ядрі Linux, Kubernetes, gVisor, containerd і dnsmasq . Ключовий момент: кожне відкриття було автономно підтверджено від початку до кінця агентною системою, що виходить за рамки підозр, згенерованих моделлю, і доводить реальну проблему безпеки .
CVE-2026-3854 — критична RCE-вразливість GitHub. Рання версія Atlas виявила критичну вразливість віддаленого виконання коду у внутрішній git-інфраструктурі GitHub (CVE-2026-3854, CVSS 8.8) . Уразливість дозволяла будь-якому аутентифікованому користувачу з правами push виконувати довільні команди на серверах GitHub за допомогою однієї команди git push, надаючи повний доступ читання/запису до приватних репозиторіїв . Wiz повідомила про це GitHub 4 березня 2026 року через програму bug bounty . GitHub відтворив проблему за 40 хвилин, розгорнув виправлення на github.com менш ніж за дві години та підтвердив відсутність експлуатації в реальних умовах .
$100 000 винагороди. GitHub виплатив $100 000 за це відкриття — один із найбільших платежів в історії програми, хоча загальна винагорода Wiz могла бути структурована за ставками до липня 2026 року, до того як публічну програму скоротили .
Це ключова історія. Atlas — не одна модель ШІ — це мультимодельна, агентна система . Ось як вона відрізняється від одномодельного підходу, який використовують GPT-5.5 Cyber і Mythos:
| Вимірювання | Project Atlas (мультиагентна) | GPT-5.5 Cyber / Mythos (одномодельна) |
|---|---|---|
| Архітектура | Оркеструє багато спеціалізованих ШІ-агентів (субагенти для аналізу коду, фаззингу, статичного аналізу, відстеження залежностей), які працюють паралельно | Одна велика мовна модель, навчена для кіберзавдань, що працює самостійно |
| Різноманітність моделей | Поєднує кілька фронтірних моделей (наприклад, Claude Opus 4.6 + GPT-5.5 у кваліфікаційному запуску CyberGym) — обирає найкращу модель для кожного підзавдання | Прив'язана до однієї родини моделей і одного набору ваг |
| Робочий процес | Кожне відкриття незалежно перевіряється окремим верифікаційним агентом, що майже повністю усуває хибні спрацьовування | Результат однієї моделі, складніше самостійно верифікувати |
| Масштабованість | Може запускати сотні агентів одночасно для тисяч цілей | Обмежується пропускною здатністю однієї моделі |
| Ключове розуміння | "Найкраща архітектура моделі для дослідження вразливостей — це не одна модель, а оркестрована команда моделей з різними спеціалізаціями" | Одномодельний підхід натикається на стелю в складних багатокрокових робочих процесах |
Wiz стверджує, що архітектура системи важливіша за сиру здатність моделі — Atlas обійшов GPT-5.5 Cyber і Mythos не тому, що має кращу базову модель, а завдяки інтелектуальному поєднанню кількох моделей та агентів з жорсткими циклами верифікації .
Хронологія гонки кіберозброєнь у сфері ШІ демонструє чітку траєкторію від домінування однієї моделі до переваги мультиагентних систем:
Початок–середина 2026: Ескалація однієї моделі. OpenAI випустила повну версію GPT-5.5-Cyber (85,6% на CyberGym) у червні 2026 року в рамках оборонної програми Daybreak . Claude Mythos Preview від Anthropic також показав високі результати, що спонукало UK AISI та Palo Alto Networks дослідників попередити, що моделі "перевершили автономні хакерські бенчмарки" .
Травень 2026: Мультиагентність доводить свій потенціал. Система MDASH від Microsoft (100+ спеціалізованих агентів, 88,45% на CyberGym) показала, що мультиагентні системи можуть перевершувати окремі моделі .
Липень 2026: Мультиагентність перемагає. Atlas від Wiz (90,9%) перевершив їх обох, довівши, що оркестрація кількох фронтірних моделей перевершує будь-яку одну модель .
Поєднання ШІ-агентів із систематичним фаззингом, статичним аналізом і перевіркою коду створює zero-day-вразливості в безпрецедентному масштабі — лише Atlas знайшов понад 200 у ретельно аудитованому коді з відкритим кодом . Цей потік виявлених ШІ помилок тисне на економіку програм розкриття вразливостей. GitHub скоротив виплати за публічні bug bounty щонайменше вдвічі 27 липня 2026 року (критичні знахідки з $20 000–$30 000+ до фіксованих $10 000), хоча закрита VIP-програма все ще платить $30 000+ . Звіти, подані до цієї дати, зокрема Atlas-виявлена CVE-2026-3854, зберегли попередні умови виплат .
Project Atlas від Wiz є найсучаснішою розробкою в галузі дослідження вразливостей за допомогою ШІ — не тому, що вона використовує кращу модель, а тому, що її мультиагентна, мультимодельна архітектура з незалежною верифікацією значно перевершує одномодельні системи (90,9% проти 85,6% та 83%). Це відображає ширший зсув у ландшафті ШІ-безпеки від питання "яка модель найкраща" до "як ефективно оркеструвати моделі". Як чітко дають зрозуміти Wiz та Google, переможний підхід у гонці кіберозброєнь ШІ — це не одна супермодель, а системи, які поєднують моделі, людський досвід і суворі конвеєри верифікації .