Лидерство в бенчмарке. Atlas набрал 90,9% на CyberGym — публичном тесте, который оценивает способность ИИ-агентов воспроизводить и находить реальные уязвимости . Для сравнения, лучшие одномодельные системы — GPT-5.5 Cyber (85,6%) и Anthropic Mythos (83%) — отстают на 5–8 процентных пунктов . Даже система Microsoft MDASH, использовавшая более 100 специализированных агентов и показавшая 88,45% в мае 2026 года, осталась позади .
Более 200 находок zero-day. В собственных тестах Atlas выявил более 200 ранее неизвестных уязвимостей в широко используемых open-source проектах, которые годами подвергались фаззингу и аудиту, включая ядро Linux, Kubernetes, gVisor, containerd и dnsmasq . Ключевой момент: каждая находка была полностью и автономно подтверждена системой, переходя от «подозрения» модели к воспроизводимому доказательству реальной уязвимости .
CVE-2026-3854 — критическая RCE в GitHub. Ранняя версия Atlas выявила критическую уязвимость удалённого выполнения кода во внутренней git-инфраструктуре GitHub (CVE-2026-3854, CVSS 8.8) . Уязвимость позволяла любому аутентифицированному пользователю с правом на push выполнять произвольные команды на бэкенд-серверах GitHub с помощью одной команды git push, получая полный доступ на чтение и запись к приватным репозиториям . Wiz сообщила о проблеме в GitHub 4 марта 2026 года через программу bug bounty . GitHub воспроизвёл проблему за 40 минут, развернул исправление на github.com менее чем за два часа и подтвердил отсутствие эксплуатации в реальных атаках .
$100 000 баунти. GitHub выплатил $100 000 за эту находку — один из крупнейших бонусов в истории программы .
Это ключевой архитектурный момент. Atlas — не одна ИИ-модель, а модельно-агентная система . Вот чем она отличается от подхода, использованного в GPT-5.5 Cyber и Mythos:
| Характеристика | Project Atlas (мультиагентный) | GPT-5.5 Cyber / Mythos (одномодельные) |
|---|---|---|
| Архитектура | Оркеструет множество специализированных ИИ-агентов (для анализа кода, фаззинга, статического анализа, отслеживания зависимостей), работающих параллельно | Одна большая языковая модель, обученная для киберзадач, работающая в одиночку |
| Разнообразие моделей | Комбинирует несколько передовых моделей (например, Claude Opus 4.6 + GPT-5.5 в квалификационном прогоне CyberGym) — выбирает лучшую модель для каждой подзадачи | Привязана к одному семейству моделей и одному набору весов |
| Процесс работы | Каждая находка независимо верифицируется отдельным агентом, что практически полностью исключает ложные срабатывания | Вывод одной модели, сложнее самопроверка |
| Масштабируемость | Может запускать сотни агентов для тысяч целей одновременно | Ограничена пропускной способностью одной модели |
| Ключевой вывод | «Лучшая архитектура для поиска уязвимостей — не одна модель, а оркестрованная команда моделей с разной специализацией» | Одномодельный подход упирается в потолок при сложных многошаговых задачах |
Wiz утверждает, что архитектура системы важнее сырой мощности модели — Atlas обогнал GPT-5.5 Cyber и Mythos не за счёт более совершенной базовой модели, а благодаря интеллектуальному сочетанию нескольких моделей и агентов с надёжными циклами верификации .
Хронология гонки ИИ-вооружений в сфере безопасности демонстрирует чёткий тренд: от доминирования одной модели к превосходству мультиагентных систем:
Начало — середина 2026: Эскалация одной модели. OpenAI выпустила полную версию GPT-5.5-Cyber (85,6% на CyberGym) в июне 2026 года в рамках оборонной программы Daybreak . Предпросмотр Anthropic Claude Mythos также показал высокие результаты, побудив исследователей из UK AISI и Palo Alto Networks предупредить, что модели «превзошли автономные хакерские бенчмарки» .
Май 2026: Мультиагентные системы доказывают потенциал. Система Microsoft MDASH (более 100 специализированных агентов, 88,45% на CyberGym) показала, что мультиагентный подход способен превзойти одиночные модели .
Июль 2026: Победа мультиагентности. Wiz Atlas (90,9%) обошёл всех, доказав, что оркестровка нескольких передовых моделей превосходит любую отдельную модель .
Сочетание ИИ-агентов с систематическим фаззингом, статическим анализом и ревью кода приводит к обнаружению zero-day в беспрецедентных масштабах — Atlas только в одном проекте нашёл 200+ уязвимостей в коде, который годами тщательно проверялся . Этот поток найденных ИИ-багов оказывает давление на экономику программ bug bounty. GitHub 27 июля 2026 года сократил публичные выплаты как минимум вдвое (критические находки упали с $20–30 тыс.+ до фиксированных $10 тыс.), хотя пригласительный VIP-уровень по-прежнему платит от $30 тыс. . Отчёты, поданные до этой даты, включая обнаруженную Atlas CVE-2026-3854, сохранили прежние условия выплат .
Project Atlas от Wiz — текущий лидер в области ИИ-исследования уязвимостей, и не потому, что он использует более совершенную модель, а благодаря мультиагентной, мультимодельной архитектуре с независимой верификацией. Он значительно превосходит одномодельные системы (90,9% против 85,6% и 83%). Это отражает более широкий сдвиг в ландшафте ИИ-безопасности — от вопроса «какая модель лучше» к вопросу «как эффективно организовать работу моделей». Как подчёркивают в Wiz и Google, победа в гонке ИИ-вооружений достанется не одной супер-модели, а системам, объединяющим модели, человеческий опыт и надёжные конвейеры верификации .