基准测试领先。 Atlas在CyberGym上取得了90.9%的成绩。CyberGym是一个公开基准,用于衡量AI智能体在来自188个开源软件项目的1,507个任务中复现和发现真实世界漏洞的能力 。作为对比,性能最好的单模型系统——GPT-5.5 Cyber(85.6%)和Anthropic的Mythos(83%)——落后了5到8个百分点 。即便是微软在2026年5月推出的、使用了100多个专业智能体并取得88.45%分数的MDASH系统,也被Atlas超越 。
超过200个零日漏洞发现。 在Wiz的内部测试中,Atlas在那些已经被长期模糊测试和审计过的广泛使用的开源项目中,发现了超过200个此前未知的漏洞,涉及的项目包括Linux内核、Kubernetes、gVisor、containerd和dnsmasq等 。至关重要的是,每个发现都由该智能体系统从端到端自主验证,从而将模型生成的“嫌疑”转化为可复现的真实安全问题证据 。
CVE-2026-3854——严重的GitHub远程代码执行漏洞。 Atlas的一个早期版本在GitHub的内部git基础设施中发现了一个严重的RCE漏洞(CVE-2026-3854,CVSS 8.8)。该漏洞允许任何拥有仓库推送权限的认证用户,通过一个简单的git push命令在GitHub的后端服务器上执行任意命令,从而获得对私有仓库的完全读写权限 。Wiz于2026年3月4日通过其漏洞赏金计划向GitHub报告了此问题 。GitHub在40分钟内复现了该问题,在不到两小时内为github.com部署了修复程序,并确认该漏洞未在野外被利用 。
10万美元赏金。 GitHub为此发现发放了10万美元的赏金——这是该计划历史上金额最高的赏金之一,不过Wiz的总奖励可能是根据2026年7月之前的费率结构计算的 。
这是核心的架构故事。Atlas 不是单一AI模型——它是一个多模型、智能体化的系统 。以下是它与GPT-5.5 Cyber和Mythos等单模型方法的不同之处:
| 维度 | Project Atlas (多智能体) | GPT-5.5 Cyber / Mythos (单模型) |
|---|---|---|
| 架构 | 编排许多专业AI智能体(代码分析、模糊测试、静态分析、依赖追踪等子智能体)并行工作 | 一个为网络任务训练的大语言模型,独立运行 |
| 模型多样性 | 结合多个前沿模型(例如,在CyberGym验证性运行中使用Claude Opus 4.6 + GPT-5.5)——为每个子任务选择最佳模型 | 绑定于一个模型家族和一组权重 |
| 工作流 | 每个发现由独立的验证智能体再次确认,几乎消除了误报 | 单模型输出,自我验证较困难 |
| 可扩展性 | 可以同时跨数千个目标运行数百个智能体 | 受限于单模型推理吞吐量 |
| 关键洞察 | “最好的漏洞研究模型架构不是单一模型——而是一个拥有不同专长的、经过编排的模型团队” | 单模型方法在处理复杂的多步骤工作流时遇到瓶颈 |
Wiz认为,系统架构比原始模型能力更重要——Atlas击败GPT-5.5 Cyber和Mythos,并非因为拥有更好的基础模型,而是通过智能地组合多个模型和带有严格验证循环的智能体 。
AI安全军备竞赛的时间线清晰地显示了从单模型主导到多智能体优势的转变轨迹:
2026年初至年中:单模型升级战。 OpenAI于2026年6月发布了完整的GPT-5.5-Cyber(在CyberGym上达到85.6%),作为其Daybreak防御计划的一部分 。Anthropic的Claude Mythos预览版也取得了高分,促使英国AISI和Palo Alto Networks的研究人员警告称,这些模型已经“超越了自主黑客基准” 。
2026年5月:多智能体证明潜力。 微软的MDASH系统(100多个专业智能体,在CyberGym上达到88.45%)表明,多智能体系统可以超越单一模型 。
2026年7月:多智能体获胜。 Wiz的Atlas(90.9%)超越了此前所有记录,证明多个前沿模型的编排优于任何单一模型 。
AI智能体与系统化模糊测试、静态分析和代码审查的结合,正在以前所未有的规模产生零日漏洞——仅Atlas就在被高度审计的开源代码中发现了200多个 。AI发现漏洞的洪流正在给漏洞披露计划的经济学带来压力。GitHub于2026年7月27日将其公开漏洞赏金降低了至少一半(严重发现的赏金从2万至3万多美元降至固定的1万美元),但其仅限邀请的VIP层级仍支付3万美元以上 。在此日期之前提交的报告,包括Atlas发现的CVE-2026-3854,仍保留之前的高额支付条款 。
Wiz的Project Atlas代表了AI漏洞研究领域的最新技术水平——不是因为它使用了更好的模型,而是因为其多智能体、多模型的架构,加上独立的验证环节,以显著优势(90.9% vs. 85.6% 和 83%)击败了单模型系统。这反映了AI安全领域的一个更广泛的转变:从“哪个模型最好”转向“如何有效地编排模型”。正如Wiz和谷歌所明确指出的那样,AI安全军备竞赛中的获胜方法将不是单一的超大模型,而是结合了模型、人类专家和严格验证流程的系统 。