基準測試領先。 Atlas 喺 CyberGym 拎到 90.9% 分數。CyberGym 係一個公開基準,用嚟測試 AI agent 喺 188 個開源軟件項目、總共 1,507 個任務入面,重現同發現真實漏洞嘅能力 。作為參考,最好嗰啲單一模型系統 — GPT-5.5 Cyber(85.6%)同 Anthropic 嘅 Mythos(83%)— 落後 5 至 8 個百分點 。就算係 Microsoft 嘅 MDASH 系統(2026 年 5 月用超過 100 個專業 agent 拎到 88.45% 分數)都被超越咗 。
發現超過 200 個零日漏洞。 喺 Wiz 自己嘅測試入面,Atlas 喺好多已經俾人用 fuzzing 同審計咗好多年嘅常用開源項目入面,搵到 超過 200 個從未公開嘅漏洞,包括 Linux kernel、Kubernetes、gVisor、containerd 同 dnsmasq 。好重要嘅係,每一個發現都由個 agentic 系統自動化咁由頭到尾驗證過,唔係淨係模型覺得有問題,而係有可重現嘅證據證明係真嘅保安問題 。
CVE-2026-3854 — 緊要嘅 GitHub RCE。 Atlas 嘅早期版本發現咗一個喺 GitHub 內部 git 基建入面嘅緊要遠端程式碼執行漏洞(CVE-2026-3854,CVSS 8.8)。呢個漏洞容許任何有 push 權限嘅已驗證用戶,用一條 git push 指令就喺 GitHub 嘅後端伺服器上面執行任意指令,仲可以完全讀寫人哋嘅私人倉庫 。Wiz 喺 2026 年 3 月 4 日透過 bug bounty 計劃報告俾 GitHub 。GitHub 喺 40 分鐘內重現咗個問題,兩個鐘內喺 github.com 上面部署咗修補程式,仲確認咗冇俾人喺現實世界利用過 。
10 萬美金 bounty。 GitHub 為咗呢個發現發咗 10 萬美金 bounty — 係個計劃歷史上最高金額嘅其中之一,不過 Wiz 嘅總獎勵可能係用 2026 年 7 月之前嘅舊費率計嘅 。
呢個係成個架構上最關鍵嘅故事。Atlas 唔係一個單一 AI 模型 — 佢係一個 多模型、agentic 系統 。佢同 GPT-5.5 Cyber 同 Mythos 呢啲單一模型嘅分別喺呢度:
| 層面 | Project Atlas(多智能體) | GPT-5.5 Cyber / Mythos(單一模型) |
|---|---|---|
| 架構 | Orchestrate 好多個專業 AI agent(負責 code analysis、fuzzing、static analysis、dependency tracing 嘅 sub-agent)一齊平行運作 | 一個訓練嚟做網絡安全任務嘅大型語言模型,自己一個做晒 |
| 模型多樣性 | 組合多個 frontier 模型(喺佢嘅 CyberGym 資格賽入面用咗 Claude Opus 4.6 同 GPT-5.5)— 每個子任務揀最適合嘅模型 | 限死咗一個模型系列同一套權重 |
| 工作流程 | 每個發現都由獨立嘅 verification agent 驗證,幾乎冇假陽性 | 單一模型輸出,比較難自己驗證自己 |
| 可擴展性 | 可以同時對住幾千個目標行幾百個 agent | 受制於單一模型嘅推理吞吐量 |
| 關鍵洞察 | 「做漏洞研究最好嘅模型架構唔係一個模型,而係一個有唔同專長嘅 orchestrated 團隊」 | 單一模型方法喺複雜嘅多步驟工作流程入面會撞到天花板 |
Wiz 認為 系統架構比模型本身嘅能力更重要 — Atlas 贏 GPT-5.5 Cyber 同 Mythos,唔係因為有個更好嘅 base model,而係因為佢聰明咁組合咗多個模型同 agent,仲有嚴謹嘅驗證循環 。
AI 保安軍備競賽嘅時間線清楚顯示咗,點樣由單一模型主導變到多智能體領先:
2026 年上半年:單一模型升級。 OpenAI 喺 2026 年 6 月推出咗完整版 GPT-5.5-Cyber(CyberGym 85.6%),作為佢哋 Daybreak 防禦計劃嘅一部分 。Anthropic 嘅 Claude Mythos Preview 都拎到高分,令到英國 AISI 同 Palo Alto Networks 嘅研究人員警告,模型已經「超越咗自動化黑客基準」。
2026 年 5 月:多智能體證明潛力。 Microsoft 嘅 MDASH 系統(超過 100 個專業 agent,CyberGym 88.45%)證明咗多智能體系統可以 outperform 單一模型 。
2026 年 7 月:多智能體贏出。 Wiz 嘅 Atlas(90.9%)超越晒前面兩個,證明咗 orchestration 多個 frontier 模型比任何單一模型都更勁 。
AI agent 配合系統性 fuzzing、static analysis 同 code review,正以史無前例嘅規模產生零日漏洞 — 淨係 Atlas 就已經喺啲審計過好多次嘅開源碼入面搵到 200 幾個 。呢波 AI 發現嘅 bug 對漏洞披露計劃嘅經濟造成好大壓力。GitHub 喺 2026 年 7 月 27 日將公開 bug bounty 嘅 payout 至少減半(緊要發現由 2 萬至 3 萬美金以上跌到固定 1 萬美金),不過只限邀請嘅 VIP 級別仍然俾 3 萬美金以上 。喺呢個日子之前提交嘅報告,包括 Atlas 發現嘅 CVE-2026-3854,就保留咗之前嘅 payout 條款 。
Wiz 嘅 Project Atlas 係目前 AI 漏洞研究嘅最先進技術 — 唔係因為佢用咗個更好嘅模型,而係因為佢嘅多智能體、多模型架構配合獨立驗證,明顯贏過單一模型系統(90.9% 對比 85.6% 同 83%)。呢個反映出 AI 保安領域一個更廣泛嘅轉變,由「邊個模型最好」變成「點樣有效地 orchestrate 模型」。正如 Wiz 同 Google 所講,喺 AI 保安軍備競賽入面,贏家唔會係一個單一 super-model,而係能夠結合模型、人類專業知識同嚴謹驗證流程嘅系統 。