DeepSeek V4 Pro 0813 在三次執行結果合併後找出 32 個漏洞中的 28 個,成本約 295 美元;這是測試最高的召回結果,但不代表單次執行必然找到 28 個。 測試結果支持以系統化方式分工:用成本較低、探索性較強的代理進行廣泛搜尋,再交由高精確度模型驗證、去重與分流,重大發現仍須經人工確認。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikido 在 2026 年 8 月進行的 AI 資安基準測試,讓 10 個模型各自面對 32 個近期公開的真實漏洞,並各執行三次。測試動用了 117 億個 token,重點不只是排出哪個模型第一,而是觀察模型在漏洞發現、穩定性、誤報取捨與成本效率上的差異。3
最醒目的結果是 DeepSeek V4 Pro 0813:三次執行的結果合併後,找出 32 個漏洞中的 28 個,合併召回率達 87.5%,成為這次測試在「發現階段」表現最強的模型。3
不過,這個 28/32 應理解為 pass@3 的合併結果,不是說模型單次執行就能穩定找出 28 個漏洞。不同執行可能探索不同檔案、程式路徑與利用假設;把多次結果合併,正是利用了這種搜尋多樣性。換句話說,安全團隊不應把模型第一次回覆當成完整的安全評估,而應設計多次獨立調查的流程。
DeepSeek V4 Pro 三次執行的總成本約為 295 美元,合併後達到 28/32。它的優勢在於覆蓋面廣,能在多次調查中挖出更多基準測試裡的漏洞。
這讓它適合放在安全工作流程的前段,負責提出大量候選發現。但候選結果仍需要通過證據驗證、去除重複項目,以及重新檢視嚴重程度,才能轉化為可交給工程團隊處理的正式警示。
DeepSeek V4 Flash 0731 三次執行找出 24/32,總成本約 108 美元。3
以「每一美元換來多少搜尋覆蓋」來看,Flash 的性價比相當突出。它適合用於平行掃描、低成本重跑或大量初步偵察,之後再把合併結果交給更重視精確度的階段審查。
Flash 不一定是最理想的最終審核者;它的價值在於同一預算下,可以增加調查嘗試的次數,讓系統探索更多可能的漏洞路徑。
如果說 DeepSeek Pro 強在探索廣度,Grok 4.6 的特色則是穩定性。測試中有 21 個漏洞在 Grok 的三次執行中全部出現,成為重複性最高的模型。3
對需要固定格式報告、可預期行為與週期性監控的團隊來說,這種一致性很有價值。即使某個探索性較強的模型在合併召回率上勝出,穩定的模型仍可能更適合標準化流程,因為每次掃描的結果較容易比較和追蹤。
Claude Opus 5 的合併召回率為 26/32,GPT-5.6 Sol 則為 25/32。3
兩者仍屬於高效能的前沿模型,但測試結果也削弱了一個常見假設:最昂貴的封閉模型不一定會帶來最高的漏洞覆蓋率。DeepSeek Pro 以約 295 美元完成三次執行,總覆蓋率高於部分更昂貴模型的單次執行,說明選型不能只看品牌或一般能力排行榜。
團隊應評估模型在推理、報告撰寫、證據整理或複核方面,能否為整條安全管線帶來互補價值。
Kimi K3 的突出表現是 92.3% 的合併精確率。精確率回答的是:「模型回報的結果中,有多少最終被接受?」它與召回率——「找回多少已知漏洞?」——並不是同一件事。
因此,Kimi K3 的定位可能不同於廣泛搜尋模型。高召回代理可以先大範圍探索、容許一定雜訊;高精確度模型則可以協助驗證漏洞是否真實、整理報告,並減少最後流向工程師的無效警示。
Aikido 觀察到,Qwen3.8-Max 有時會重新檢視同一個 CVE 或沿用相同的推理路徑。
當重複行動只是消耗調查回合、沒有增加覆蓋範圍時,這種行為顯然低效;但重新檢查也可能揭露先前漏掉的條件、執行路徑或驗證細節。因此,重點不只是禁止重複,而是讓系統能分辨「無效重播」與「有目的的複核」。
實務上的解法是由代理框架管理狀態:記錄哪些檔案已檢查、哪些假設已測試、哪些發現已回報,為重複分支設定上限;若個案仍未解決,則轉交新的調查路徑,而不是無限重播原本的推理。
在更新後的比較中,GLM-5.3 的結果由 24/32 提升至 25/32,同時維持比封閉式前沿模型更低的成本輪廓。3
這使它成為可信的高流量工作模型或集成系統組件。對組織而言,低成本與部署彈性帶來的最大好處,不只是每次請求更便宜,而是能在相同預算中執行更多次調查,再把結果集中交由後續階段處理。
漏洞發現系統至少應分開觀察以下指標:
這些指標對應不同的營運需求。漏洞探索通常偏好高召回率與多樣化的調查行為;直接產生正式警示,則更需要高精確率、可重現證據、去重能力與可靠的風險排序。
所以,一個很會提出可能性的模型,不一定適合把未經審核的警示直接送到開發者面前。反過來,高精確率模型也未必適合擔任第一輪獵尋者。
這次測試最值得注意的系統層面訊息,是模型表現具有隨機性。單次執行只會取樣一條調查路徑;多次獨立執行則提高探索不同假設的機會。
因此,三次相對便宜的 DeepSeek 執行,可能在總覆蓋率上追平甚至超越更昂貴模型的單次結果。真正應比較的單位,不只是一次模型呼叫,而是完整調查:模型、工具、提示設計、回合預算、記憶、重跑策略,以及最終驗證流程。3
根據這些結果,部署時可以把「探索」與「判斷」拆開:
這種依角色分派模型的做法,比把開放權重模型或封閉模型視為彼此可直接替換的元件,更能因應真實環境。
Aikido 的結果具有參考價值,但不能視為所有 AI 資安模型的普遍排名。測試只涵蓋 32 個近期公開漏洞、每個模型三次嘗試,以及特定的代理框架;若改變程式語言、程式庫結構、工具權限、威脅模型、調查預算或團隊對誤報的容忍度,結果都可能不同。3
因此,較穩妥也更有用的結論是:在這個測試環境裡,開放權重模型——尤其是 DeepSeek V4 Pro——在搭配重複執行與良好編排後,已能追平甚至超越封閉式前沿模型。3
但真正勝出的資安產品,不一定是標題分數最高的單一模型,而是能把廣泛發現、可靠驗證與工程師可採取行動的證據串在一起的完整系統。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
DeepSeek V4 Pro 0813 在三次執行結果合併後找出 32 個漏洞中的 28 個,成本約 295 美元;這是測試最高的召回結果,但不代表單次執行必然找到 28 個。
DeepSeek V4 Pro 0813 在三次執行結果合併後找出 32 個漏洞中的 28 個,成本約 295 美元;這是測試最高的召回結果,但不代表單次執行必然找到 28 個。 測試結果支持以系統化方式分工:用成本較低、探索性較強的代理進行廣泛搜尋,再交由高精確度模型驗證、去重與分流,重大發現仍須經人工確認。