DeepSeek V4 Pro 0813 三次調查結果合併後找出 32 個漏洞中的 28 個,成本約 295 美元,成為測試中召回率最高的模型;不過,呢個係 pass@3 結果,唔代表單次執行一定搵到 28 個。 測試結果更支持一套有分工嘅安全系統:用成本較低、覆蓋面較廣嘅模型負責搜尋,再用高精準度模型驗證,最後由人員覆核重要發現。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikido 於 2026 年 8 月測試 10 個 AI 模型,要求每個模型針對 32 個近期公開嘅真實漏洞,各自進行 3 次、每次 30 輪嘅離線調查。結果表面上係 DeepSeek V4 Pro 0813 登頂,但更值得留意嘅訊息係:AI 漏洞搜尋唔係單靠一個模型就可以包辦,重複調查、狀態記錄、結果驗證同模型分工,先至係實際部署嘅關鍵。 3
DeepSeek V4 Pro 0813 將 3 次調查結果合併後,搵到 32 個漏洞入面嘅 28 個,即係 87.5% pooled recall,成為今次測試發現漏洞最多嘅模型。三次執行成本約為 295 美元。 3
不過,呢個數字應該理解為 pass@3,而唔係單次呼叫模型就可以穩定找出 28 個漏洞。每一次調查可能會檢查唔同檔案、路徑,同埋提出唔同嘅利用假設;將幾次結果合併,就可以借助呢種探索差異提升整體覆蓋率。
換句話講,實務上更合理嘅做法係進行幾次相互獨立嘅調查,而唔係將模型第一次答案當成完整嘅安全評估。
DeepSeek Pro 以 28/32 嘅合併召回率領先,優勢在於覆蓋面廣:幾次調查合併後,可以揭示更多測試漏洞。
因此,佢適合放喺安全流程第一階段,負責盡量搵出候選問題。但模型報告仍然要經過證據驗證、去重、風險等級檢視,先至應該變成正式告警。
三次 Flash 執行搵到 24/32 個漏洞,成本約 108 美元。以每一美元換取嘅覆蓋率計,呢個表現相當有吸引力,適合用嚟做平行掃描、初步偵察或者追加重跑。
但 Flash 未必係最後審核嘅最佳人選。佢更實際嘅價值係:喺固定預算之內增加調查次數,再將合併結果交俾較嚴謹嘅驗證階段處理。 3
Grok 4.6 最突出嘅地方係可重複性:有 21 個漏洞喺 3 次執行入面都出現。
對於需要穩定報告、可預測行為同埋每次掃描結果唔好差距太大嘅團隊,呢種一致性相當重要。佢同 DeepSeek Pro 嘅強項唔同:前者偏向穩定,後者則偏向探索更多可能性。做定期監察或者標準化流程時,穩定性可能比最高合併召回率更加實用。
Claude Opus 5 嘅合併召回率係 26/32,GPT-5.6 Sol 就係 25/32。兩者仍然屬於高性能選擇,但結果亦削弱咗一個常見假設:最昂貴嘅封閉式模型,未必自然就係漏洞覆蓋率最高或者最抵用嘅方案。
團隊選擇呢類模型,理由唔應該只係品牌或者一般排行榜名次,而要睇佢喺推理、報告、驗證,或者處理複雜個案方面,能唔能夠為成套安全流程提供額外價值。 3
Kimi K3 最亮眼嘅結果係 92.3% pooled precision。Precision 代表模型提交嘅發現之中,有幾多最後獲得接受,而唔係模型總共搵到幾多漏洞。
呢個分別好重要。高召回率模型可以先大範圍搜尋,代價係可能帶來較多噪音;高精準度模型就適合協助驗證、整理報告,同埋減少真正流到工程師手上嘅誤報數量。
Aikido 留意到,Qwen3.8-Max 有時會反覆檢查同一個 CVE,或者沿住相同推理路徑打轉。假如重複行動只係消耗調查輪數而冇增加覆蓋率,當然係低效率;但第二次檢查亦可能意外揭示之前忽略嘅條件、執行路徑或者驗證細節。
實際解法應該放喺 agent harness,即係包住模型運作嘅工具同控制層:系統要記錄已經檢查過咩、測試過咩假設;對重複分支設定上限;遇到未解決個案時,就轉交一次全新調查,而唔係無限重播同一條路徑。
喺更新後嘅比較入面,GLM-5.3 由 24/32 提升至 25/32,同時維持比文中提到嘅封閉式前沿模型更低嘅成本定位。
呢個結果令佢適合做大量調查嘅工作模型,或者成為 ensemble,即係多模型組合嘅其中一環。佢嘅優勢唔一定係單次執行打敗所有對手,而係組織可以用較低成本進行更多次調查,提升整體覆蓋率。
漏洞發現系統唔應該將所有表現壓縮成一個排行榜分數:
對初步探索嚟講,高召回率同多元化嘅調查行為較重要;但如果係直接向工程師發出正式告警,就更加需要高精準度、可重現證據、去重同有用嘅風險排序。
所以,一個好擅長「諗可能性」嘅模型,未必適合未經審核就直接將結果推送畀開發團隊。DeepSeek Pro 可以負責廣泛搜尋,Kimi 就可能更適合做最後分流,兩者並唔係互相取代。
今次測試最重要嘅系統層面發現,係模型表現具有隨機性。單次執行其實只係抽樣咗一條調查路徑;多次獨立執行,就增加咗探索唔同假設嘅機會。
亦正因為咁,幾次相對便宜嘅 DeepSeek 執行,可以喺總覆蓋率上追過,甚至超過較昂貴前沿模型嘅單次結果。真正應該比較嘅單位,唔係一次模型呼叫,而係完整調查流程:包括模型、工具、提示、輪數上限、記憶、重跑方式,以及後續驗證。 3
根據今次結果,一套較穩陣嘅部署方式可以將「搜尋」同「判斷」拆開:
呢種模型路由方式,比起將開放權重模型或者封閉模型當成可以直接互換嘅即插即用工具,更貼近實際安全運作需要。
Aikido 嘅結果有參考價值,但唔係所有 AI 安全模型嘅通用排名。測試只涵蓋 32 個近期公開漏洞、每個模型 3 次嘗試,以及特定嘅 agent harness。模型表現可能會因為程式語言、程式庫結構、可用工具、威脅模型、調查預算,同埋團隊對誤報嘅容忍度而改變。 3
因此,較穩妥而且有用嘅結論係:喺今次設定之下,開放權重模型,尤其 DeepSeek V4 Pro,配合重複執行同良好編排後,可以追上甚至超越封閉式前沿模型。但真正勝出嘅安全產品,未必係排行榜分數最高嗰個模型,而係可以將廣泛搜尋、可靠驗證,同工程師真正用得着嘅證據串連起來嘅整套系統。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
DeepSeek V4 Pro 0813 三次調查結果合併後找出 32 個漏洞中的 28 個,成本約 295 美元,成為測試中召回率最高的模型;不過,呢個係 pass@3 結果,唔代表單次執行一定搵到 28 個。
DeepSeek V4 Pro 0813 三次調查結果合併後找出 32 個漏洞中的 28 個,成本約 295 美元,成為測試中召回率最高的模型;不過,呢個係 pass@3 結果,唔代表單次執行一定搵到 28 個。 測試結果更支持一套有分工嘅安全系統:用成本較低、覆蓋面較廣嘅模型負責搜尋,再用高精準度模型驗證,最後由人員覆核重要發現。