DeepSeek V4 Pro 0813 三轮合计发现 32 个漏洞中的 28 个,成本约 295 美元,取得测试中的最高召回率;但这并不意味着单次运行就能稳定发现 28 个漏洞。 测试结果更支持一套经过编排的安全系统:用成本较低、覆盖面广的模型负责探索,用稳定或高精度模型验证,再由人工复核重要发现。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikido 于 2026 年 8 月开展了一项 AI 网络安全基准测试:让 10 个模型分别进行 3 次独立调查,在 32 个近期披露的真实漏洞中寻找可被重新发现的问题。结果显示,DeepSeek V4 Pro 0813 以三轮合计发现 28 个漏洞的成绩领先,但更值得关注的结论并不是“哪个模型最强”,而是漏洞发现高度依赖重复调查、证据验证和模型分工。3
DeepSeek V4 Pro 0813 在三次运行结果合并后,发现了 32 个漏洞中的 28 个,合并召回率达到 87.5%。这使它成为本次测试中探索阶段表现最强的模型,但这个数字应理解为 pass@3 的结果,而不是单次调用就能稳定发现 28 个漏洞的保证。
不同轮次可能会检查不同文件、代码路径,并提出不同的利用假设。把多轮结果合并起来,系统就能从这种搜索差异中获得更高覆盖率。对实际安全工作而言,这意味着应运行多个相互独立的调查流程,而不能把模型的第一份回答当成完整的安全评估。3
DeepSeek Pro 三轮合计覆盖 28/32 个漏洞,成本约为 295 美元。它的优势在于探索广度:将多次调查结果合并后,能够暴露更多测试集中的漏洞。
因此,它很适合放在安全流程的第一阶段,负责尽可能广泛地寻找候选问题。不过,在这些发现转化为生产告警之前,仍需要进行证据验证、去重和严重性评估。
三轮 Flash 运行发现了 24/32 个漏洞,成本约为 108 美元。从“每美元带来的覆盖率”来看,这一结果相当有竞争力,也使它适合进行低成本并行扫描或补充性重跑。
但 Flash 并不天然适合作为最终审核者。它更适合在预算有限时增加调查次数,再把汇总后的结果交给更擅长筛选和验证的模型处理。3
Grok 4.6 的突出优势是可重复性:有 21 个漏洞在它的三次运行中全部出现。当团队需要可预测的行为、稳定的报告以及不同扫描之间较少的意外差异时,这种一致性非常重要。
它与 DeepSeek Pro 的强项并不相同。即使探索型模型在合并召回率上更高,在周期性监控或标准化流程中,高一致性模型仍可能更实用。
Claude Opus 5 的合并召回率为 26/32,GPT-5.6 Sol 为 25/32。两者仍属于表现靠前的选择,但测试结果削弱了这样一种常见假设:最昂贵的闭源模型必然能带来最高的漏洞覆盖率。
因此,选择这类模型的理由不应只是品牌或通用榜单排名。团队需要评估它们的推理、报告撰写或复核能力,是否能为现有安全流水线提供互补价值。3
Kimi K3 最亮眼的成绩是 92.3% 的合并精确率。精确率衡量的是:模型提交的发现中,有多少最终被接受,而不是它总共找到了多少漏洞。
这一差异决定了 Kimi 更适合承担与广泛搜索模型不同的任务。高召回模型可以先扩大搜索范围、容忍一定噪声;高精度模型则可以协助验证发现、整理报告,并减少最终流向工程师的低质量告警。
Aikido 观察到,Qwen3.8-Max 有时会重新检查同一个 CVE 或沿着相同的推理路径反复探索。如果这些重复没有扩大覆盖范围,就会白白消耗调查轮次;但在某些情况下,第二次检查也可能发现此前遗漏的条件、执行路径或验证细节。
更实际的解决方案在于改进代理框架本身:系统应记录已经测试过的内容,限制重复分支的次数,并将尚未解决的问题转交给新的调查流程,而不是自动重复播放同一条路径。
在更新后的比较中,GLM-5.3 的成绩从 24/32 提升至 25/32,同时仍保持着相较闭源前沿模型更低的成本特征。这使它成为高吞吐量执行模型或集成系统组件的可靠候选。
当组织能够利用成本和部署灵活性运行更多调查时,GLM-5.3 的价值尤其明显。关键不在于让它单独完成全部工作,而在于借助更多调查次数提升整体覆盖率。
漏洞发现系统不应把所有表现压缩成一个排行榜数字:
这些指标对应不同的运营需求。漏洞探索重视高召回率和多样化调查;生产告警则更看重精确率、可复现证据、去重和有用的风险排序。
换句话说,一个擅长广泛寻找可能问题的模型,未必适合把未经审核的告警直接发送给开发者。它可能非常适合“先撒网”,却不适合“直接定案”。
这项测试最重要的系统层面启示是:模型表现具有随机性。单次运行只会探索一条调查路径,而多次独立运行则增加了系统尝试不同假设的机会。
也正因为如此,三次成本相对较低的 DeepSeek 运行,可以在总覆盖率上追平甚至超过更昂贵前沿模型的一次运行。真正应该比较的单位,不只是一次模型调用,而是完整调查流程:模型、工具、提示词、轮次预算、记忆、重跑机制以及验证过程。3
根据这组结果,部署时可以把“广泛发现”和“最终判断”拆开:
这种按角色分配模型的方式,比把开源权重模型或闭源模型简单视为彼此的“即插即用替代品”更稳健。
Aikido 的结果具有参考价值,但不能视为 AI 安全模型的通用排名。测试只覆盖了 32 个近期披露的漏洞,每个模型运行 3 次,并使用了特定的代理框架。换成不同的编程语言、代码仓库结构、工具权限、威胁模型、调查预算或误报容忍度后,表现都可能变化。3
因此,更稳妥也更有用的结论是:在这项测试环境中,开源权重模型——尤其是 DeepSeek V4 Pro——在配合重复运行和流程编排后,已经能够追平或超过闭源前沿模型。
真正胜出的安全产品,未必是榜单上分数最高的模型,而是能够把广泛发现、可靠验证和工程师可据此采取行动的证据串成一体的系统。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
DeepSeek V4 Pro 0813 三轮合计发现 32 个漏洞中的 28 个,成本约 295 美元,取得测试中的最高召回率;但这并不意味着单次运行就能稳定发现 28 个漏洞。
DeepSeek V4 Pro 0813 三轮合计发现 32 个漏洞中的 28 个,成本约 295 美元,取得测试中的最高召回率;但这并不意味着单次运行就能稳定发现 28 个漏洞。 测试结果更支持一套经过编排的安全系统:用成本较低、覆盖面广的模型负责探索,用稳定或高精度模型验证,再由人工复核重要发现。