政府测试也显示,这类模型越来越擅长把多个独立任务连接成完整攻击流程,而不仅仅是解决单个安全挑战 。
英国国家网络安全中心(NCSC)也警告称,前沿 AI 模型已经能够在网络攻击的一些关键环节提供帮助,例如寻找零日漏洞或解决复杂加密问题 。
尽管 Mythos 在漏洞发现方面表现强劲,但现有证据也显示它 仍无法独立完成完整安全分析流程。
例如:
一些关于 Mythos 找到“数千个高危漏洞”的说法主要来自厂商相关材料或未经充分独立验证的报道,因此更合理的看法是:这些数字目前仍属于 厂商声明,而非已全面复现的研究结果 。
在实际企业环境中,这还可能带来新的问题:模型可以非常快地产生大量疑似漏洞,但安全团队仍需花时间验证,从而造成 漏洞筛查压力(triage overload)。
另一项重要发现是:Mythos 并非唯一达到这一能力水平的模型。
AISI 在后续测试中评估了 OpenAI 的 GPT‑5.5,并发现 另一家开发商的模型也达到了类似水平的网络安全能力 。
在该机构的网络安全测试套件中:
这表明,在前沿模型竞争中,能力提升正在迅速扩散,而不是长期由单一模型保持领先 。
一些第三方测试还指出,在以真实历史漏洞为基础的基准中,GPT‑5.5 也展现出接近 Mythos 的漏洞发现能力 。
因此,从 成本与性能比(cost‑adjusted performance) 的角度看,Mythos 的优势可能取决于整体系统设计、工具链和访问控制,而不只是模型本身。
尽管能力仍有限,但政府和金融机构仍在争相测试类似 Mythos 的系统。
原因很简单:如果攻击者也能使用这些工具,防御方必须先拥有它们。
例如:
在金融、能源和政府基础设施等领域,这种技术被视为一种 “攻防双用”能力。
AISI 的研究还显示,AI 能够独立完成的网络安全任务长度正在迅速增加。
该机构估计,自 2024 年以来,模型能够自动完成的网络任务复杂度 大约每 4.7 个月翻倍 。
这种增长速度意味着:
综合政府评估与公开测试结果,Mythos 最合理的定位是:
一个高效率、能力强但具有双重用途的网络安全助手,而不是自动化的网络防御专家。
它在漏洞发现和复杂任务串联方面表现突出,但关键问题仍未完全解决,例如:
随着 GPT‑5.5 以及更多专业安全代理系统的出现,未来的竞争可能不再只是“哪一个模型最强”,而是 谁能构建最有效的 AI 安全工具链与工作流程。