然而,在更具挑战性的 ExploitBench 上,情况截然不同。ExploitBench 要求模型对漏洞进行更深层次的推理并生成可用的漏洞利用代码。GLM-5.3 的得分较前代翻了一番多,从 24.4% 提升至 54.4% 。但 Z.ai 报告称,Mythos 5 在该测试中得分 78%,GPT-5.6 Sol 得分 76.5%,GLM-5.3 的差距依然明显
。
在 ExploitGym 上,该测试衡量模型在标准化两小时预算内能完成多少利用任务。GLM-5.3 完成了 105 项任务(前代 GLM-5.2 为 29 项)。若将预算延长至六小时,完成任务数则升至 130 项
。
| 基准测试 | 测试内容 | GLM-5.3 | Anthropic Mythos 5 | OpenAI GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | 从源代码中发现并验证白盒漏洞 | 84.5% | 83.8% | 83.6% |
| ExploitBench | 漏洞根因推理并交付可用的利用代码 | 54.4% | 78% | 76.5% |
| ExploitGym(2 小时预算) | 在标准化预算下完成的利用任务数 | 105 个 | 未披露 | 未披露 |
除了基准测试,GLM-5.3 在实际安全测试中的表现同样引人注目:
GLM-5.3 在编程和智能体(Agent)基准测试中也表现强劲,使其成为软件开发任务中领先的开源权重模型:
Z.ai 表示,该模型的网络安全能力在后期训练中“增长速度快于预期”。基础模型的 7400 亿参数并未重新训练——所有性能提升均来自后期训练的改进
。由于这种能力是“突现”的,公司决定将开源权重的发布推迟两周,以便加强安全与安保控制措施
。该模型目前已通过 Z.ai API、ZCode、Claude Code 和 OpenCode 的集成提供服务
。