| 基准测试 | GLM-5.3 | GLM-5.2(上一代) |
|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 |
| DeepSWE v1.1 | 66.9 | 46.2 |
| Agents' Last Exam (CLI) | 28.5 | 23.8 |
| Z.ai 内部编码测试 | 提升约50% | 基准线 |
注意:Mythos 5在智能体编码测试SWE-bench Pro上得分为80.3%,但在上述特定基准测试上,目前尚无与GLM-5.3的直接横向对比数据。值得注意的是,GLM-5.3的全部性能提升均来自于扩展的后训练,其743B的基础模型并未重新训练
。
GLM-5.3在漏洞检测方面声称以微弱优势领先Mythos 5(CyberGym:84.5% vs 83.8%),但在漏洞利用方面(ExploitBench:54.4% vs 78.0%)则大幅落后。其开源权重因安全审查而被推迟发布,而其前代模型GLM-5.2被评估为几乎不拒绝任何网络攻击指令。相比之下,Mythos 5仍然受到极其严格的限制——从未公开过,仅限约200家经过审查的合作伙伴获取——但在生成可用漏洞利用代码这一最为危险的攻击性任务上,其能力也远超对手。更广泛的影响在于,开源权重模型在网络任务能力上正在迅速缩小与前沿受限模型的差距,但其安全保障仍然薄弱得多。中国监管机构对出口顶级AI模型的不确定性,也为GLM-5.3的模型权重能否像Z.ai营销宣传的那样自由可得,增添了另一层复杂性。