| 基準測試 | GLM-5.3 | GLM-5.2 (前代) |
|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 |
| DeepSWE v1.1 | 66.9 | 46.2 |
| Agents' Last Exam (CLI) | 28.5 | 23.8 |
| Z.ai Internal Code Bench | 約提升 50% | 基準線 |
註:Mythos 5 在 SWE-bench Pro(代理式編碼)上得分 80.3%,但雙方並未在這些特定基準測試上進行直接比較 。GLM-5.3 的所有提升均來自擴展的後期訓練,基礎的 743B 模型並未重新訓練
。
GLM-5.3 在漏洞偵測上宣稱以微幅差距領先 Mythos 5(CyberGym 84.5% vs 83.8%),但在漏洞利用方面則顯著落後(ExploitBench 54.4% vs 78.0%)。其開源權重發布因安全審查而延後,且其前代 GLM-5.2 被評估為幾乎不拒絕任何網路攻擊指令。Mythos 5 則始終保持高度限制——從未公開,僅限約 200 個經過審查的合作夥伴使用——但在生成有效攻擊程式這項最危險的攻擊性任務上能力遠為強大。
更廣泛的影響在於,開源權重模型正迅速縮小與前沿受限模型在網路任務上的能力差距,但安全防護機制仍明顯薄弱。中國對於頂尖 AI 模型出口問題的監管不確定性,也為 GLM-5.3 的權重能否如 Z.ai 行銷宣傳般自由取得,增添了另一層複雜變數。