不過,去到更深入嘅 ExploitBench 測試——呢個測試要求模型理解漏洞嘅根源,並實際交付可用嘅攻擊程式——情況就唔同晒。GLM-5.3 嘅得分雖然比上代提升超過一倍,由 24.4% 升到 54.4% ,但 Z.ai 報告顯示 Mythos 5 喺呢個測試嘅得分係 78%,而 GPT-5.6 Sol 就係 76.5%——換句話說,GLM-5.3 喺呢個更難嘅測試上仲係遠遠落後
。
至於 ExploitGym,呢個測試係計算模型喺標準化嘅兩小時預算內可以完成幾多個漏洞利用任務。GLM-5.3 完成咗 105 個任務(GLM-5.2 只係做到 29 個)。如果將預算延長到六小時,佢嘅完成量就上升到 130 個任務
。
| 基準測試 | 測試內容 | GLM-5.3 | Anthropic Mythos 5 | OpenAI GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | 從源碼中發現同驗證白色盒漏洞 | 84.5% | 83.8% | 83.6% |
| ExploitBench | 根源分析 + 交付可用攻擊程式 | 54.4% | 78% | 76.5% |
| ExploitGym(兩小時預算) | 標準化預算下完成漏洞利用任務 | 105 個任務 | 未披露 | 未披露 |
除咗基準測試之外,GLM-5.3 喺真實世界嘅安全測試中都交出咗亮麗嘅成績單:
GLM-5.3 喺編碼同代理型基準測試上都表現強勁,令佢成為軟件工程領域中領先嘅開源權重模型:
Z.ai 解釋話,模型嘅網絡安全能力喺後期訓練階段「增長得比預期快」。基礎模型嘅 7400 億參數 冇重新訓練過——所有嘅進步都係嚟自後期訓練嘅改進
。由於呢個能力係突然湧現嘅,公司決定將開源權重嘅發布延遲兩個星期,以便加強安全同保安控制
。目前,模型已經可以透過 Z.ai API,以及 ZCode、Claude Code 同 OpenCode 嘅整合使用
。