GLM 5.3 配備 100 萬 token 上下文窗口,Z.ai 稱其 Z.ai Code Bench 表現較 GLM 5.2 提升 50%;其他公開測試升幅則主要來自第三方報告,未經獨立確認。[2][32] Z.ai 將主要改進歸因於擴大後訓練(post training)及更貼近真實多日工程、研究流程嘅任務環境,而唔係單純更換基礎模型架構。[2] 模型現時可經 Z.ai GLM Coding Plan 同 ZCode 使用;模型權重據報計劃喺 2026 年 8 月 14 日推出後約兩星期、完成額外安全評估後發布,時間仍屬暫定。[3][8][12][32]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3, how does it compare with GLM-5.2 in coding, long-horizon tasks, cybersecurity, and benchmarks such as Z.ai Code Benc. Article summary: GLM-5.3 is Z.ai’s flagship coding-and-agent model, aimed at complex software engineering and long-horizon tasks. It has a 1M-token context window and is available through Z.ai’s GLM Coding Plan; its API availability was . Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3 係 Z.ai 最新一代編程及 Agent 模型,定位係處理複雜軟件工程、深度除錯,以及需要連續做幾十步甚至更長時間嘅任務。Z.ai 列出模型具備 100 萬 token 上下文窗口,並指 GLM-5.3 喺長程、複雜工作上比上一代 GLM-5.2 更強。
今次更新嘅重點,唔只係傳統編程考試分數高咗。Z.ai 表示,GLM-5.3 喺自家 Z.ai Code Bench 提升 50%,並喺 Terminal-Bench 3.0、Agents’ Last Exam(CLI)等公開評測中,達到開源模型嘅頂尖表現。
官方最清楚嘅比較係 Z.ai 聲稱 GLM-5.3 喺內部 Z.ai Code Bench 比 GLM-5.2 高 50%。至於以下公開測試數字,就係由第三方報告整理,應該視為「已報告結果」,唔係經獨立機構確認嘅定論:
| 評測 | GLM-5.2 | GLM-5.3 | 反映嘅能力 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | 處理較長命令列任務嘅能力大幅提升 |
| DeepSWE v1.1 | 46.2% | 66.9% | 軟件工程任務表現更好 |
| Agents’ Last Exam(CLI) | 23.8% | 28.5% | 使用工具及執行 Agent 任務時有所改善 |
| CyberGym | 77.2% | 84.5% | 尋找漏洞嘅表現提升 |
| ExploitBench | 24.4% | 54.4% | 報告分數超過 GLM-5.2 一倍 |
由 4.6% 升至 28.3%,係呢份比較表入面最誇張嘅升幅。Terminal-Bench 3.0 同編程 Agent 特別相關,因為模型唔係淨係交一段獨立程式碼,而係要喺命令列環境入面操作工具、檢查目前狀態、修改檔案,再繼續完成後續步驟。
換句話講,測試更接近一個 Agent 真正幫手處理工程任務時嘅工作模式。不過,呢個結果只支持 GLM-5.3 喺該項測試明顯強過 GLM-5.2,並唔代表佢喺每個真實程式庫或開發流程都一定勝出。
Z.ai 對 GLM-5.3 嘅定位,係持續進行規劃、實作、除錯同反覆修改,並喺較大範圍嘅專案上下文入面一路跟進。官方模型總覽列出 100 萬 token 上下文窗口,亦明確將模型定位為適合長程、複雜任務。
呢個方向同單純改善「幫我寫一段函數」嘅模型更新唔同。Z.ai 稱 GLM-5.3 喺 Terminal-Bench 3.0 及 Agents’ Last Exam(CLI)達到開源模型頂尖表現,而自家 Code Bench 就報稱比 GLM-5.2 提升 50%。
對開發者嚟講,實際含意係模型理論上可以保留及運用更多專案資料,亦可以將一項工作拆開更多步驟完成。但跑分本身唔能夠證明模型喺你嘅環境一定可靠,亦唔代表延遲、成本、工具執行質素同生產穩定性同步改善。考慮轉用之前,最好用自己常見嘅程式庫、測試流程同部署工具做實測,唔好直接將 benchmark 升幅當成生產環境升幅。
Z.ai 表示,GLM-5.3 喺 CyberGym 漏洞發現測試取得截至目前最佳成績,漏洞利用方面嘅表現亦超過 GLM-5.2 兩倍。
第三方分數表就報告 CyberGym 由 77.2% 升至 84.5%,ExploitBench 由 24.4% 升至 54.4%。由於官方提供嘅資料節錄冇逐項重現呢啲數字,現階段較適合將佢哋視為發布時嘅報告數據,而唔係已經確立嘅業界基準。
呢部分結果有兩個值得注意嘅地方。第一,模型嘅 Agent 能力似乎唔只體現喺寫應用程式,亦延伸到分析程式漏洞、驗證問題同推理攻擊路徑。第二,能力愈強,安全評估就愈重要:同一套能力可以支援防禦性保安研究,但如果缺乏適當限制,亦可能增加誤用風險。
Z.ai 將 GLM-5.3 嘅進步主要歸因於規模化 後訓練(post-training)。公司表示,佢哋擴大咗訓練期間使用嘅任務環境,令環境更加接近真實世界入面持續數日嘅工程及研究流程,而唔係只集中處理短而獨立嘅編程題目。
因此,今次升級嘅重點唔係單純加大上下文窗口,亦唔係官方另外公布一個全新基礎架構。Z.ai 嘅說法係,後訓練過程針對規劃、工具使用、從失敗中恢復,以及持續完成多階段任務作出強化,呢點亦解釋到點解長程及 Agent 評測出現較大升幅。
當然,以上係 Z.ai 對改進來源嘅解釋。到底升幅有幾多可以跨模型、Agent harness、提示詞及不同軟件專案泛化,仍然要等更多獨立測試先可以判斷。
GLM-5.3 目前可以經 Z.ai 嘅 GLM Coding Plan 使用,並已加入 ZCode 開發環境;GLM Coding Plan 所列嘅 Max、Pro 及 Lite 方案均支援最新模型。
就提供嘅資料嚟睇,模型權重當時尚未公開。第三方報告指,Z.ai 預計喺 2026 年 8 月 14 日發布後約兩星期、完成額外安全評估後先發布權重,即大約落喺 2026 年 8 月下旬。不過,呢個時間表並非官方文件節錄直接確認,仍然屬暫定安排。
對開發者而言,現時要分清楚「可以使用」同「可以自行重現」係兩回事:你可以透過 Z.ai 支援嘅編程產品試用 GLM-5.3,但喺相關權重正式公開前,外界未能完全喺本地重現發布時所報告嘅結果。
GLM-5.3 並唔似係一次例行嘅型號更新,而係針對編程 Agent 工作方式嘅升級。Z.ai 報告指,模型喺內部編程測試比 GLM-5.2 提升 50%,長程 Agent 評測及網絡安全測試亦有明顯進步。
最大嘅保留位係證據完整性:Z.ai 官方資料確認咗改進方向,但逐項公開跑分比較,以及「發布後約兩星期開放權重」嘅時間表,主要來自第三方報道,仍有待獨立驗證。
所以,現階段較準確嘅理解係:GLM-5.3 係一個值得留意、目前可以透過產品使用嘅編程 Agent 升級版;但喺更廣泛測試及權重正式發布之前,仲未可以當成完全獨立可重現嘅開源模型。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
GLM 5.3 配備 100 萬 token 上下文窗口,Z.ai 稱其 Z.ai Code Bench 表現較 GLM 5.2 提升 50%;其他公開測試升幅則主要來自第三方報告,未經獨立確認。[2][32]
GLM 5.3 配備 100 萬 token 上下文窗口,Z.ai 稱其 Z.ai Code Bench 表現較 GLM 5.2 提升 50%;其他公開測試升幅則主要來自第三方報告,未經獨立確認。[2][32] Z.ai 將主要改進歸因於擴大後訓練(post training)及更貼近真實多日工程、研究流程嘅任務環境,而唔係單純更換基礎模型架構。[2]
模型現時可經 Z.ai GLM Coding Plan 同 ZCode 使用;模型權重據報計劃喺 2026 年 8 月 14 日推出後約兩星期、完成額外安全評估後發布,時間仍屬暫定。[3][8][12][32]