核心規格一覽:
一項關鍵的架構創新是「IndexShare」機制。為了讓高達 100 萬 Token 的超長上下文視窗在經濟上可行,Z.ai 讓一個輕量級的索引器(indexer)在每四層稀疏注意力層中重複使用。根據技術分析,這個技巧能在完整的 100 萬上下文長度下,將每個 Token 的計算量降低約 2.9 倍,避免了長上下文模型常出現的效能衰退問題 。
Z.ai 直接將 GLM-5.2 與 GPT-5.5 及 Claude Opus 4.8 進行比較。下表中的分數由 Z.ai 自行公布,其中也包含了他們為競爭對手所引用的數據。這些數字僅代表單一廠商的測量結果,尚未經過其他競爭實驗室的獨立驗證 。
GLM-5.2 在多項程式編寫與推理評測中領先 GPT-5.5。 在 SWE-bench Pro 上,GLM-5.2 得分 62.1,勝過 GPT-5.5 的 58.6 。在要求更高的 20 小時自主工程基準 FrontierSWE 上,GLM-5.2 以 74.4 分勝過 GPT-5.5 的 72.6 分
。而在數學方面,它以近乎完美的 99.2 分在 AIME 2026 中勝出,微幅領先兩個美國競爭對手
。
GLM-5.2 與 Claude Opus 4.8 在代理程式編寫能力上的差距已顯著縮小。 儘管 Opus 4.8 在幾項基準上仍保持明顯領先,尤其是在 SWE-bench Pro 上以 69.2 分勝過 GLM-5.2 的 62.1 分 ,但在長時程代理任務的結果上,兩者已非常接近。在 FrontierSWE 上,GLM-5.2 僅落後 Opus 4.8 約 0.7 分(74.4 vs 75.1)
。在 MCP-Atlas 上則僅落後 0.8 分(77.0 vs 77.8)
。
相較於前代 GLM-5.1 有飛躍性的進步。 進步幅度最驚人的是 Terminal-Bench 2.1,GLM-5.2 的 81.0 分比起前一代的 62.0 分,有高達 19 分的跳躍式增長 。這也使 GLM-5.2 成為第一個在此基準上突破 80% 大關的開源權重模型
。
同樣重要的是,必須留意 GLM-5.2 在哪些方面仍處於落後。在最困難、時程最長的任務上,例如 SWE-Marathon(超長週期工程),Opus 4.8 以 26.0% 的成績領先 GLM-5.2 的 13.0%,這是一個顯著的差距,顯示美國的頂尖模型在極長時間的代理執行可靠性上,仍掌握著一定優勢 。
GLM-5.2 的競爭力故事,不僅關乎效能,更關乎價格。
zai-org/GLM-5.2 儲存庫中以 MIT 授權釋出,其中也包含了便於本地部署的 FP8 量化版本 這種寬鬆的 MIT 授權加上不受限於特定基礎設施的部署模式,讓開發者能夠自行託管模型、整合進 CI/CD 管線,並避免被特定廠商綁定——這與其主要競爭對手封閉的、僅限 API 的取用模式形成了鮮明對比。
GLM-5.2 釋出的時間點,技術意義與象徵意義同樣重大。它發布的同一週,美國政府正好升級了對 Anthropic 旗下 Claude Fable 5 的管制力道,據報導此舉動受到亞馬遜執行長與白宮官員對話的影響 。這樣的對比刻意且強烈:在美國對其領先的 AI 實驗室收緊管控之際,一個完全開放的中國頂尖模型橫空出世。
Z.ai 的創辦人明確以「前沿智慧屬於每個人(Frontier Intelligence Belongs to Everyone)」的口號來宣傳這次 MIT 授權釋出 ,將 GLM-5.2 定位為美中科技競爭升溫下,兼具技術實力與政治表態的產品。