Tang Jie 將「sooooooon」拖長到幾乎似係吊胃口,結果這句話來得異常準確:有報道指,智譜 AI(Zhipu AI/Z.ai)在其首席科學家回覆數小時後,就發布了 GLM-5.3。
12
不過,這次發布受關注,並不只是因為「快」。GLM-5.3 的定位相當清晰:集中處理編程、可以自行使用工具的 AI Agent 工作,以及網絡安全。更特別的是,智譜表示模型沿用 GLM-5.2 約 7,430 億參數的基座,據報的進步主要來自擴大後訓練,而不是重新進行一輪更大規模的預訓練。
1
4
20
同一個基座,點解可以進步咁多?
在大型語言模型競爭中,性能提升往往令人聯想到更多參數,或者重新訓練一個更大的基礎模型。GLM-5.3 的說法則將焦點放在「後訓練」:即模型完成基礎訓練後,再用針對性數據、推理流程及任務回饋,持續調整模型處理特定工作的方式。
智譜公布的比較顯示,進步最明顯的正是需要模型長時間拆解問題、使用工具及執行多個步驟的軟件工程任務:
- SWE-Marathon:19.4 升至 42.5
- FrontierSWE:67.5 升至 78.1
- Terminal-Bench 3.0:4.6 升至 28.3
- DeepSWE v1.1:46.2 升至 66.9
以上數字來自智譜公布的比較,以及整理相關結果的後續分析。
1
3
6
7
Terminal-Bench 由 4.6 升至 28.3,按百分點計算確實相當突出;但由較低起點大幅上升,並不等於模型在所有軟件工程任務都已經無敵。以 SWE-Marathon 為例,報告中的 42.5 仍低於 Kimi K3 的 48.1 及 Opus 4.8 的 48.8。
6
9
換句話說,GLM-5.3 的重點未必是「全面勝出」,而是同一個大型基座在針對性後訓練下,能否在特定、複雜而且講求長時間執行的工作中,取得大幅改善。
CyberGym 成為最搶眼成績
GLM-5.3 最受注目的數字,是在 CyberGym 得分 84.5。這項基準測試,主要評估模型能否從源代碼找出並驗證安全漏洞。智譜的比較表顯示,這個成績略高於 Mythos 5 的 83.8 及 GPT-5.6 Sol 的 83.6。
2
5
6
CyberGym 測試的並不是普通的「幫手寫安全代碼」。相關任務涉及找出弱點、設計攻擊,以及確認攻擊造成的效果;換句話說,更接近漏洞發現、攻擊路徑推理及驗證,而不只是一般代碼補全。
12
17
這亦是為甚麼網絡安全媒體特別留意這個結果。《The Register》報道智譜的說法,指 GLM-5.3 的能力不只是更容易發現單一漏洞,亦開始能夠推理一條由多個階段組成的漏洞利用鏈。
17
但「領先」仍然需要加上前提。現有報道所引用的比較,主要是供應商自行公布或自行測試的結果,目前未有大規模獨立複製驗證。
2
4
6
智譜亦公布現實代碼庫測試數字
除 CyberGym 外,智譜據報曾與安全團隊合作,將模型放到現實世界的代碼庫中測試。公司公布的紀錄顯示,模型在 269 個開源項目中找出 2,436 個安全問題,其中 1,097 個屬 Critical 或 High 嚴重程度。報道又指,最早的問題可以追溯至 1981 年,而相關漏洞平均隱藏了 26.6 年。
21
31
這些數字可以反映智譜希望將 GLM-5.3 聯繫到哪一種網絡安全工作流程:不只是閱讀代碼,而是持續掃描大型項目、驗證漏洞,再交由專家審核及處理。
不過,讀者不應將這份紀錄當作已經獨立審計的測量結果。現有資料將這些數字歸因於智譜公布,而整體基準測試紀錄亦主要建基於公司披露。
主打的不只是寫代碼,而是完成整套工作
智譜對 GLM-5.3 的定位,亦不限於輸入一句指令、輸出一段看似合理的程式碼。模型主打的是長時間運作的 AI Agent:可以使用工具、操作終端機,並處理涉及多個步驟的工程任務。
已公布的結果包括:
- Toolathlon Verified:由 GLM-5.2 的 59.9 升至 73.0
- AutomationBench:由 26.2 升至 48.2
- Agents’ Last Exam:28.5
1
7
11
這些測試帶出一個實際分別:模型的賣點不只在於寫出一段「睇落啱」的代碼,而是能否在代碼庫、終端機及其他工具環境之間,按次序採取行動並完成任務。
至於這些成績能否直接轉化成可靠的生產環境工程能力,仍然要看工具權限、測試覆蓋率、人工審查流程,以及模型在特定代碼庫上的出錯率。Benchmark 分數高,並不代表可以完全取代工程師的 code review 或安全審核。
這次發布真正證明了甚麼?
目前最穩妥的結論,比「GLM-5.3 擊敗所有頂尖模型」窄得多:智譜公布的結果顯示,GLM-5.3 相比 GLM-5.2,在多項編程及 AI Agent 基準測試有顯著提升;而在智譜公布、亦被多家報道引用的比較表中,CyberGym 84.5 是最高分。
2
5
6
但這些數字尚未證明 GLM-5.3 在所有編程、推理、安全性及通用任務上都全面優勝。部分競爭模型在個別編程基準測試仍然領先,而目前的結果亦未經獨立評估者廣泛重現。
6
9
更值得留意的,可能是它背後的方法:GLM-5.3 將「擴大後訓練」當成由現有大型基座解鎖專門能力的主要手段。如果日後獨立測試能確認這些增幅,AI 模型的競爭焦點就可能不再只是參數數量,亦會更加重視後訓練投資,以及模型在真實軟件開發和網絡安全流程中的表現。