智譜 AI 首席科學家 Tang Jie 回覆網民「sooooooon」後,據報 GLM 5.3 僅數小時便正式發布。[12] GLM 5.3 沒有單純靠擴大模型參數取勝,而是以同一個約 7,430 億參數基座配合更大規模後訓練,提升長流程編程、終端機操作及工具型 AI 代理能力。[1][4][20] 智譜公布的 CyberGym 成績為 84.5,並稱曾在 269 個開源項目中發現 2,436 個安全問題;不過相關數字主要來自公司披露,仍需獨立評估。
研究答案

Create a landscape editorial hero image for this Studio Global article: What happened when Zhipu AI chief scientist Tang Jie responded “sooooooon” to a user asking about GLM-5.3, and what did Zhipu’s subsequently. Article summary: Tang Jie’s “sooooooon” proved unusually literal: Zhipu released GLM-5.3 only hours later, positioning it as a coding, agentic, and cyber-defence upgrade built on GLM-5.2’s base rather than a larger pretrained model. [1][. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Tang Jie 那句拉長版的「sooooooon」,這次幾乎可以按字面理解:據報智譜 AI 首席科學家回覆相關問題後,GLM-5.3 在數小時內便推出。12
這次發布的看點不只是速度。智譜將 GLM-5.3 定位為專注於編程、代理式軟件工程及網絡安全的模型。更特別的是,它沿用 GLM-5.2 的同一個約 7,430 億參數基座;智譜把主要性能提升歸因於擴大後訓練,而不是重新進行更大規模的預訓練。1
4
20
在大型語言模型競爭中,性能進步往往令人聯想到更多參數或重新訓練基礎模型。GLM-5.3 的發布則把焦點放在另一條路線:先保留原有基座,再透過後訓練,讓模型更擅長特定而複雜的工作流程。
智譜公布的比較中,較明顯的進步集中在需要長時間操作、調用工具或處理軟件工程任務的測試:
上述數字來自智譜公布的比較,以及對相關結果的二次分析。1
3
6
7
其中,Terminal-Bench 3.0 由 4.6 升至 28.3,按百分點計算的增幅尤其突出。不過,低基數上的大幅上升,不能直接等同於模型在所有軟件工程任務中都已經領先。以 SWE-Marathon 為例,報告中的 42.5 仍低於 Kimi K3 的 48.1 及 Opus 4.8 的 48.8。6
9
GLM-5.3 最受關注的數字,是在 CyberGym 取得 84.5。這項測試著重從原始碼中尋找並驗證漏洞。智譜的比較表把 GLM-5.3 排在 Mythos 5 的 83.8 及 GPT-5.6 Sol 的 83.6 之前。2
5
6
CyberGym 並非單純測試模型能否提出較安全的程式碼。據相關報道,任務包括識別弱點、構造攻擊,以及驗證攻擊效果;相比一般程式碼補全,更接近漏洞發掘和推演完整攻擊鏈。12
17
這也是為何 CyberGym 成績受到網絡安全媒體注意。《The Register》報道,智譜聲稱模型的進步不只體現在找出單一漏洞,也延伸至理解多個階段的漏洞利用鏈。17
但「領先」仍需要加上限定語。現有報道指出,這些比較主要是廠商公布或根據廠商測試整理,暫時沒有大規模獨立複現。2
4
6
除了 CyberGym,智譜據報表示曾與安全團隊合作,讓模型分析現實世界的代碼庫。公司公布的紀錄列出 269 個開源項目中的 2,436 個安全問題,其中 1,097 個屬嚴重或高危漏洞。報道又指,紀錄中最早的問題可追溯至 1981 年,而這些漏洞平均存在了 26.6 年才被發現。21
31
這些資料可以反映智譜希望把 GLM-5.3 與哪一類安全工作流程聯繫起來:不只是檢查程式碼風格,而是從實際項目中找出可驗證的安全問題。不過,相關數字的來源是智譜公布的紀錄,並非獨立審計結果,因此不宜視為已獲外部全面確認的測量數據。
智譜的宣傳重點也超越單次問答或程式碼生成。GLM-5.3 被定位為可支援長時間運行的 AI 代理,讓模型使用工具、操作終端機,並完成多步驟的工程任務。
據公布結果,GLM-5.3 在 Toolathlon Verified 得分 73.0,高於 GLM-5.2 的 59.9;在 AutomationBench 得分 48.2,高於前代的 26.2。1
7 其他已發布的比較則列出 Agents’ Last Exam 28.5。
11
這些測試所反映的實際差異是:模型的目標不只是產生看似合理的程式碼片段,而是能在代碼庫、終端機或工具環境中連續採取一系列行動。至於這種能力能否穩定轉化為生產環境中的工程成果,仍取決於工具權限、測試覆蓋率、人工審查,以及模型在特定代碼庫中的失敗率。
目前較穩妥的結論,不是「GLM-5.3 已經擊敗所有前沿模型」,而是智譜公布的結果顯示,它相較 GLM-5.2 在多項編程及代理式任務測試中有顯著提升,並在智譜及相關報道所列的 CyberGym 比較中取得領先成績。2
5
6
這些結果尚未證明 GLM-5.3 在所有編程、推理、安全性或通用任務上都全面優勝。部分競爭模型在個別編程測試中仍然領先,而目前的成績也未經廣泛獨立評估重現。6
9
更值得留意的,可能是它所代表的方法論:只要後訓練投入足夠,而且評估目標集中在真實軟件和安全工作流程,同一個大型基座也可能被訓練出更強的專門能力。若日後的獨立測試確認這些增幅,後訓練的規模與質量,或許會和參數數量一樣,成為衡量模型競爭力的重要指標。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
智譜 AI 首席科學家 Tang Jie 回覆網民「sooooooon」後,據報 GLM 5.3 僅數小時便正式發布。[12]
智譜 AI 首席科學家 Tang Jie 回覆網民「sooooooon」後,據報 GLM 5.3 僅數小時便正式發布。[12] GLM 5.3 沒有單純靠擴大模型參數取勝,而是以同一個約 7,430 億參數基座配合更大規模後訓練,提升長流程編程、終端機操作及工具型 AI 代理能力。[1][4][20]
智譜公布的 CyberGym 成績為 84.5,並稱曾在 269 個開源項目中發現 2,436 個安全問題;不過相關數字主要來自公司披露,仍需獨立評估。