智譜 AI 發布 GLM 5.3,模型規模維持 7430 億參數;公司表示,主要進步來自後訓練,而非擴大基礎模型。 GLM 5.3 在 Terminal Bench 3.0 得分 28.3,在 DeepSWE 1.1 得分 66.9;GLM 5.2 的對應成績分別為 4.6 與 46.2。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Chinese AI startup Zhipu AI announce about its next-generation open-source foundation model GLM-5.3, including its 743-billion-para. Article summary: Zhipu AI announced GLM-5.3, a 743-billion-parameter open-weights foundation model positioned as a major capability upgrade achieved primarily through post-training rather than a larger base model. The company says it sub. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
智譜 AI(Zhipu AI)宣布推出 GLM-5.3。這款擁有 7430 億參數的開放權重基礎模型,主攻方向不再只是聊天或產生零散程式碼,而是程式設計、軟體工程,以及需要多輪規劃與工具操作的 AI 代理工作。智譜的核心說法是:GLM-5.3 與 GLM-5.2 維持相同模型規模,能力提升主要來自後訓練,尤其反映在長流程程式設計和工具使用評測上。
目前最受關注的數字包括:智譜稱 GLM-5.3 在自家 Z.ai Code Bench 的程式設計表現較 GLM-5.2 提升約 50%;在 Terminal-Bench 3.0 得分 28.3,在 DeepSWE 1.1 得分 66.9。這些成績顯示,模型的目標是完成多步驟工程任務,而不只是回答「請寫一段程式碼」這類單點問題。不過,相關數據主要仍是廠商公布的結果,是否能穩定複製到真實開發環境,仍需獨立測試與實際使用驗證。
GLM-5.3 的 7430 億參數規模本身已相當可觀,但更值得注意的是,智譜將這次更新描述為「同一基座、依靠後訓練提升能力」。換句話說,公司希望證明,改善訓練方法未必需要同步增加基礎模型的參數量,仍可能讓模型在特定工作上更有效率。
後訓練可以進一步塑造模型的工作方式,例如如何規劃任務、呼叫工具、遵循指令,以及在遇到錯誤後持續完成複雜流程。這也是近年 AI 模型競爭從「誰的參數更多」逐漸延伸至「誰更能把任務做完」的原因之一。
現有報導支持智譜對訓練方向的描述,但尚不足以獨立判定每項進步究竟來自哪一種後訓練技術,或不同訓練環節各自貢獻了多少。
智譜表示,GLM-5.3 在 Z.ai Code Bench 的表現較 GLM-5.2 提升約 50%。 而在要求模型連續處理軟體任務的評測中,差距更為明顯:
Terminal-Bench 3.0 特別能反映「代理式程式設計」的方向,因為評測不只看模型能否給出靜態答案,也涉及終端機與 Shell 操作。DeepSWE 1.1 則聚焦較完整的軟體工程任務,因此可作為模型處理開發流程能力的參考。
智譜稱,GLM-5.3 在發布時的 Terminal-Bench 3.0 成績是開放模型中最高,並領先月之暗面(Moonshot AI)的 Kimi K3。 但這屬於公司公布的排名;比較不同模型時,仍須同時確認評測版本、提示詞、推理設定,以及各模型取得資源是否一致。
GLM-5.3 背後的產品方向,是讓 AI 不只提出程式碼建議,而是能夠使用工具並完成更長的行動序列。智譜將它描述為可操作軟體、處理複雜任務,並在較少人工介入的情況下持續推進工作。
兩者的差別可以這樣理解:傳統程式助理可能只回答一個明確問題;AI 代理則可能先檢查程式碼庫,再執行指令、診斷錯誤、修改檔案,最後反覆測試,直到接近預定目標。
Terminal-Bench 3.0 和 DeepSWE 1.1 的進步,與這種發展方向相當吻合。但單一基準分數並不能保證模型在陌生的正式生產環境中,仍能安全且穩定地運作。
智譜也表示,GLM-5.3 的程式設計與代理能力已接近 Claude Fable 5,並主張在實際程式開發任務上,比其他中國模型更具實用優勢。 這些屬於智譜的產品定位與比較說法,不應直接視為獨立排行榜已經確認的結論。
智譜也把 GLM-5.3 的推理與工具使用能力延伸至網路安全工作,包括辨識軟體漏洞。公開報導的評測數據顯示,模型在 CyberGym 涵蓋漏洞發現與驗證的任務中,得分為 84.5%。
這類能力具有明顯的雙重用途。一方面,更強的程式理解與軟體操作能力,可能協助防守方找出弱點;另一方面,若缺乏適當限制,同樣的能力也可能讓不安全的自主操作帶來更大風險。
因此,現有證據可以支持「漏洞發現是 GLM-5.3 宣稱的能力領域」這個說法,但不能據此認定它已是可靠的資安稽核工具,更不能視為它能安全地自主進行攻擊或漏洞利用。
GLM-5.3 最重要的訊號,不只是 7430 億參數,而是智譜把重點放在後訓練,以及模型能否持續完成多步驟軟體任務。
對開發者而言,評估模型時可優先關注以下幾點:
GLM-5.3 是一款 7430 億參數模型。智譜 AI 表示,它的主要性能增長來自後訓練,而不是更大的基礎模型。從 Terminal-Bench 3.0 由 4.6 提升至 28.3,以及 DeepSWE 1.1 由 46.2 提升至 66.9 來看,這次發布的主打訊息十分清楚:開放模型正朝著能處理更長軟體流程的程式設計代理發展。
這些結果值得進一步測試,特別是對正在評估開放模型程式設計與代理工作流程的團隊而言。然而,強勁的基準成績與可靠的自主操作之間,仍存在一段需要獨立驗證的距離。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
智譜 AI 發布 GLM 5.3,模型規模維持 7430 億參數;公司表示,主要進步來自後訓練,而非擴大基礎模型。
智譜 AI 發布 GLM 5.3,模型規模維持 7430 億參數;公司表示,主要進步來自後訓練,而非擴大基礎模型。 GLM 5.3 在 Terminal Bench 3.0 得分 28.3,在 DeepSWE 1.1 得分 66.9;GLM 5.2 的對應成績分別為 4.6 與 46.2。
智譜將模型定位為可處理較長軟體工程流程、使用工具及操作軟體的 AI 代理,也宣稱它具備找出潛在漏洞的能力。