Terminal-Bench 3.0 對智譜所講的「AI 編程代理」特別有參考價值,因為評測涉及終端機、Shell 及工具互動,而唔係單純回答問題。DeepSWE 1.1 則較集中測試軟件工程任務,反映模型能否處理更完整的開發流程。
智譜稱,GLM-5.3 的 28.3 分在發布時為開源模型之中最高,並領先 Moonshot AI 的 Kimi K3。 不過,呢個排名屬於公司公布的比較結果,閱讀時仍要一併留意評測版本、提示方法,以及各模型實際運行時使用的條件。
兩者的分別可以咁理解:一般編程助手可能只會回答一條清晰問題;而 AI 代理就要能夠檢查程式碼庫、執行指令、分析錯誤、修改檔案,再繼續向目標推進。Terminal-Bench 及 DeepSWE 的提升,與呢個產品方向相當吻合,但單靠基準測試分數,仍然唔足以證明模型可以喺陌生的生產環境中穩定工作。
呢類能力具有明顯的雙重用途。協助防守者找出弱點的推理及軟件操作能力,同樣可能令不安全的自主行為帶來更大後果。因此,現有證據只支持將「漏洞發現」描述為模型聲稱具備的能力範疇,唔代表 GLM-5.3 已經係可靠的網絡安全審計工具,更唔代表它可以安全地自主進行漏洞利用。
GLM-5.3 最重要的訊號,未必係 7430 億參數呢個數字,而係智譜將焦點放在後訓練,以及衡量模型能否跨多個步驟持續完成軟件工作的評測上。
如果開發者想實際評估模型,可以由以下幾方面入手:
GLM-5.3 是一個 7430 億參數模型。智譜表示,它大部分能力提升來自後訓練,而唔係更換或擴大基礎模型。模型在 Terminal-Bench 3.0 由 4.6 升至 28.3,在 DeepSWE 1.1 由 46.2 升至 66.9,清楚反映其主打方向:打造可以處理較長軟件任務的編程代理。
呢些結果足以令開放模型編程及 AI 代理工作流程值得進一步測試,尤其係需要模型連續使用工具、除錯及修改檔案的場景。不過,基準測試上的亮眼表現,與在真實生產環境中長時間、穩定及安全地自主運作,中間仍然有一段距離,最終仍要靠獨立驗證。