GLM 5.3 喺 CyberGym 漏洞檢測以 84.5% 些微領先 Mythos 5(83.8%)同 GPT 5.6 Sol(83.6%),但製作實際攻擊程式嘅能力就落後一大截,ExploitBench 只得 54.4% 對比 Mythos 5 嘅 78.0%。 Z.ai 今次嘅開放權重唔係即時,要等至少兩星期安全審查,同上一代 GLM 5.2 完全開放嘅做法好唔同,反映佢哋對網絡安全風險嘅顧慮。
研究答案

Create a landscape editorial hero image for this Studio Global article: How does Chinese AI startup Z.ai's open source GLM 5.3 model compare to Anthropic's restricted Mythos 5 model in cybersecurity vulnerability. Article summary: GLM-5.3 claims a narrow lead over Mythos 5 on vulnerability *detection* (84.5% vs 83.8% on CyberGym), but trails significantly on *exploitation* (54.4% vs 78.0% on ExploitBench). Its open-weight release is delayed for sa. Topic tags: general web, ai safety, openai, llm, agents. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
2026年8月14日,中國AI初創Z.ai推出咗佢哋嘅新一代開源模型GLM-5.3,號稱喺漏洞檢測能力上超越咗Anthropic嘅封閉式模型Mythos 5。呢個宣稱即時喺科技界引起咗唔少討論,因為背後涉及嘅唔止係AI能力嘅比拼,仲有關於開源安全、模型監管同中美AI競賽嘅深層次問題。
喺CyberGym呢個測試模型能否從源碼中找出並驗證真實漏洞嘅基準入面,GLM-5.3取得咗84.5%嘅分數,稍稍高過Mythos 5嘅83.8%同OpenAI GPT-5.6 Sol嘅83.6%。 Z.ai更話喺訓練過程中,GLM-5.3發現咗2,436個之前從未公開過嘅真實漏洞,呢個能力嘅增長「快過預期」。
但要注意,呢啲分數係Z.ai自己報告嘅,暫時未有獨立第三方核實。
漏洞檢測只係第一步,真正危險嘅係將漏洞變成可以實際用嘅攻擊程式。喺ExploitBench呢個測試更深層次攻擊能力嘅基準上,GLM-5.3嘅54.4%雖然比上一代GLM-5.2嘅24.4%進步咗好多,但對比Mythos 5嘅78.0%同GPT-5.6 Sol嘅76.5%,仍然有23.6個百分點嘅明顯差距。
換句話講,GLM-5.3喺「發現邊度有問題」方面贏咗少少,但喺「點樣利用呢個問題」方面仲有好大距離。
GLM-5.3可以即時用API或者Z.ai嘅Coding Plan(月費$18美元)使用,但下載模型權重就要等至少兩星期嘅安全審查。 呢個做法同上一代GLM-5.2好唔同——GLM-5.2喺2026年6月16號推出時係完全開放權重嘅。
爲咗咁樣?可能同GLM-5.2嘅安全評估報告有關。美國NIST旗下嘅CAISI組織喺2026年7月評估,發現GLM-5.2嘅安全機制「好壞參半」,尤其係會協助開發網絡攻擊程序,對高風險指令嘅拒絕能力好弱。 另一份由SaferAI嘅報告更指出,GLM-5.2對高風險網絡攻擊指令嘅拒絕率係0%,漏洞重現率高達76%,呢啲數字都令人憂慮。
Anthropic從來冇公開過Mythos 5。呢個模型只限約200間經審查嘅機構使用,包括美國政府,呢個計劃叫做「Project Glasswing」。 Anthropic仲將模型拆分成一個安全版「Fable 5」畀公眾使用,呢個版本喺網絡攻擊任務上嘅分數係0%。
換句話講,Anthropic嘅策略係:你知道Mythos 5好勁,但你用唔到;你要用嘅係經安全處理嘅弱化版。
| 基準 | GLM-5.3 | GLM-5.2 (上一代) |
|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 |
| DeepSWE v1.1 | 66.9 | 46.2 |
| Agents' Last Exam (CLI) | 28.5 | 23.8 |
| Z.ai 內部編程基準 | 約提升50% | 基線 |
值得留意嘅係,GLM-5.3所有嘅進步都係透過後續強化訓練(post-training)完成嘅,底層嘅743B參數模型冇重新訓練過。 Mythos 5喺SWE-bench Pro(智能編程)取得80.3%,但呢啲基準喺兩個模型之間冇直接可比數據。
GLM-5.3喺漏洞檢測上(CyberGym 84.5% vs 83.8%)聲稱些微領先Mythos 5,但喺攻擊程式開發上(ExploitBench 54.4% vs 78.0%)就明顯落後。佢嘅開放權重要延遲安全審查,而上一代GLM-5.2被評為對網絡攻擊指令幾乎零拒絕。Mythos 5始終保持高度限制——從未公開,只限約200間經審查合作夥伴——但喺最危險嘅攻擊任務上能力更強。
更大嘅啟示係:開放權重模型喺網絡任務上正快速縮窄同封閉式頂尖模型嘅能力差距,但安全保護機制仍然明顯較弱。中國對頂尖AI模型出口嘅監管不確定性,亦令GLM-5.3嘅權重最終能否如Z.ai所宣傳嘅自由開放,存在變數。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
GLM 5.3 喺 CyberGym 漏洞檢測以 84.5% 些微領先 Mythos 5(83.8%)同 GPT 5.6 Sol(83.6%),但製作實際攻擊程式嘅能力就落後一大截,ExploitBench 只得 54.4% 對比 Mythos 5 嘅 78.0%。
GLM 5.3 喺 CyberGym 漏洞檢測以 84.5% 些微領先 Mythos 5(83.8%)同 GPT 5.6 Sol(83.6%),但製作實際攻擊程式嘅能力就落後一大截,ExploitBench 只得 54.4% 對比 Mythos 5 嘅 78.0%。 Z.ai 今次嘅開放權重唔係即時,要等至少兩星期安全審查,同上一代 GLM 5.2 完全開放嘅做法好唔同,反映佢哋對網絡安全風險嘅顧慮。
Mythos 5 從未公開,只限約 200 間經審查嘅機構使用,Anthropic 仲將模型分拆出一個冇網絡攻擊能力嘅「Fable 5」版本,安全門檻遠高於 Z.ai。