GLM 5.3 ottiene l'84,5% su CyberGym (rilevamento vulnerabilità), superando Mythos 5 (83,8%) e GPT 5.6 Sol (83,6%). Su ExploitBench (generazione di exploit funzionanti) il divario è enorme: 54,4% per GLM 5.3 contro 78,0% per Mythos 5.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Chinese AI startup Z.ai's open source GLM 5.3 model compare to Anthropic's restricted Mythos 5 model in cybersecurity vulnerability. Article summary: GLM-5.3 claims a narrow lead over Mythos 5 on vulnerability *detection* (84.5% vs 83.8% on CyberGym), but trails significantly on *exploitation* (54.4% vs 78.0% on ExploitBench). Its open-weight release is delayed for sa. Topic tags: general web, ai safety, openai, llm, agents. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Il 14 agosto 2026 Z.ai ha lanciato GLM-5.3, un modello open-source basato su un'architettura da 743 miliardi di parametri, ottenendo risultati all'avanguardia nel benchmark CyberGym per il rilevamento delle vulnerabilità (84,5%), superando di poco il ristretto Mythos 5 di Anthropic (83,8%) e GPT-5.6 Sol di OpenAI (83,6%) . Tuttavia, GLM-5.3 è decisamente indietro rispetto a Mythos 5 nello sviluppo effettivo di exploit (54,4% contro 78,0% su ExploitBench), e il rilascio dei pesi aperti è stato ritardato in attesa di una revisione della sicurezza
. Il confronto rivela un quadro complesso: leadership di misura nel rilevamento, ma lacune evidenti nello sfruttamento delle vulnerabilità, nei controlli di accesso, nella postura di sicurezza e nel contesto normativo.
| Benchmark | GLM-5.3 | GLM-5.2 (generazione precedente) |
|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE v1.1 | 66,9 | 46,2 |
| Agents' Last Exam (CLI) | 28,5 | 23,8 |
| Z.ai Internal Code Bench | ~50% di miglioramento | baseline |
Nota: Mythos 5 ottiene l'80,3% su SWE-bench Pro (coding agentico), ma non sono disponibili confronti diretti su questi benchmark specifici tra i due modelli . Tutti i miglioramenti di GLM-5.3 derivano esclusivamente da un potenziamento del post-training — il modello base da 743 miliardi di parametri non è stato riaddestrato
.
GLM-5.3 rivendica un vantaggio di misura su Mythos 5 nel rilevamento delle vulnerabilità (84,5% contro 83,8% su CyberGym), ma è nettamente in svantaggio nello sfruttamento (54,4% contro 78,0% su ExploitBench). Il rilascio dei suoi pesi aperti è stato ritardato per una revisione della sicurezza e il suo predecessore GLM-5.2 è stato valutato come avente una capacità di rifiuto prossima allo zero per le istruzioni di attacco informatico. Mythos 5 rimane molto più limitato — mai disponibile pubblicamente, riservato a circa 200 partner verificati — ma anche molto più capace nel compito offensivo più pericoloso: generare exploit funzionanti. La conseguenza più ampia è che i modelli a pesi aperti stanno rapidamente colmando il divario di capacità con i modelli ristretti di frontiera nei compiti cyber, mentre le salvaguardie di sicurezza rimangono sostanzialmente più deboli. L'incertezza normativa cinese sull'esportazione dei migliori modelli di AI aggiunge un ulteriore livello di complessità sulla questione se i pesi di GLM-5.3 saranno mai così liberamente disponibili come suggerisce il marketing di Z.ai.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GLM 5.3 ottiene l'84,5% su CyberGym (rilevamento vulnerabilità), superando Mythos 5 (83,8%) e GPT 5.6 Sol (83,6%).
GLM 5.3 ottiene l'84,5% su CyberGym (rilevamento vulnerabilità), superando Mythos 5 (83,8%) e GPT 5.6 Sol (83,6%). Su ExploitBench (generazione di exploit funzionanti) il divario è enorme: 54,4% per GLM 5.3 contro 78,0% per Mythos 5.
Z.ai ha rinviato di almeno due settimane il rilascio dei pesi aperti, in attesa di una valutazione di sicurezza.