Z.ais åpne GLM 5.3 modell oppnår 84,5% på CyberGym – et marginalt forsprang foran Anthropics Mythos 5 (83,8%) og OpenAI GPT 5.6 Sol (83,6%) i sårbarhetsdeteksjon [4][7][12]. På ExploitBench, som måler evnen til å utvikle fungerende utnyttelseskode, får GLM 5.3 bare 54,4% – et betydelig etterslep sammenlignet med Myt...
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Chinese AI startup Z.ai's open source GLM 5.3 model compare to Anthropic's restricted Mythos 5 model in cybersecurity vulnerability. Article summary: GLM-5.3 claims a narrow lead over Mythos 5 on vulnerability *detection* (84.5% vs 83.8% on CyberGym), but trails significantly on *exploitation* (54.4% vs 78.0% on ExploitBench). Its open-weight release is delayed for sa. Topic tags: general web, ai safety, openai, llm, agents. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Den 14. august 2026 lanserte Z.ai GLM-5.3, en åpen modell basert på 743B parametere. Modellen oppnår toppresultater på CyberGym (84,5%), et referansepunkt for sårbarhetsdeteksjon, og slår dermed Anthropics begrensede Mythos 5 (83,8%) og OpenAIs GPT-5.6 Sol (83,6%) . Men GLM-5.3 ligger et godt stykke bak Mythos 5 når det gjelder å utvikle faktiske utnyttelsesmetoder (54,4% mot 78,0% på ExploitBench), og utgivelsen av åpne vekter er utsatt i påvente av en sikkerhetsgjennomgang
. Sammenligningen tegner et nyansert bilde: en smal ledelse i deteksjon, men klare hull i utnyttelse, tilgangskontroll, sikkerhetsprofil og regulatorisk kontekst.
| Referansepunkt | GLM-5.3 | GLM-5.2 (forrige generasjon) |
|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE v1.1 | 66,9 | 46,2 |
| Agents' Last Exam (CLI) | 28,5 | 23,8 |
| Z.ai Internal Code Bench | ~50% forbedring | grunnlinje |
Merk: Mythos 5 scorer 80,3% på SWE-bench Pro (agentisk koding), men direkte sammenligninger på disse spesifikke referansepunktene er ikke tilgjengelige på tvers av begge modellene . Alle GLM-5.3s forbedringer kom kun fra utvidet ettertrening – basismodellen på 743B parametere ble ikke trent på nytt
.
GLM-5.3 hevder et smalt forsprang foran Mythos 5 på sårbarhetsdeteksjon (84,5% mot 83,8% på CyberGym), men ligger betydelig etter på utnyttelse (54,4% mot 78,0% på ExploitBench). Utgivelsen av åpne vekter er forsinket for sikkerhetsgjennomgang, og forgjengeren GLM-5.2 ble vurdert til å ha nesten null avvisning av cyberangrepsinstruksjoner. Mythos 5 forblir langt mer begrenset – aldri offentlig tilgjengelig, begrenset til omtrent 200 vurderte partnere – men også langt mer dyktig på den farligste offensive oppgaven: å generere fungerende utnyttelseskode. Den bredere implikasjonen er at åpne modeller raskt tette kapasitetsgapet til frontlinjebegrensede modeller på cyberoppgaver, samtidig som sikkerhetstiltakene forblir betydelig svakere. Kinesisk regulatorisk usikkerhet rundt eksport av topp KI-modeller legger enda et lag med kompleksitet til hvorvidt GLM-5.3s vekter noen gang vil være så fritt tilgjengelige som Z.ais markedsføring antyder.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Z.ais åpne GLM 5.3 modell oppnår 84,5% på CyberGym – et marginalt forsprang foran Anthropics Mythos 5 (83,8%) og OpenAI GPT 5.6 Sol (83,6%) i sårbarhetsdeteksjon [4][7][12].
Z.ais åpne GLM 5.3 modell oppnår 84,5% på CyberGym – et marginalt forsprang foran Anthropics Mythos 5 (83,8%) og OpenAI GPT 5.6 Sol (83,6%) i sårbarhetsdeteksjon [4][7][12]. På ExploitBench, som måler evnen til å utvikle fungerende utnyttelseskode, får GLM 5.3 bare 54,4% – et betydelig etterslep sammenlignet med Mythos 5 (78,0%) og GPT 5.6 Sol (76,5%) [3][4][12].
Nedlastbare vekter for GLM 5.3 er forsinket i minst to uker på grunn av sikkerhetsgjennomgang, i motsetning til forgjengeren GLM 5.2 som ble fullt utgitt [3][12][15].