GLM-5.3s mest omtalte resultat er på CyberGym, en benchmark fra UC Berkeleys Responsible AI Development Initiative som tester om en modell kan identifisere og validere kjente sårbarheter i åpen kildekode . Der scorer GLM-5.3 84,5 %, marginalt foran Anthropics Mythos 5 (83,8 %) og OpenAIs GPT-5.6 Sol (83,6 %)
.
Bildet endrer seg på ExploitBench, som krever at modellen ikke bare finner sårbarheter, men også viser hvordan de kan utnyttes. GLM-5.3 mer enn doblet sin egen poengsum sammenlignet med forrige versjon, fra 24,4 % til 54,4 % . Men Z.ai oppgir at Mythos 5 scorer 78 % og GPT-5.6 Sol 76,5 % på denne testen – GLM-5.3 ligger altså langt bak
.
På ExploitGym, som teller hvor mange utnyttelsesoppgaver en modell fullfører innenfor et normalisert to-timers budsjett, fullfører GLM-5.3 105 oppgaver (opp fra 29 for GLM-5.2) . Innenfor et seks-timers budsjett stiger tallet til 130
.
| Benchmark | Hva måles? | GLM-5.3 | Anthropic Mythos 5 | OpenAI GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | Oppdage og validere sårbarheter fra åpen kildekode | 84,5 % | 83,8 % | 83,6 % |
| ExploitBench | Dypere analyse og levering av fungerende utnyttelse | 54,4 % | 78 % | 76,5 % |
| ExploitGym (2-timers budsjett) | Fullførte utnyttelsesoppgaver | 105 oppgaver | Ikke offentliggjort | Ikke offentliggjort |
I tillegg til benchmark-tester har GLM-5.3 blitt brukt i ekte sikkerhetstesting med imponerende resultater:
GLM-5.3 leverer også sterke tall på kode- og agent-benchmarks, og posisjonerer seg som en ledende åpen vekt-modell for programvareutvikling:
Z.ai sier modellens evne til cybersikkerhet "vokste raskere enn forventet" under opptreningen . Grunnmodellens 740 milliarder parametere ble ikke trent på nytt – alle forbedringene kom fra post-trening
. Ettersom evnen var en uventet oppdagelse, holder selskapet tilbake den åpne utgivelsen i to uker for å styrke sikkerhetstiltak
. Modellen er allerede tilgjengelig via Z.ai API og gjennom integrasjoner med ZCode, Claude Code og OpenCode
.