| Benchmark | GLM-5.3 | GLM-5.2 (forrige generation) |
|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE v1.1 | 66,9 | 46,2 |
| Agents' Last Exam (CLI) | 28,5 | 23,8 |
| Z.ai Internal Code Bench | ~50 % forbedring | baseline |
Bemærk: Mythos 5 scorer 80,3 % på SWE-bench Pro (agentisk kodning), men direkte sammenligninger på disse specifikke benchmarks er ikke tilgængelige på tværs af begge modeller . Alle GLM-5.3's gevinster kom udelukkende fra udvidet post-træning — basismodellen på 743B parametre blev ikke genoptrænet
.
GLM-5.3 hævder en snæver føring over Mythos 5 på sårbarhedsdetektion (84,5 % mod 83,8 % på CyberGym), men halter betydeligt bagefter på udnyttelse (54,4 % mod 78,0 % på ExploitBench). Dets open-weight-udgivelse er forsinket af sikkerhedshensyn, og dets forgænger GLM-5.2 blev vurderet til at have næsten nul afvisning af cyberangrebsinstruktioner. Mythos 5 forbliver langt mere begrænset — aldrig offentligt tilgængelig, begrænset til cirka 200 godkendte partnere — men også langt mere kapabel til den farligste offensive opgave: at generere fungerende angreb. Den bredere implikation er, at open-weight-modeller hurtigt lukker kapacitetsgabet til frontier-begrænsede modeller på cyberopgaver, mens sikkerhedsforanstaltningerne forbliver væsentligt svagere. Kinesisk reguleringsusikkerhed omkring eksport af top-AI-modeller tilføjer endnu et lag af kompleksitet til, om GLM-5.3's vægte nogensinde vil være så frit tilgængelige, som Z.ai's markedsføring antyder.