| Penanda Aras | GLM-5.3 | GLM-5.2 (generasi sebelumnya) |
|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 |
| DeepSWE v1.1 | 66.9 | 46.2 |
| Ujian Terakhir Ejen (CLI) | 28.5 | 23.8 |
| Penanda Aras Kod Dalaman Z.ai | ~50% peningkatan | garis dasar |
Nota: Mythos 5 mendapat 80.3% pada SWE-bench Pro (pengekodan agen), tetapi perbandingan langsung pada penanda aras khusus ini tidak tersedia antara kedua-dua model . Semua peningkatan GLM-5.3 datang daripada latihan pasca yang diperluas sahaja — model asas 743B tidak dilatih semula
.
GLM-5.3 mendakwa mendahului tipis berbanding Mythos 5 dalam pengesanan kelemahan (84.5% berbanding 83.8% pada CyberGym), tetapi jauh ketinggalan dalam eksploitasi (54.4% berbanding 78.0% pada ExploitBench). Pelepasan pemberat terbukanya ditangguhkan untuk semakan keselamatan, dan pendahulunya GLM-5.2 dinilai sebagai mempunyai kadar penolakan hampir sifar untuk arahan serangan siber. Mythos 5 kekal jauh lebih terhadap — tidak pernah tersedia secara umum, terhad kepada ~200 rakan kongsi yang disaring — tetapi juga jauh lebih berkemampuan dalam tugas ofensif paling berbahaya: menjana eksploitasi berfungsi. Implikasi yang lebih luas ialah model pemberat terbuka dengan pantas menutup jurang keupayaan dengan model terhadap di peringkat hadapan dalam tugas siber, sementara perlindungan keselamatan kekal lebih lemah secara substansial. Ketidakpastian kawal selia China tentang mengeksport model AI terbaik menambah satu lagi lapisan kerumitan sama ada pemberat GLM-5.3 akan pernah tersedia secara bebas seperti yang dicadangkan oleh pemasaran Z.ai.