| Benchmark | GLM-5.3 | GLM-5.2 (poprzednik) |
|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE v1.1 | 66,9 | 46,2 |
| Agents' Last Exam (CLI) | 28,5 | 23,8 |
| Wewnętrzny benchmark kodowania Z.ai | ~50% poprawy | poziom wyjściowy |
Wszystkie ulepszenia wynikają wyłącznie z treningu na wyższych poziomach; podstawowy model 743B nie został przebudowany . Warto zaznaczyć, że Mythos 5 uzyskuje 80,3% w SWE-bench Pro (agentowym benchmarku kodowania), jednak bezpośrednie porównanie na tych samych testach nie jest możliwe
.
GLM-5.3 może pochwalić się wąskim prowadzeniem nad Mythos 5 w wykrywaniu podatności (84,5% vs 83,8% na CyberGym), jednak znacząco odstaje w generowaniu exploitów (54,4% vs 78,0% na ExploitBench). Jego publikacja otwartych wag jest opóźniona ze względów bezpieczeństwa, a poprzednik GLM-5.2 został oceniony jako praktycznie nieodrzucający instrukcji cyberataku. Tymczasem Mythos 5 pozostaje znacznie bardziej ograniczony – nigdy publicznie niedostępny, udostępniony zaledwie około 200 partnerom – ale też znacznie bardziej zdolny do najniebezpieczniejszego zadania: tworzenia działających exploitów. Szersza implikacja jest taka, że modele open-weight szybko zamykają lukę w możliwościach względem ograniczonych modeli w zadaniach cybernetycznych, podczas gdy zabezpieczenia pozostają znacznie słabsze. Chińska niepewność regulacyjna dotycząca eksportu najlepszych modeli AI dodaje kolejną warstwę złożoności do kwestii, czy wagi GLM-5.3 będą kiedykolwiek tak swobodnie dostępne, jak sugeruje marketing Z.ai .