Obraz zmienia się diametralnie na ExploitBench, który wymaga głębszego rozumowania – model musi nie tylko znaleźć lukę, ale też wykazać, jak można ją faktycznie wykorzystać, i dostarczyć działający exploit. GLM-5.3 ponad dwukrotnie poprawił wynik poprzednika, skacząc z 24,4% na 54,4% . Jednak Z.ai podaje, że Mythos 5 uzyskuje na ExploitBench 78%, a GPT-5.6 Sol 76,5% – co oznacza, że chiński model wciąż wyraźnie odstaje od rywali w tym trudniejszym pomiarze
.
Z kolei na ExploitGym, który zlicza, ile zadań eksploatacyjnych model jest w stanie ukończyć w ramach znormalizowanego dwugodzinnego budżetu, GLM-5.3 wykonuje 105 zadań (wobec 29 dla GLM-5.2) . Przy budżecie sześciogodzinnym wynik rośnie do 130 zadań
.
| Benchmark | Co mierzy | GLM-5.3 | Anthropic Mythos 5 | OpenAI GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | Wykrywanie i potwierdzanie podatności z kodu źródłowego (white-box) | 84,5% | 83,8% | 83,6% |
| ExploitBench | Głębokie rozumowanie przyczyn i dostarczenie działającego exploit’a | 54,4% | 78% | 76,5% |
| ExploitGym (budżet 2 godz.) | Liczba ukończonych zadań eksploatacyjnych w znormalizowanym budżecie | 105 zadań | Brak danych | Brak danych |
Poza testami GLM-5.3 został wdrożony w rzeczywistych testach bezpieczeństwa, przynosząc imponujące rezultaty:
GLM-5.3 notuje także silne wyniki w testach kodowania i agentowych, pozycjonując się jako wiodący model z otwartymi wagami do zadań inżynierii oprogramowania:
Z.ai przyznaje, że zdolności cybernetyczne modelu „rosły szybciej niż przewidywano” w trakcie post-treningu . Podstawowe 740 miliardów parametrów modelu nie było przetrenowywane – cały postęp pochodzi z ulepszeń w fazie post-treningu
. Ponieważ zdolność ta pojawiła się niespodziewanie, firma wstrzymuje publikację otwartych wag o dwa tygodnie, aby wzmocnić mechanizmy bezpieczeństwa
. Model jest już dostępny za pośrednictwem API Z.ai oraz integracji z ZCode, Claude Code i OpenCode
.