Le tableau est tout autre sur ExploitBench, un test qui exige un raisonnement plus profond sur la manière dont une vulnérabilité pourrait être exploitée concrètement, jusqu'à la production d'une preuve de concept fonctionnelle. GLM-5.3 a plus que doublé le score de son prédécesseur, passant de 24,4 % à 54,4 % . Cependant, Z.ai indique que Mythos 5 obtient 78 % sur ExploitBench et GPT-5.6 Sol 76,5 % — laissant GLM-5.3 loin derrière sur cette mesure plus difficile
.
Sur ExploitGym, qui comptabilise le nombre de tâches d'exploitation qu'un modèle peut accomplir dans un budget de deux heures normalisé, GLM-5.3 réalise 105 tâches (contre 29 pour GLM-5.2) . Dans un budget de six heures, ce nombre passe à 130 tâches
.
| Benchmark | Ce qu'il mesure | GLM-5.3 | Anthropic Mythos 5 | OpenAI GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | Découverte et validation de vulnérabilités à partir de code source | 84,5 % | 83,8 % | 83,6 % |
| ExploitBench | Raisonnement causal et production d'une preuve d'exploitation fonctionnelle | 54,4 % | 78 % | 76,5 % |
| ExploitGym (budget 2h) | Nombre de tâches d'exploitation achevées sous budget normalisé | 105 tâches | Non communiqué | Non communiqué |
Au-delà des benchmarks, GLM-5.3 a été déployé dans des tests de sécurité réels avec des résultats impressionnants :
GLM-5.3 affiche également des scores solides sur les benchmarks de codage et d'agents, ce qui en fait un modèle open-weight de premier plan pour les tâches de génie logiciel :
Z.ai explique que la capacité du modèle en cybersécurité a « grandi plus vite que prévu » durant la phase de post-entraînement . Les 740 milliards de paramètres du modèle de base n'ont pas été ré-entraînés — toutes les améliorations proviennent de techniques de post-entraînement
. Cette capacité étant apparue de manière inattendue, l'entreprise retient la publication des poids ouverts pendant deux semaines afin de renforcer les contrôles de sécurité
. Le modèle est d'ores et déjà disponible via l'API de Z.ai et via des intégrations avec ZCode, Claude Code et OpenCode
.