| Benchmark | GLM-5.3 | GLM-5.2 (génération précédente) |
|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE v1.1 | 66,9 | 46,2 |
| Agents' Last Exam (CLI) | 28,5 | 23,8 |
| Z.ai Internal Code Bench | ~50 % d'amélioration | référence |
Note : Mythos 5 obtient 80,3 % sur SWE-bench Pro (codage agentique), mais les comparaisons directes avec ces benchmarks spécifiques ne sont pas disponibles pour les deux modèles . Tous les progrès de GLM-5.3 proviennent uniquement du post-entraînement, le modèle de base de 743B paramètres n'ayant pas été ré-entraîné
.
GLM-5.3 revendique une très légère avance sur Mythos 5 dans la détection de vulnérabilités (84,5 % contre 83,8 % sur CyberGym), mais est nettement distancé sur l'exploitation (54,4 % contre 78,0 % sur ExploitBench). La sortie de ses poids ouverts est retardée pour un examen de sécurité, et son prédécesseur GLM-5.2 a été évalué comme ayant un taux de refus quasi nul face aux instructions de cyberattaque. Mythos 5 reste infiniment plus verrouillé – jamais mis à disposition du public, limité à environ 200 partenaires de confiance – mais aussi bien plus performant dans la tâche offensive la plus risquée : générer des exploits fonctionnels. La leçon plus large est que les modèles ouverts réduisent rapidement l'écart de capacités avec les modèles restreints de pointe dans le domaine cyber, tandis que les mécanismes de sécurité restent considérablement plus faibles. L'incertitude réglementaire chinoise quant à l'exportation des meilleurs modèles d'IA ajoute une couche de complexité supplémentaire à la question de savoir si les poids de GLM-5.3 seront un jour aussi librement disponibles que le marketing de Z.ai le suggère.