| Бенчмарк | GLM-5.3 | GLM-5.2 (попереднє покоління) |
|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE v1.1 | 66,9 | 46,2 |
| Agents' Last Exam (CLI) | 28,5 | 23,8 |
| Z.ai Internal Code Bench | ~50% покращення | база |
Примітка: Mythos 5 набирає 80,3% на SWE-bench Pro (агентне кодування), але прямі порівняння за цими бенчмарками відсутні . Усі покращення GLM-5.3 отримані виключно завдяки розширеному пост-тренуванню — базова модель на 743B параметрів не перенавчалася
.
GLM-5.3 заявляє про невелику перевагу над Mythos 5 у виявленні вразливостей (84,5% проти 83,8% на CyberGym), але значно відстає у розробці експлойтів (54,4% проти 78,0% на ExploitBench). Випуск її відкритих ваг відкладено для перевірки безпеки, а її попередник GLM-5.2 був оцінений як такий, що має майже нульовий рівень відмови від інструкцій з кібератак. Mythos 5 залишається набагато більш обмеженою — ніколи не була загальнодоступною, доступна лише для ~200 перевірених партнерів — але також набагато більш здатною до найнебезпечнішого наступального завдання: генерації робочих експлойтів. Загальний висновок полягає в тому, що моделі з відкритими вагами швидко скорочують розрив у можливостях з передовими обмеженими моделями в кіберзавданнях, при цьому безпекові заходи залишаються значно слабшими. Регуляторна невизначеність у Китаї щодо експорту топових ШІ-моделей додає додатковий рівень складності питанню про те, чи будуть ваги GLM-5.3 колись настільки ж вільно доступними, як рекламує Z.ai.