Відповідь головного науковця Zhipu AI Тан Цзе із розтягнутим «sooooooon» виявилася майже буквальним анонсом: за повідомленнями, компанія випустила GLM-5.3 уже за кілька годин.
12
Однак головна новина — не швидкість релізу. GLM-5.3 позиціонують як модель насамперед для програмування, автономних програмних агентів і кібербезпеки. Її технічна особливість полягає в тому, що базова модель залишилася приблизно такою самою — близько 743 млрд параметрів, як у GLM-5.2. Zhipu пояснює заявлений приріст переважно масштабнішим посттренуванням, а не новим, більшим циклом попереднього навчання.
1
4
20
Більше можливостей на тій самій базі
Реліз GLM-5.3 фактично зробив посттренування центральною частиною історії про покращення моделі. Це важливо для індустрії, де стрибок результатів часто пов’язують зі збільшенням моделей або повним перенавчанням базової системи.
У власних порівняннях Zhipu найвиразніший прогрес показала на складних завданнях, де модель має не просто написати фрагмент коду, а працювати з інструментами й виконувати довгу послідовність дій:
- SWE-Marathon: з 19,4 до 42,5;
- FrontierSWE: з 67,5 до 78,1;
- Terminal-Bench 3.0: з 4,6 до 28,3;
- DeepSWE v1.1: з 46,2 до 66,9.
Ці показники походять із опублікованих Zhipu порівнянь і вторинних аналізів результатів.
1
3
6
7
Результат Terminal-Bench особливо помітний у перерахунку на процентні пункти. Водночас великий приріст із низької стартової позиції ще не означає, що модель стала найкращою в кожній задачі програмної інженерії. Наприклад, показник 42,5 у SWE-Marathon, за наведеними порівняннями, все ще поступався Kimi K3 та Opus 4.8.
6
9
CyberGym став головною цифрою релізу
Найбільше уваги привернув результат 84,5 у CyberGym — тесті, що перевіряє здатність знаходити й підтверджувати вразливості у вихідному коді. У порівняльній таблиці Zhipu цей показник був трохи вищим за результати Mythos 5 — 83,8 — і GPT-5.6 Sol — 83,6.
2
5
6
CyberGym — це не звичайна перевірка того, чи може модель запропонувати безпечніший код. Завдання передбачає пошук слабких місць, побудову атак і перевірку їхніх наслідків. Тобто воно ближче до виявлення вразливостей і міркування над повним ланцюгом експлуатації, ніж до стандартного автодоповнення коду.
12
17
Саме ця різниця пояснює інтерес профільних видань із кібербезпеки. The Register навело заяву Zhipu, що прогрес моделі полягає не лише у виявленні окремих помилок: вона нібито краще міркує через кілька етапів ланцюга експлуатації.
17
Але слово «лідер» потребує контексту. Доступні огляди прямо описують ці порівняння як результати, заявлені виробником, і зазначають, що масштабної незалежної реплікації поки немає.
2
4
6
Тестування на реальному коді: що заявила компанія
Окрім CyberGym, Zhipu повідомила про співпрацю з командами безпеки, які тестували моделі на реальних кодових базах. За оприлюдненим компанією реєстром, було виявлено 2 436 проблем безпеки у 269 проєктах із відкритим кодом, зокрема 1 097 вразливостей критичного або високого рівня. Також повідомлялося, що найстаріша знахідка датується 1981 роком, а вразливості залишалися невиявленими в середньому 26,6 року.
21
31
Ці цифри показують, із яким сценарієм використання Zhipu хоче пов’язати GLM-5.3: не лише написанням коду, а й системним аудитом безпеки. Проте їх не слід сприймати як незалежно перевірені вимірювання. Надані матеріали приписують ці дані самій Zhipu, а ширша картина результатів також переважно ґрунтується на розкритті інформації компанією.
Модель розрахована на агентів, а не тільки на чат
Позиціонування GLM-5.3 виходить за межі автономного написання програм. Zhipu просуває її для довготривалих агентів, які можуть користуватися інструментами, працювати в терміналі та виконувати багатокрокові інженерні завдання.
Серед заявлених результатів — 73,0 у Toolathlon Verified проти 59,9 у GLM-5.2 і 48,2 в AutomationBench проти 26,2.
1
7 В інших опублікованих порівняннях також наведено 28,5 у Agents’ Last Exam.
11
Практичний сенс цих тестів такий: потенційна перевага моделі полягає не просто у створенні правдоподібного фрагмента коду, а у виконанні цілої серії дій у репозиторії, терміналі чи середовищі інструментів. Чи перетвориться це на стабільну роботу в реальних продуктивних системах, залежатиме від дозволів інструментів, покриття тестами, процесів перевірки та частоти помилок на конкретній кодовій базі.
Що насправді доводить цей реліз
Найсильніший висновок із доступних даних скромніший за твердження «GLM-5.3 перевершує всі передові моделі». Результати Zhipu вказують на значний заявлений стрибок порівняно з GLM-5.2 у кількох тестах програмування та агентної роботи, а також на найвищий показник CyberGym у порівняльних таблицях, опублікованих Zhipu та відтворених у матеріалах про реліз.
2
5
6
Водночас вони не доводять, що GLM-5.3 стабільно краща за конкурентів у всіх завданнях програмування, міркування, безпеки чи загального призначення. На окремих тестах програмування попереду залишалися інші моделі, а доступні результати ще не пройшли масштабної незалежної перевірки.
6
9
Найважливіший урок релізу — методологічний. GLM-5.3 демонструє посттренування як спосіб розкрити спеціалізовані можливості вже наявної великої бази. Якщо незалежні тести підтвердять ці результати, інвестиції в посттренування та ретельна перевірка на реальних програмних і безпекових сценаріях можуть виявитися не менш важливими, ніж просте порівняння кількості параметрів.