Ответ Тан Цзе растянутым «sooooooon» оказался почти буквальным: по сообщениям, Zhipu выпустила GLM-5.3 всего через несколько часов после этой реплики.
12
Но примечательным был не только стремительный релиз. Новую модель представили прежде всего как инструмент для программирования, длительных агентных задач и кибербезопасности. При этом её базовая модель сохранила примерно те же 743 млрд параметров, что и GLM-5.2. По версии Zhipu, основной прирост обеспечило расширенное постобучение, а не новый масштабный этап предварительного обучения.
1
4
20
Больше возможностей на той же базе
Релиз GLM-5.3 сделал постобучение центральной частью своей технической истории. Это особенно интересно на фоне индустрии, где улучшение результатов часто связывают с увеличением числа параметров или созданием новой базовой модели.
В опубликованных Zhipu сравнениях наиболее заметный прогресс пришёлся на сложные задачи, требующие работы с инструментами и многошагового выполнения:
- SWE-Marathon: с 19,4 до 42,5;
- FrontierSWE: с 67,5 до 78,1;
- Terminal-Bench 3.0: с 4,6 до 28,3;
- DeepSWE v1.1: с 46,2 до 66,9.
Эти показатели основаны на сравнениях, опубликованных Zhipu, и вторичных анализах её результатов.
1
3
6
7
Особенно эффектно выглядит скачок в Terminal-Bench в пересчёте на процентные пункты. Однако большой прирост с низкой стартовой отметки ещё не означает, что модель стала лучшей во всех инженерных сценариях. Например, результат 42,5 в SWE-Marathon всё ещё уступал показателям Kimi K3 и Opus 4.8 в приведённой таблице.
6
9
Главный заголовок — результат CyberGym
Самой заметной цифрой GLM-5.3 стал результат 84,5 в CyberGym — тесте, который проверяет способность находить и подтверждать уязвимости в исходном коде. В сравнении Zhipu этот показатель оказался немного выше результатов Mythos 5 — 83,8 — и GPT-5.6 Sol — 83,6.
2
5
6
CyberGym проверяет не просто умение предложить более безопасный фрагмент кода. Задача включает поиск слабого места, построение атаки и проверку её последствий. То есть модель должна рассуждать скорее как специалист по поиску уязвимостей, чем как обычный генератор кода.
12
17
Именно поэтому результат привлёк внимание профильных изданий о кибербезопасности. The Register передал заявление Zhipu о том, что улучшения коснулись не только обнаружения отдельных ошибок: модель стала лучше рассуждать по нескольким этапам цепочки эксплуатации.
17
При этом слово «лидер» требует оговорки. Доступные сравнения в основном основаны на данных, представленных поставщиком, а масштабной независимой проверки пока нет.
2
4
6
Тестирование на реальном коде
Помимо CyberGym, Zhipu, по сообщениям, рассказала о совместной работе с командами по безопасности и проверке моделей на реальных кодовых базах. В опубликованном компанией реестре указаны 2 436 находок безопасности в 269 проектах с открытым исходным кодом, включая 1 097 уязвимостей критического или высокого уровня. Также сообщалось, что самая старая находка относилась к 1981 году, а в среднем уязвимости оставались незамеченными 26,6 года.
21
31
Эти цифры показывают, какой рабочий процесс Zhipu связывает с GLM-5.3, но их не следует воспринимать как результат независимого аудита. Предоставленные материалы приписывают статистику самой Zhipu, а большая часть доступных данных о тестах по-прежнему основана на раскрытиях компании.
Модель рассчитана на агентную работу
Zhipu продвигала GLM-5.3 не только как систему для генерации отдельных фрагментов программного кода. Её целевая аудитория — длительно работающие агенты, способные пользоваться инструментами, выполнять команды в терминале и проходить через несколько этапов инженерной задачи.
Среди заявленных результатов — 73,0 в Toolathlon Verified против 59,9 у GLM-5.2 и 48,2 в AutomationBench против 26,2. В других опубликованных сравнениях указано 28,5 в Agents’ Last Exam.
1
7
11
Практический смысл этих тестов в том, что преимущество модели должно заключаться не только в создании правдоподобного кода. В идеале она умеет последовательно работать с репозиторием, терминалом и внешними инструментами. Но надёжность в реальной разработке по-прежнему зависит от прав доступа, покрытия тестами, человеческой проверки и того, как часто модель ошибается именно на конкретной кодовой базе.
Что действительно показывают эти цифры
Наиболее осторожный вывод звучит так: Zhipu сообщила о значительном росте GLM-5.3 по сравнению с GLM-5.2 сразу в нескольких тестах на программирование и агентную работу. Кроме того, в опубликованных компанией сравнительных таблицах модель показала лидирующий результат в CyberGym.
2
5
6
Однако это не доказывает, что GLM-5.3 стабильно превосходит все передовые модели в программировании, рассуждениях, безопасности и универсальных задачах. На отдельных инженерных тестах конкуренты по-прежнему опережали её, а широкого независимого воспроизведения результатов пока нет.
6
9
Главный вывод связан скорее с подходом, чем с одним рекордным числом. GLM-5.3 показывает, как масштабное постобучение может раскрыть специализированные возможности уже существующей большой модели. Если независимые проверки подтвердят заявленный рост, инвестиции в постобучение и тестирование на реальных сценариях разработки и безопасности могут оказаться не менее важными, чем простое сравнение количества параметров.