| ExploitBench | 24,4% | 54,4% | Результат более чем вдвое выше показателя GLM-5.2 |
Эти числа следует воспринимать как заявленные результаты, требующие независимой проверки: детальное сравнение опубликовано в посте стороннего автора в X, тогда как официальные материалы подтверждают общую картину улучшений, но не приводят в представленном отрывке все значения таблицы.
Рост с 4,6% до 28,3% в Terminal-Bench 3.0 — самый заметный скачок в приведённом сравнении. Тест особенно важен для кодинговых агентов, поскольку проверяет работу в командной строке. Модели приходится анализировать состояние среды, вызывать инструменты, вносить изменения и последовательно продвигаться к результату, а не просто выдавать один фрагмент кода.
По имеющимся данным, GLM-5.3 значительно сильнее GLM-5.2 именно в этом тесте. Однако такой результат сам по себе не доказывает, что новая модель будет лучше на любом реальном репозитории или в каждом рабочем процессе разработки.
Z.ai делает акцент на задачах, которые требуют длительного удержания контекста: от составления плана и реализации до отладки, проверки и повторных итераций. Контекстное окно на 1 млн токенов должно быть полезно при работе с большими проектами, множеством файлов и продолжительными цепочками действий.
Компания также заявляет о результатах уровня SOTA среди открытых моделей в Terminal-Bench 3.0 и Agents’ Last Exam (CLI), а в собственном Code Bench — о преимуществе на 50% над GLM-5.2.
На практике это означает, что GLM-5.3 рассчитана на более продолжительную работу с проектом, а не только на ответы в формате «запрос — код». Но бенчмарки не показывают автоматически надёжность, стоимость, задержку ответа или качество выполнения инструментальных команд в конкретной среде. Перед переходом с GLM-5.2 разработчикам стоит проверить модель на собственных репозиториях и типичных сценариях.
Z.ai сообщает, что GLM-5.3 показала лучший для компании результат в тесте CyberGym, который оценивает поиск уязвимостей. Также Z.ai утверждает, что способность модели эксплуатировать уязвимости превысила результат GLM-5.2 более чем вдвое.
Сторонняя сравнительная таблица указывает на рост CyberGym с 77,2% до 84,5%, а ExploitBench — с 24,4% до 54,4%. Точные значения не подтверждены независимыми измерениями в представленном наборе официальных материалов, поэтому их корректнее считать заявленными результатами запуска, а не окончательными отраслевыми показателями.
Для специалистов по безопасности это двоякий сигнал. С одной стороны, более способная модель может помогать искать и анализировать уязвимости в защитных целях. С другой — рост возможностей по обнаружению и эксплуатации ошибок повышает риски злоупотреблений. Перед широким внедрением потребуются дополнительные проверки безопасности и подходящие ограничения доступа.
По версии Z.ai, основной причиной улучшений стало масштабирование post-training — дополнительного обучения модели после базовой подготовки. Компания расширила набор задач и обучающих сред, чтобы они больше напоминали реальные многодневные процессы разработки и исследований, а не короткие изолированные упражнения по программированию.
Иными словами, Z.ai связывает результат прежде всего с изменением процесса обучения и самих сред, а не просто с увеличением контекстного окна. Такой подход объясняет, почему наиболее заметный рост наблюдается в долгих агентных тестах: модель обучали планировать, пользоваться инструментами, восстанавливаться после ошибок и продолжать работу через несколько последовательных этапов.
Это объяснение остаётся версией самой Z.ai. Чтобы понять, насколько прирост переносится на другие проекты, промпты, агентские оболочки и наборы инструментов, потребуются независимые испытания.
Модель доступна в тарифах GLM Coding Plan — Max, Pro и Lite — и поддерживается в среде разработки ZCode.
На момент описания открытые веса ещё не были представлены в доступных источниках. Сторонний отчёт сообщал, что Z.ai рассчитывает выпустить их примерно через две недели после запуска 14 августа 2026 года, после дополнительной проверки безопасности. Это указывает на конец августа 2026 года, но срок остаётся предварительным и не должен восприниматься как подтверждённая дата.
Для разработчиков здесь важна разница между доступом и воспроизводимостью. Попробовать GLM-5.3 уже можно через продукты Z.ai, но полностью повторить опубликованные результаты локально пока нельзя с помощью весов, описанных в представленных источниках.
GLM-5.3 выглядит целевым обновлением для кодинговых агентов, а не простой сменой номера версии. Z.ai заявляет о приросте на 50% в собственном Code Bench, более сильной работе в долгих агентных сценариях и заметном улучшении показателей кибербезопасности по сравнению с GLM-5.2.
Главная оговорка касается доказательности. Официальная документация подтверждает направление улучшений, но точные публичные сравнения и ориентир по срокам выхода весов основаны на сторонних сообщениях и ещё требуют независимой проверки. Пока разумнее считать GLM-5.3 многообещающим обновлением, доступным через продукты Z.ai, но ещё не полностью воспроизводимой открытой моделью.