Terminal-Bench 3.0 важен для оценки так называемого агентного программирования: он проверяет работу модели с терминалом и оболочкой, а не только способность выдавать статичный ответ. DeepSWE 1.1 ориентирован на более полноценные инженерные сценарии разработки. Поэтому результаты GLM-5.3 указывают прежде всего на улучшение в цепочках действий, а не просто на более качественное автодополнение кода.
Zhipu также заявила, что результат 28,3 был лучшим среди моделей с открытым исходным кодом на момент анонса и опережал Kimi K3 от Moonshot AI. Однако такое сравнение следует воспринимать как позицию самой компании: результаты могут зависеть от версии теста, формулировок запросов, используемых инструментов и условий доступа к каждой модели.
GLM-5.3 задумывалась не только как чат-бот для ответа на вопросы разработчика. Zhipu описывает её как систему, способную работать с программным обеспечением, вызывать инструменты и выполнять длинные последовательности действий с меньшим участием человека.
Разница между двумя подходами принципиальна. Обычный помощник может предложить функцию или объяснить сообщение об ошибке. Агент должен самостоятельно осмотреть проект, выполнить команды, проверить логи, изменить файлы, повторить неудачный шаг и довести задачу до результата.
Именно с таким сценарием согласуются заметные улучшения на Terminal-Bench и DeepSWE. Но высокий балл в бенчмарке ещё не доказывает, что система будет надёжно работать в незнакомой промышленной среде: там появляются нестандартные конфигурации, неполные требования, ограничения доступа и риск повредить рабочие данные.
Zhipu утверждает, что возможности GLM-5.3 в программировании и агентных сценариях приближаются к Claude Fable 5, а в практических задачах разработки модель превосходит другие китайские решения. Это заявления о позиционировании продукта, а не окончательный независимый рейтинг.
В анонсе GLM-5.3 отдельное место занимает кибербезопасность. Разработчик связывает улучшенное рассуждение и работу с инструментами с возможностью находить уязвимости в программном обеспечении. В открыто опубликованных материалах упоминается результат 84,5% в CyberGym — оценке задач по обнаружению и проверке уязвимостей.
У этой способности двойное назначение. Те же навыки, которые могут помочь специалистам по защите находить слабые места, способны сделать опасное автономное поведение более серьёзной проблемой. Поэтому корректнее говорить о заявленной возможности обнаружения уязвимостей, а не о доказанной надёжности GLM-5.3 в роли аудитора безопасности или о способности безопасно проводить автономные атаки.
Главный вывод из релиза — не само число в 743 млрд параметров, а акцент на постобучении и тестах, где модель должна удерживать цель на протяжении многих шагов.
Тем, кто рассматривает GLM-5.3 для практического использования, стоит проверить несколько вещей:
GLM-5.3 — это модель на 743 млрд параметров, которую Zhipu AI представляет как существенный шаг вперёд без увеличения базовой основы. По данным компании, основные улучшения получены за счёт постобучения. Рост на Terminal-Bench 3.0 с 4,6 до 28,3 и на DeepSWE 1.1 с 46,2 до 66,9 формирует ясную стратегию релиза: сделать открытые модели более полезными для длительных задач программирования и агентной работы.
Результаты заслуживают дальнейшего внимания, особенно со стороны команд, которые экспериментируют с открытыми моделями и автоматизацией разработки. Но между сильным показателем в тесте и надёжным автономным агентом остаётся существенная дистанция. Её смогут подтвердить только независимые проверки и эксплуатация в контролируемых реальных сценариях.