GLM 5.3 — нова coding та agent модель Z.ai з контекстом на 1 мільйон токенів; компанія заявляє про 50% перевагу над GLM 5.2 на внутрішньому Z.ai Code Bench. Найбільші заявлені прирости припадають на багатокрокові CLI задачі: у сторонньому порівнянні Terminal Bench 3.0 зріс із 4,6% до 28,3%, а ExploitBench — із 24,4%...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3, how does it compare with GLM-5.2 in coding, long-horizon tasks, cybersecurity, and benchmarks such as Z.ai Code Benc. Article summary: GLM-5.3 is Z.ai’s flagship coding-and-agent model, aimed at complex software engineering and long-horizon tasks. It has a 1M-token context window and is available through Z.ai’s GLM Coding Plan; its API availability was . Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3 — нова coding- та agent-модель компанії Z.ai, розрахована не лише на генерацію окремих фрагментів коду, а й на тривалу роботу над складними програмними проєктами: планування, реалізацію, налагодження та повторні ітерації. Z.ai вказує для неї контекстне вікно на 1 мільйон токенів і позиціонує модель як сильнішу за GLM-5.2 у складних задачах із довгим горизонтом виконання.
Головна новина — не просто чергове підвищення результату в стандартних coding-тестах. За даними Z.ai, GLM-5.3 показує на 50% кращий результат на внутрішньому Z.ai Code Bench і досягає найкращих серед open-source-моделей показників у публічних оцінюваннях, зокрема Terminal-Bench 3.0 та Agents’ Last Exam (CLI).
Найчіткіше офіційне порівняння — це заява Z.ai про 50-відсотковий приріст на власному Z.ai Code Bench. Детальні цифри публічних бенчмарків наведені у сторонньому звіті:
| Бенчмарк | GLM-5.2 | GLM-5.3 | Що може означати результат |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6% | 28,3% | Значно краща робота в тривалих командних задачах |
| DeepSWE v1.1 | 46,2% | 66,9% | Вищі результати в інженерних coding-задачах |
| Agents’ Last Exam (CLI) | 23,8% | 28,5% | Покращення в агентній роботі з інструментами |
| CyberGym | 77,2% | 84,5% | Кращий пошук уразливостей |
| ExploitBench | 24,4% | 54,4% | Показник більш ніж удвічі вищий, ніж у GLM-5.2 |
Ці числа варто сприймати саме як оприлюднені результати, а не як остаточно підтверджені вимірювання. Детальне порівняння походить зі сторонньої публікації в X, тоді як офіційна документація Z.ai підтверджує загальний напрямок покращень у coding-задачах, довготривалих бенчмарках і кібербезпеці, але не наводить у наданому фрагменті кожну з перелічених цифр.
Перехід із 4,6% до 28,3% у Terminal-Bench 3.0 — найпомітніший приріст у наведеній таблиці. Цей тест важливий для coding-агентів, оскільки перевіряє роботу в командному рядку: модель має використовувати інструменти, аналізувати стан середовища, вносити зміни й послідовно рухатися до результату, а не просто видати один ізольований приклад коду.
Доступні дані дають підстави говорити про суттєво сильніший результат GLM-5.3 саме в цьому тесті. Водночас він не доводить, що модель буде кращою за GLM-5.2 у кожному реальному репозиторії чи робочому процесі розробки.
GLM-5.3 задумана для тривалої інженерної роботи — від складання плану й написання коду до глибокого дебагінгу та перевірки результату. В огляді моделі Z.ai вказує контекст на 1 мільйон токенів і прямо описує її як сильнішу в складних задачах із довгим горизонтом виконання.
Це відрізняє реліз від звичайного оновлення, орієнтованого на короткі запити на кшталт «напиши функцію». Z.ai заявляє про SOTA-рівень серед open-source-моделей у Terminal-Bench 3.0 та Agents’ Last Exam (CLI), а на власному Code Bench — про 50-відсоткове покращення порівняно з GLM-5.2.
Практично це означає, що GLM-5.3 має краще утримувати великий обсяг контексту про проєкт і доводити завдання через більше послідовних кроків. Однак самі бенчмарки не показують надійність, вартість, затримку відповіді чи якість виконання інструментальних команд у конкретному середовищі. Командам, які планують перехід, варто перевірити модель на власних репозиторіях і типових workflow, а не механічно переносити приріст із тестів у production.
Z.ai заявляє, що GLM-5.3 показала найкращий для компанії результат на бенчмарку CyberGym, який оцінює пошук уразливостей. Також компанія повідомляє, що результат моделі в задачах експлуатації вразливостей більш ніж удвічі перевищив показник GLM-5.2.
Стороння таблиця наводить зростання CyberGym із 77,2% до 84,5%, а ExploitBench — із 24,4% до 54,4%. Точні значення не підтверджені в наданих офіційних матеріалах, тому їх коректніше розглядати як заявлені під час запуску результати, а не як остаточно усталені галузеві показники.
Ці результати важливі з двох причин. По-перше, вони свідчать, що покращення агентних можливостей можуть поширюватися не лише на написання прикладного коду, а й на пошук та аналіз дефектів. По-друге, вони підкреслюють потребу в додаткових перевірках безпеки перед широким розгортанням: модель, здатніша знаходити й експлуатувати вразливості, може допомагати захисникам, але водночас підвищує ризики зловживання без належних обмежень.
Z.ai пов’язує приріст GLM-5.3 передусім із масштабуванням post-training — донавчання після базового тренування. Компанія розширила навчальні середовища так, щоб вони більше нагадували реальні багатоденні інженерні та дослідницькі процеси, а не короткі самодостатні вправи з програмування.
Згідно з описом Z.ai, GLM-5.3 використовує ту саму базову модель, що й GLM-5.2, а основні покращення походять від масштабованого post-training і нових task environments. Тобто акцент зроблено не на заявленій зміні базової архітектури, а на тому, як модель навчали планувати, користуватися інструментами, відновлюватися після помилок і виконувати довгі послідовності дій.
Це також пояснює, чому найбільші заявлені прирости припадають на довготривалі та агентні оцінювання. Водночас це версія самої Z.ai про причини покращення. Щоб встановити, наскільки результат узагальнюється на інші моделі, harness-середовища, промпти та програмні проєкти, потрібні незалежні тести.
GLM-5.3 уже доступна в GLM Coding Plan від Z.ai — на заявлених тарифах Max, Pro і Lite — а також у середовищі розробки ZCode.
У наданих матеріалах немає підтвердження, що відкриті ваги вже опубліковані. Сторонній звіт повідомляє, що Z.ai планувала випустити їх приблизно через два тижні після запуску 14 серпня 2026 року — орієнтовно наприкінці серпня — після додаткового оцінювання безпеки. Це попередній термін, а не підтверджена дата релізу.
Для розробників тут важливо розрізняти доступність і відтворюваність. Модель уже можна випробувати через підтримувані продукти Z.ai, але повністю відтворити детальні результати запуску локально поки неможливо без опублікованих ваг і незалежно описаних умов тестування.
GLM-5.3 виглядає не як косметична зміна номера, а як цілеспрямоване оновлення для coding-агентів. Z.ai заявляє про 50% приросту на внутрішньому тесті, кращі результати в довготривалих агентних задачах і помітне посилення можливостей у кібербезпеці порівняно з GLM-5.2.
Головне застереження стосується доказової бази. Z.ai підтверджує сам напрямок покращень, тоді як точні порівняння в публічних бенчмарках і орієнтир щодо виходу ваг приблизно через два тижні походять зі сторонніх повідомлень і ще потребують незалежної перевірки.
Поки не з’являться ширше тестування та відкриті ваги, GLM-5.3 найкраще описувати як перспективне й уже доступне через продукти Z.ai оновлення для coding-агентів — але ще не як повністю відтворювану open модель.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GLM 5.3 — нова coding та agent модель Z.ai з контекстом на 1 мільйон токенів; компанія заявляє про 50% перевагу над GLM 5.2 на внутрішньому Z.ai Code Bench.
GLM 5.3 — нова coding та agent модель Z.ai з контекстом на 1 мільйон токенів; компанія заявляє про 50% перевагу над GLM 5.2 на внутрішньому Z.ai Code Bench. Найбільші заявлені прирости припадають на багатокрокові CLI задачі: у сторонньому порівнянні Terminal Bench 3.0 зріс із 4,6% до 28,3%, а ExploitBench — із 24,4% до 54,4%.
Z.ai пояснює результат масштабуванням post training і навчальними середовищами, наближеними до тривалих інженерних та дослідницьких процесів; відкриті ваги орієнтовно мали з’явитися наприкінці серпня 2026 року після д...