| ExploitBench | 24.4% | 54.4% | Lebih dua kali ganda markah GLM-5.2 yang dilaporkan |
Angka ini perlu dibaca sebagai keputusan yang dilaporkan, bukannya ukuran yang telah disahkan secara bebas. Perbandingan terperinci datang daripada hantaran pihak ketiga di X, manakala dokumentasi rasmi Z.ai mengesahkan dakwaan umum tentang pengekodan, penanda aras tugasan jangka panjang dan keselamatan siber tanpa menyenaraikan semula setiap angka dalam petikan yang tersedia.
Kenaikan daripada 4.6% kepada 28.3% dalam Terminal-Bench 3.0 ialah perbezaan paling ketara dalam jadual tersebut. Penanda aras ini relevan untuk ejen pengekodan kerana ia menguji kerja dalam persekitaran baris perintah. Model biasanya perlu mengurus alatan, memeriksa keadaan sistem, membuat perubahan dan meneruskan tugasan melalui beberapa peringkat—bukan hanya menghasilkan satu cebisan kod yang berdiri sendiri.
Bukti yang tersedia menyokong gambaran bahawa GLM-5.3 jauh lebih kuat dalam ujian ini. Namun, keputusan tersebut bukan bukti bahawa ia akan mengatasi GLM-5.2 dalam setiap repositori sebenar atau aliran kerja pembangunan.
GLM-5.3 disasarkan untuk kerja kejuruteraan yang berterusan: merancang, melaksanakan, menyahpepijat dan membuat penambahbaikan berulang pada projek yang mempunyai konteks lebih besar. Gambaran keseluruhan model Z.ai menyenaraikan tetingkap konteks 1 juta token serta secara khusus memposisikannya untuk tugasan kompleks dan jangka panjang.
Fokus ini membezakan pelancaran tersebut daripada kemas kini biasa yang hanya dioptimumkan untuk arahan pengekodan ringkas. Z.ai melaporkan prestasi terbaik dalam kalangan model sumber terbuka bagi Terminal-Bench 3.0 dan Agents’ Last Exam (CLI), manakala perbandingan Code Bench miliknya sendiri menunjukkan peningkatan 50% berbanding GLM-5.2.
Secara praktikal, ini bermakna GLM-5.3 dibina untuk mengekalkan dan menggunakan lebih banyak konteks projek sambil melaksanakan tugasan melalui lebih banyak langkah. Walau bagaimanapun, markah penanda aras tidak dengan sendirinya membuktikan tahap kebolehpercayaan, kos, kependaman atau kualiti pelaksanaan alatan dalam persekitaran pembangunan tertentu.
Pasukan yang mempertimbangkan migrasi wajar mengujinya menggunakan repositori dan aliran kerja sebenar mereka, bukannya menganggap peningkatan penanda aras akan berpindah sepenuhnya ke penggunaan produksi.
Z.ai berkata GLM-5.3 mencatat keputusan terbaiknya setakat ini dalam penanda aras CyberGym untuk penemuan kelemahan. Syarikat itu turut menyatakan bahawa prestasi model dalam eksploitasi kelemahan melebihi dua kali ganda keputusan GLM-5.2.
Jadual pihak ketiga pula melaporkan CyberGym meningkat daripada 77.2% kepada 84.5%, manakala ExploitBench meningkat daripada 24.4% kepada 54.4%. Angka tepat ini tidak disahkan secara bebas dalam bahan rasmi yang tersedia, jadi ia lebih wajar dianggap sebagai dakwaan pelancaran yang dilaporkan, bukan penanda aras industri yang muktamad.
Keputusan keselamatan siber ini penting atas dua sebab. Pertama, ia mencadangkan peningkatan keupayaan ejen mungkin merangkumi bukan sahaja penulisan kod aplikasi, tetapi juga pencarian dan penaakulan tentang kelemahan. Kedua, ia menekankan keperluan penilaian keselamatan sebelum penggunaan yang lebih meluas.
Model yang lebih cekap menemui dan mengeksploitasi kelemahan boleh membantu kerja pertahanan siber, tetapi juga meningkatkan risiko penyalahgunaan jika digunakan tanpa kawalan yang sesuai.
Z.ai mengaitkan peningkatan GLM-5.3 terutamanya dengan post-training yang dipertingkatkan pada skala lebih besar. Menurut penjelasan syarikat itu, persekitaran tugasan yang digunakan dalam latihan diperluas supaya lebih menyerupai aliran kerja kejuruteraan dan penyelidikan sebenar yang berlangsung selama beberapa hari, bukannya hanya latihan pengekodan pendek dan berasingan.
Dengan kata lain, peningkatan yang dilaporkan dipersembahkan sebagai hasil perubahan pada proses latihan dan persekitaran tugasan—bukan semata-mata tetingkap konteks yang lebih besar atau seni bina asas baharu yang diperincikan dalam bahan tersebut.
Pendekatan ini membantu menjelaskan mengapa peningkatan paling besar dilaporkan pada penilaian jangka panjang dan berasaskan ejen: proses post-training itu disasarkan untuk mengajar model merancang, menggunakan alatan, pulih daripada kegagalan dan meneruskan tugasan yang panjang.
Namun, penjelasan itu masih merupakan akaun Z.ai sendiri. Ujian bebas diperlukan untuk menentukan sejauh mana peningkatan tersebut boleh digeneralisasikan merentasi model, rangka kerja ejen, arahan dan projek perisian yang berbeza.
GLM-5.3 kini tersedia melalui GLM Coding Plan Z.ai, termasuk pelan Max, Pro dan Lite yang disenaraikan, serta dalam persekitaran pembangunan ZCode.
Weights model itu belum tersedia berdasarkan bukti yang dibekalkan. Satu laporan pihak ketiga menyatakan Z.ai menjangka menerbitkannya kira-kira dua minggu selepas pelancaran pada 14 Ogos 2026, selepas penilaian keselamatan tambahan. Ini menunjuk kepada sekitar akhir Ogos 2026, tetapi masanya masih tentatif dan tidak harus dianggap sebagai tarikh keluaran yang disahkan.
Bagi pembangun yang mahu mencuba GLM-5.3 sekarang, perbezaan penting ialah antara akses dan kebolehulangan. Model itu boleh digunakan melalui produk pengekodan rasmi Z.ai, tetapi keputusan pelancaran terperinci belum boleh dihasilkan semula sepenuhnya secara setempat menggunakan weights yang dinyatakan dalam sumber tersedia.
GLM-5.3 bukan sekadar pertukaran nombor versi. Ia ialah naik taraf yang disasarkan kepada ejen pengekodan—terutamanya untuk tugasan yang panjang, kompleks dan memerlukan penggunaan alatan. Z.ai melaporkan peningkatan 50% dalam penanda aras pengekodan dalaman, keputusan lebih kukuh dalam penilaian ejen jangka panjang serta peningkatan besar dalam ujian keselamatan siber berbanding GLM-5.2.
Namun, perkara paling penting untuk diingat ialah tahap buktinya. Z.ai mengesahkan arah peningkatan tersebut, manakala perbandingan tepat dalam penanda aras awam dan jadual keluaran weights kira-kira dua minggu datang daripada laporan pihak ketiga serta masih menunggu pengesahan bebas.
Sehingga ujian lebih meluas dijalankan dan weights diterbitkan, GLM-5.3 paling tepat difahami sebagai naik taraf ejen pengekodan yang menjanjikan dan sudah boleh diakses melalui produk Z.ai—bukannya model terbuka yang boleh dihasilkan semula sepenuhnya secara bebas.