Zhipu mendakwa GLM-5.3 mencatat peningkatan pengekodan kira-kira 50% berbanding GLM-5.2 dalam penilaian dalaman Z.ai Code Bench. Perubahan yang lebih besar pula dapat dilihat dalam penilaian yang memerlukan model menyelesaikan tugasan perisian secara berterusan:
Terminal-Bench 3.0 sangat berkaitan dengan dakwaan keupayaan pengekodan berasaskan ejen kerana ia menilai kerja perisian yang melibatkan terminal dan arahan shell, bukan jawapan statik semata-mata. DeepSWE 1.1 pula memfokuskan tugasan kejuruteraan perisian, menjadikan skornya petunjuk berguna untuk menilai kemajuan dalam aliran kerja pembangunan yang lebih lengkap.
Zhipu berkata skor 28.3 dalam Terminal-Bench 3.0 merupakan yang tertinggi dalam kalangan model sumber terbuka ketika diumumkan, serta mengatasi Kimi K3 milik Moonshot AI. Bagaimanapun, ini ialah kedudukan yang dilaporkan oleh syarikat. Perbandingan wajar dibaca bersama versi penilaian, kaedah arahan dan keadaan akses yang digunakan untuk setiap model.
Hala tuju GLM-5.3 ialah membina sistem AI yang boleh melakukan lebih daripada mencadangkan kod. Zhipu mempersembahkan model ini sebagai sistem yang boleh mengendalikan perisian, menggunakan alatan dan menyelesaikan rangkaian tindakan yang lebih panjang dengan kurang pengawasan manusia.
Perbezaannya terletak antara pembantu pengekodan yang menjawab soalan khusus dengan ejen yang boleh memeriksa repositori, menjalankan arahan, mendiagnosis kegagalan, mengubah fail dan terus berusaha mencapai matlamat.
Peningkatan dalam Terminal-Bench dan DeepSWE selari dengan hala tuju tersebut. Namun, skor penanda aras semata-mata belum dapat membuktikan bahawa ejen akan beroperasi secara konsisten dalam persekitaran produksi yang tidak dikenali.
Zhipu turut berkata prestasi pengekodan dan ejen GLM-5.3 semakin menghampiri Claude Fable 5, selain mendakwa model ini lebih praktikal untuk tugasan pengekodan dunia sebenar berbanding model China yang lain. Dakwaan ini ialah kedudukan pasaran daripada Zhipu dan tidak harus dianggap sebagai papan pendahulu bebas yang muktamad.
Pengumuman Zhipu turut mengaitkan penaakulan dan penggunaan alatan yang lebih baik dengan tugasan keselamatan siber, termasuk potensi mengenal pasti kelemahan dalam perisian. Antara butiran penilaian yang dilaporkan kepada umum ialah skor 84.5% dalam CyberGym untuk tugasan mencari dan mengesahkan kelemahan.
Keupayaan ini mempunyai sifat dwi-guna. Kemahiran penaakulan dan pengendalian perisian yang membantu pasukan pertahanan mencari kelemahan juga boleh menjadikan tingkah laku autonomi yang tidak selamat lebih berisiko.
Bukti yang tersedia menyokong penerangan bahawa pengesanan kelemahan ialah salah satu bidang keupayaan yang dilaporkan — bukan bukti bahawa GLM-5.3 ialah juruaudit keselamatan yang boleh diharap atau mampu menjalankan eksploitasi autonomi dengan selamat.
Isyarat paling penting daripada GLM-5.3 bukan sekadar jumlah parameternya. Yang lebih signifikan ialah penekanan Zhipu terhadap latihan pasca dan penilaian yang mengukur sama ada model boleh meneruskan tugasan perisian melalui beberapa langkah.
Pembangun yang ingin menilai model ini wajar memberi perhatian kepada beberapa perkara:
GLM-5.3 ialah keluaran 743 bilion parameter yang menurut Zhipu AI memperoleh sebahagian besar peningkatan prestasinya melalui latihan pasca, bukannya model asas yang lebih besar. Lonjakan yang dilaporkan — daripada 4.6 kepada 28.3 dalam Terminal-Bench 3.0 dan daripada 46.2 kepada 66.9 dalam DeepSWE 1.1 — menjelaskan sasaran utamanya: ejen pengekodan yang lebih mampu mengendalikan tugasan perisian berjangka panjang.
Keputusan ini cukup menarik untuk diuji dengan lebih dekat, khususnya bagi pengekodan berasaskan model terbuka dan aliran kerja ejen AI. Namun, ia masih merupakan dakwaan yang dilaporkan vendor. Jarak antara skor penanda aras yang tinggi dengan operasi autonomi yang benar-benar boleh dipercayai tetap memerlukan pengesahan bebas.