| Benchmark | GLM-5.3 | GLM-5.2 (thế hệ trước) |
|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE v1.1 | 66,9 | 46,2 |
| Agents' Last Exam (CLI) | 28,5 | 23,8 |
| Z.ai Internal Code Bench | Cải thiện ~50% | mốc cơ sở |
Lưu ý: Mythos 5 đạt 80,3% trên SWE-bench Pro (lập trình agent), nhưng không có so sánh trực tiếp trên các benchmark cụ thể này giữa cả hai mô hình . Tất cả cải thiện của GLM-5.3 chỉ đến từ việc mở rộng huấn luyện sau (post-training) – mô hình nền 743 tỷ tham số không được huấn luyện lại
.
GLM-5.3 tuyên bố dẫn đầu hẹp so với Mythos 5 trong phát hiện lỗ hổng (84,5% so với 83,8% trên CyberGym), nhưng bị tụt lại đáng kể trong khai thác lỗ hổng (54,4% so với 78,0% trên ExploitBench). Việc phát hành open-weight của nó bị trì hoãn để xem xét an toàn, và người tiền nhiệm GLM-5.2 đã được đánh giá là có khả năng từ chối các hướng dẫn tấn công mạng gần như bằng không. Mythos 5 vẫn bị hạn chế hơn nhiều - chưa bao giờ được công khai, chỉ giới hạn cho khoảng 200 đối tác đã được thẩm định - nhưng cũng có năng lực vượt trội hơn nhiều ở nhiệm vụ tấn công nguy hiểm nhất: tạo ra các mã khai thác hoạt động. Hàm ý rộng hơn là các mô hình open-weight đang nhanh chóng thu hẹp khoảng cách năng lực với các mô hình tiên phong bị hạn chế trong các tác vụ mạng, trong khi các biện pháp bảo vệ an toàn vẫn còn yếu hơn đáng kể. Sự không chắc chắn về quy định của Trung Quốc trong việc xuất khẩu các mô hình AI hàng đầu càng thêm một lớp phức tạp cho việc liệu các trọng số của GLM-5.3 có bao giờ được phổ biến rộng rãi như những gì tiếp thị của Z.ai gợi ý hay không.