Tuy nhiên, bức tranh thay đổi hoàn toàn ở ExploitBench—bài kiểm tra đòi hỏi khả năng suy luận sâu hơn về cách khai thác một lỗ hổng thực sự và yêu cầu đưa ra được mã khai thác có hiệu quả. GLM-5.3 đã tăng hơn gấp đôi điểm số so với người tiền nhiệm, từ 24.4% lên 54.4% . Tuy nhiên, Z.ai báo cáo rằng Mythos 5 đạt 78% trên ExploitBench và GPT-5.6 Sol đạt 76.5% — để GLM-5.3 tụt lại phía sau đáng kể ở bài kiểm tra khó khăn hơn này
.
Trên ExploitGym, bài kiểm tra đếm số lượng nhiệm vụ khai thác mà một mô hình có thể hoàn thành trong ngân sách hai giờ tiêu chuẩn hóa, GLM-5.3 hoàn thành nhiệm vụ 105 (tăng từ 29 so với GLM-5.2) . Trong ngân sách sáu giờ, con số này tăng lên 130 nhiệm vụ
.
| Chuẩn | Đo lường điều gì | GLM-5.3 | Anthropic Mythos 5 | OpenAI GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | Phát hiện & xác thực lỗ hổng hộp trắng từ mã nguồn | 84.5% | 83.8% | 83.6% |
| ExploitBench | Suy luận nguyên nhân gốc rễ & đưa ra mã khai thác có hiệu quả | 54.4% | 78% | 76.5% |
| ExploitGym (2 giờ) | Số lượng mã khai thác hoàn thành trong ngân sách chuẩn hóa | 105 nhiệm vụ | Không được tiết lộ | Không được tiết lộ |
Ngoài các bài kiểm chuẩn, GLM-5.3 đã được triển khai trong các bài kiểm tra bảo mật thực tế với kết quả ấn tượng:
GLM-5.3 cũng đạt điểm số mạnh mẽ trên các bài kiểm chuẩn về lập trình và tác tử (agentic), khẳng định vị thế là mô hình mã nguồn mở hàng đầu cho các tác vụ kỹ thuật phần mềm:
Z.ai cho biết khả năng an ninh mạng của mô hình đã "phát triển nhanh hơn dự kiến" trong quá trình huấn luyện sau (post-training) . 740 tỷ tham số của mô hình nền tảng không được huấn luyện lại — tất cả sự cải thiện đều đến từ các cải tiến trong huấn luyện sau
. Vì khả năng này xuất hiện một cách đột biến ngoài dự kiến, công ty đã tạm thời giữ lại bản phát hành mã nguồn mở trong hai tuần để tăng cường các biện pháp kiểm soát an toàn và bảo mật
. Mô hình hiện đã có sẵn thông qua API của Z.ai và thông qua các tích hợp với ZCode, Claude Code và OpenCode
.