| 54,4% |
| Điểm số được báo cáo cao hơn gấp đôi GLM-5.2 |
Cần đọc các số liệu này với mức độ thận trọng. Bảng so sánh chi tiết đến từ một bài đăng trên X của bên thứ ba; tài liệu chính thức của Z.ai xác nhận xu hướng cải thiện về lập trình, tác vụ dài hạn và an ninh mạng nhưng không tái hiện toàn bộ các con số trong phần trích dẫn được cung cấp. Vì vậy, đây nên được xem là các kết quả được báo cáo, chưa phải phép đo đã được kiểm chứng độc lập.
Mức tăng từ 4,6% lên 28,3% trên Terminal-Bench 3.0 là thay đổi nổi bật nhất trong bảng điểm. Benchmark này phù hợp để đánh giá coding agent vì model phải làm việc trong môi trường dòng lệnh, kiểm tra trạng thái, sử dụng công cụ, chỉnh sửa tệp và tiếp tục qua nhiều giai đoạn thay vì chỉ đưa ra một đoạn mã đơn lẻ.
Kết quả được báo cáo cho thấy GLM-5.3 mạnh hơn đáng kể trong bài kiểm tra này. Tuy nhiên, nó không chứng minh rằng model sẽ luôn vượt GLM-5.2 trên mọi kho mã, dự án hoặc quy trình phát triển thực tế.
GLM-5.3 được thiết kế cho chuỗi công việc gồm lập kế hoạch, triển khai, gỡ lỗi và lặp lại trên một lượng ngữ cảnh lớn. Tổng quan model của Z.ai nêu rõ cửa sổ ngữ cảnh 1 triệu token và định vị GLM-5.3 cho các tác vụ phức tạp, kéo dài nhiều bước.
Đây là điểm khác với một bản nâng cấp chỉ tối ưu cho những câu lệnh lập trình ngắn. Z.ai báo cáo hiệu năng dẫn đầu trong nhóm model nguồn mở trên Terminal-Bench 3.0 và Agents’ Last Exam (CLI), trong khi phép so sánh nội bộ cho thấy GLM-5.3 tăng 50% so với GLM-5.2 trên Z.ai Code Bench.
Về thực tế sử dụng, điều này có nghĩa model được kỳ vọng có thể giữ lại và tận dụng nhiều thông tin hơn về dự án, đồng thời theo đuổi một nhiệm vụ qua nhiều bước. Dù vậy, điểm benchmark không tự động cho biết model có đáng tin cậy đến đâu, tốc độ phản hồi, chi phí hay chất lượng thực thi công cụ trong một môi trường lập trình cụ thể.
Các đội ngũ đang cân nhắc chuyển sang GLM-5.3 nên thử nghiệm trên những kho mã và quy trình đại diện cho công việc thật, thay vì mặc định rằng mức tăng benchmark sẽ được chuyển nguyên vẹn sang môi trường production.
Z.ai cho biết GLM-5.3 đạt kết quả tốt nhất từ trước đến nay của hãng trên benchmark CyberGym, vốn đánh giá khả năng phát hiện lỗ hổng. Công ty cũng nói rằng hiệu năng khai thác lỗ hổng của model cao hơn gấp đôi kết quả của GLM-5.2.
Bảng điểm từ bên thứ ba ghi nhận CyberGym tăng từ 77,2% lên 84,5%, còn ExploitBench tăng từ 24,4% lên 54,4%. Các con số chính xác này chưa được xác minh độc lập trong tài liệu chính thức được cung cấp, nên phù hợp hơn khi được xem là kết quả công bố tại thời điểm ra mắt, thay vì một chuẩn mực đã được toàn ngành xác nhận.
Kết quả an ninh mạng có hai hàm ý. Thứ nhất, những cải thiện về khả năng tác nhân có thể mở rộng từ việc viết mã sang phân tích và tìm kiếm khiếm khuyết trong phần mềm. Thứ hai, chúng nhấn mạnh nhu cầu đánh giá an toàn trước khi triển khai rộng rãi: một model giỏi hơn trong phát hiện và khai thác lỗ hổng có thể hỗ trợ đội ngũ phòng thủ, nhưng cũng làm tăng rủi ro bị lạm dụng nếu thiếu cơ chế kiểm soát phù hợp.
Z.ai quy kết phần lớn tiến bộ của GLM-5.3 cho việc mở rộng quy mô hậu huấn luyện. Theo giải thích của công ty, các môi trường tác vụ dùng trong quá trình huấn luyện đã được mở rộng để gần hơn với quy trình kỹ thuật và nghiên cứu thực tế kéo dài nhiều ngày, thay vì chỉ tập trung vào các bài lập trình ngắn, độc lập.
Nói cách khác, cải thiện được mô tả chủ yếu là kết quả của thay đổi trong huấn luyện và môi trường tác vụ, không đơn thuần do tăng cửa sổ ngữ cảnh hay công bố một kiến trúc nền tảng hoàn toàn mới. Cách tiếp cận này cũng giúp lý giải vì sao mức tăng lớn nhất xuất hiện ở các bài đánh giá tác vụ dài hạn và tác vụ theo kiểu tác nhân: giai đoạn hậu huấn luyện được nhắm tới việc giúp model lập kế hoạch, sử dụng công cụ, phục hồi sau lỗi và tiếp tục xử lý nhiệm vụ qua nhiều bước.
Đây vẫn là cách lý giải từ phía Z.ai. Cần có thêm các phép thử độc lập để xác định mức cải thiện có khái quát tốt giữa những model, bộ công cụ điều phối, prompt và dự án phần mềm khác nhau hay không.
GLM-5.3 hiện có trên GLM Coding Plan của Z.ai, với các gói được liệt kê gồm Max, Pro và Lite. Model cũng đã được tích hợp vào môi trường phát triển ZCode.
Trong các nguồn được cung cấp, model weights của GLM-5.3 vẫn chưa được phát hành. Một báo cáo bên thứ ba cho biết Z.ai dự kiến công bố weights khoảng hai tuần sau ngày ra mắt 14/8/2026, sau khi hoàn tất đánh giá an toàn bổ sung. Điều này gợi ý thời điểm vào cuối tháng 8/2026, nhưng vẫn chỉ là kế hoạch tạm thời, không phải ngày phát hành đã được xác nhận.
Với nhà phát triển, cần phân biệt giữa khả năng truy cập và khả năng tái lập. GLM-5.3 có thể được dùng thông qua các sản phẩm lập trình được Z.ai hỗ trợ, nhưng các kết quả chi tiết tại thời điểm ra mắt chưa thể được tái lập đầy đủ trên máy nội bộ bằng weights được mô tả trong các nguồn nói trên.
GLM-5.3 là một bản nâng cấp có định hướng cho coding agent, không chỉ là thay đổi số phiên bản. Z.ai báo cáo model tăng 50% trên benchmark lập trình nội bộ, đạt kết quả mạnh hơn ở các bài đánh giá tác vụ dài hạn và có bước tiến đáng kể trong một số bài kiểm tra an ninh mạng so với GLM-5.2.
Điểm cần lưu ý nhất là chất lượng bằng chứng. Z.ai xác nhận hướng cải thiện, còn các bảng so sánh benchmark công khai chi tiết và mốc phát hành weights khoảng hai tuần chủ yếu đến từ báo cáo bên thứ ba, vẫn cần được kiểm chứng độc lập.
Cho đến khi có thêm thử nghiệm diện rộng và weights được phát hành, GLM-5.3 nên được xem là một bản nâng cấp coding agent đầy hứa hẹn, hiện có thể tiếp cận qua sản phẩm của Z.ai — nhưng chưa phải một model nguồn mở có khả năng tái lập hoàn toàn bởi cộng đồng.