Zhipu cho biết GLM-5.3 cải thiện khoảng 50% năng lực lập trình so với GLM-5.2 trên bài đánh giá nội bộ Z.ai Code Bench. Mức tăng nổi bật hơn xuất hiện ở những bài kiểm tra yêu cầu mô hình xử lý một nhiệm vụ phần mềm kéo dài qua nhiều bước:
Terminal-Bench 3.0 đặc biệt phù hợp với tuyên bố về “lập trình tác tử” vì bài đánh giá này xem xét khả năng thực hiện công việc phần mềm thông qua terminal và shell, thay vì chỉ chấm câu trả lời tĩnh. DeepSWE 1.1 tập trung vào các nhiệm vụ kỹ thuật phần mềm, qua đó cung cấp thêm một chỉ dấu về khả năng xử lý quy trình phát triển hoàn chỉnh hơn.
Zhipu nói kết quả 28,3 điểm trên Terminal-Bench 3.0 là cao nhất trong nhóm mô hình mã nguồn mở tại thời điểm công bố và vượt Moonshot AI Kimi K3. Tuy vậy, đây là thứ hạng do công ty tự báo cáo. Khi so sánh, cần xem xét cả phiên bản bài đánh giá, cách xây dựng prompt và điều kiện truy cập được áp dụng cho từng mô hình.
Định hướng sản phẩm của GLM-5.3 là một hệ thống có thể làm nhiều hơn việc đề xuất mã. Zhipu giới thiệu mô hình này với khả năng vận hành phần mềm, sử dụng công cụ và hoàn thành các chuỗi hành động dài hơn mà cần ít sự can thiệp của con người hơn.
Sự khác biệt nằm ở chỗ: một trợ lý lập trình thông thường có thể trả lời câu hỏi cụ thể, còn một agent có thể kiểm tra kho mã, chạy lệnh, chẩn đoán lỗi, chỉnh sửa tệp rồi tiếp tục tiến tới mục tiêu.
Các kết quả trên Terminal-Bench và DeepSWE phù hợp với định hướng đó. Dù vậy, một điểm số benchmark không thể tự nó chứng minh agent sẽ hoạt động ổn định trong mọi môi trường sản xuất xa lạ, nơi yêu cầu, cấu trúc hệ thống và lỗi phát sinh thường không được chuẩn hóa.
Zhipu cũng cho biết năng lực lập trình và tác tử của GLM-5.3 đang tiến gần Claude Fable 5, đồng thời có lợi thế thực tế hơn các mô hình Trung Quốc khác trong các tác vụ lập trình ngoài đời. Đây là các tuyên bố định vị từ Zhipu, không nên được xem là bảng xếp hạng độc lập mang tính kết luận.
Thông báo của Zhipu còn liên hệ năng lực suy luận và sử dụng công cụ tốt hơn của GLM-5.3 với các công việc an ninh mạng, trong đó có khả năng phát hiện lỗ hổng phần mềm. Các chi tiết đánh giá được công bố rộng rãi gồm kết quả 84,5% trên CyberGym ở các nhiệm vụ phát hiện và xác thực lỗ hổng.
Đây là năng lực có tính lưỡng dụng. Kỹ năng suy luận và vận hành phần mềm có thể giúp đội ngũ phòng thủ tìm ra điểm yếu, nhưng cũng khiến hành vi tự động không an toàn trở nên đáng lo ngại hơn.
Bằng chứng hiện có chỉ đủ để mô tả phát hiện lỗ hổng là một lĩnh vực năng lực được báo cáo, chứ chưa chứng minh GLM-5.3 là công cụ kiểm toán an ninh đáng tin cậy hoặc có thể tự tiến hành khai thác một cách an toàn.
Tín hiệu quan trọng nhất từ GLM-5.3 không chỉ là con số 743 tỷ tham số. Đó là việc Zhipu nhấn mạnh vào hậu huấn luyện và những bài đánh giá đo khả năng duy trì một nhiệm vụ phần mềm qua nhiều bước.
Nếu muốn đánh giá mô hình, nhà phát triển nên tập trung vào các câu hỏi thực tế:
GLM-5.3 là mô hình 743 tỷ tham số mà Zhipu AI cho biết đã đạt phần lớn cải thiện nhờ hậu huấn luyện, thay vì xây dựng một mô hình nền lớn hơn. Mức tăng từ 4,6 lên 28,3 điểm trên Terminal-Bench 3.0 và từ 46,2 lên 66,9 điểm trên DeepSWE 1.1 làm nổi bật thông điệp chính của bản phát hành: tạo ra các coding agent có khả năng xử lý những nhiệm vụ phần mềm dài và phức tạp hơn.
Các kết quả đủ đáng chú ý để cộng đồng tiếp tục kiểm tra, đặc biệt trong lĩnh vực lập trình bằng mô hình mở và quy trình agent. Nhưng khoảng cách giữa một benchmark ấn tượng và khả năng vận hành tự động đáng tin cậy ngoài thực tế vẫn cần được lấp đầy bằng các đánh giá độc lập.