Câu trả lời kéo dài thành “sooooooon” của Tang Jie nhanh chóng trở thành hiện thực: các báo cáo cho biết Zhipu đã phát hành GLM-5.3 chỉ vài giờ sau phản hồi của nhà khoa học trưởng Zhipu AI.
12
Tuy nhiên, điểm đáng chú ý của lần ra mắt này không chỉ nằm ở tốc độ. GLM-5.3 được định vị là mô hình chuyên cho lập trình, các tác vụ phần mềm do AI tự thực hiện và an ninh mạng. Câu chuyện kỹ thuật khác thường của sản phẩm là mô hình vẫn sử dụng nền tảng khoảng 743 tỷ tham số của GLM-5.2, trong khi Zhipu quy phần lớn mức tăng hiệu năng được công bố cho quá trình hậu huấn luyện mở rộng, thay vì một đợt tiền huấn luyện với mô hình lớn hơn.
1
4
20
Tăng năng lực mà không cần tăng kích thước nền tảng
GLM-5.3 đặt hậu huấn luyện vào trung tâm của chiến lược cải thiện hiệu năng. Đây là hướng đi đáng chú ý trong bối cảnh các bước tiến của mô hình AI thường được gắn với số lượng tham số lớn hơn hoặc một nền tảng được huấn luyện mới hoàn toàn.
Theo các so sánh do Zhipu công bố, mức tiến bộ rõ nhất xuất hiện ở những nhiệm vụ phần mềm phức tạp, đòi hỏi mô hình phải sử dụng công cụ và thực hiện nhiều bước liên tiếp:
- SWE-Marathon: tăng từ 19,4 lên 42,5
- FrontierSWE: tăng từ 67,5 lên 78,1
- Terminal-Bench 3.0: tăng từ 4,6 lên 28,3
- DeepSWE v1.1: tăng từ 46,2 lên 66,9
Các số liệu này đến từ những bảng so sánh do Zhipu công bố và các phân tích thứ cấp về kết quả đó.
1
3
6
7
Kết quả Terminal-Bench đặc biệt gây chú ý nếu tính theo số điểm phần trăm. Dù vậy, mức tăng mạnh từ một điểm xuất phát thấp không đồng nghĩa mô hình chắc chắn đứng đầu ở mọi nhiệm vụ kỹ thuật phần mềm. Trên SWE-Marathon, chẳng hạn, điểm 42,5 được báo cáo vẫn thấp hơn Kimi K3 ở mức 48,1 và Opus 4.8 ở mức 48,8.
6
9
CyberGym trở thành con số nổi bật nhất
Kết quả thu hút nhiều sự quan tâm nhất của GLM-5.3 là 84,5 điểm trên CyberGym — bài kiểm thử tập trung vào việc tìm và xác nhận lỗ hổng từ mã nguồn. Bảng so sánh của Zhipu đặt kết quả này nhỉnh hơn Mythos 5 với 83,8 điểm và GPT-5.6 Sol với 83,6 điểm.
2
5
6
CyberGym không đơn thuần kiểm tra xem AI có thể đề xuất mã an toàn hay không. Nhiệm vụ được mô tả bao gồm xác định điểm yếu, xây dựng cách tấn công và kiểm tra tác động của chúng — gần với quy trình phát hiện lỗ hổng và suy luận theo chuỗi khai thác hơn là việc hoàn thành một đoạn mã thông thường.
12
17
Đó cũng là lý do kết quả này được các ấn phẩm chuyên về an ninh mạng chú ý. The Register dẫn tuyên bố của Zhipu rằng cải thiện của mô hình không chỉ dừng ở việc nhận diện các lỗi riêng lẻ, mà còn mở rộng sang suy luận qua nhiều giai đoạn trong một chuỗi khai thác.
17
Dẫu vậy, cụm từ “dẫn đầu” cần được đặt đúng bối cảnh. Các so sánh hiện có chủ yếu là số liệu do nhà cung cấp công bố, trong khi chưa có hoạt động tái lập độc lập trên quy mô lớn.
2
4
6
Zhipu còn công bố thử nghiệm trên mã nguồn thực tế
Ngoài CyberGym, Zhipu được cho là đã phối hợp với các nhóm bảo mật để kiểm thử mô hình trên những kho mã nguồn thực tế. Bảng thống kê do công ty công bố liệt kê 2.436 phát hiện bảo mật trong 269 dự án mã nguồn mở, trong đó có 1.097 lỗi ở mức Nghiêm trọng hoặc Cao. Các báo cáo cũng cho biết phát hiện lâu đời nhất có từ năm 1981, còn những lỗ hổng này đã tồn tại trung bình 26,6 năm trước khi được tìm thấy.
21
31
Những con số trên cho thấy loại quy trình bảo mật mà Zhipu muốn gắn với GLM-5.3. Tuy nhiên, chúng không nên được hiểu là các phép đo đã được kiểm toán độc lập. Các nguồn được cung cấp quy những số liệu này cho sổ thống kê của Zhipu, còn hồ sơ đánh giá rộng hơn hiện vẫn phần lớn dựa trên thông tin do công ty tiết lộ.
Mục tiêu không chỉ là viết mã, mà còn hoàn thành cả quy trình
Zhipu không quảng bá GLM-5.3 như một công cụ chỉ tạo ra các đoạn mã có vẻ hợp lý. Mô hình được hướng tới những agent có thể hoạt động trong thời gian dài, sử dụng công cụ, thao tác trên terminal và hoàn thành các nhiệm vụ kỹ thuật gồm nhiều bước.
Các kết quả được công bố gồm 73,0 điểm trên Toolathlon Verified, tăng từ 59,9 của GLM-5.2, và 48,2 điểm trên AutomationBench, tăng từ 26,2. Một số so sánh khác ghi nhận 28,5 điểm trên Agents’ Last Exam.
1
7
11
Điểm khác biệt thực tế nằm ở chỗ: lợi thế mà Zhipu hướng tới không chỉ là viết một đoạn mã đúng, mà là thực hiện liên tiếp nhiều hành động trong kho mã, terminal hoặc môi trường công cụ. Việc điều đó có chuyển thành hiệu quả ổn định trong dự án sản xuất hay không còn phụ thuộc vào quyền truy cập công cụ, độ bao phủ của kiểm thử, quy trình rà soát và tỷ lệ thất bại trên từng cơ sở mã cụ thể.
Lần ra mắt này thực sự chứng minh điều gì?
Bằng chứng mạnh nhất hiện ủng hộ một kết luận hẹp hơn nhiều so với tuyên bố “GLM-5.3 vượt qua mọi mô hình tiên phong”. Các kết quả của Zhipu cho thấy một bước nhảy đáng kể được báo cáo khi so GLM-5.3 với GLM-5.2 trên nhiều bài kiểm thử lập trình và agent, cùng điểm CyberGym dẫn đầu trong các bảng so sánh do Zhipu công bố và các bài viết về lần ra mắt này dẫn lại.
2
5
6
Các kết quả đó chưa chứng minh GLM-5.3 vượt trội đồng đều trong mọi nhiệm vụ lập trình, suy luận, an toàn hay sử dụng đa mục đích. Một số mô hình cạnh tranh vẫn có điểm cao hơn ở từng bài kiểm thử lập trình riêng lẻ, trong khi các kết quả hiện tại chưa được các đơn vị đánh giá độc lập tái lập rộng rãi.
6
9
Bài học đáng chú ý hơn nằm ở phương pháp: GLM-5.3 cho thấy hậu huấn luyện ở quy mô lớn có thể được dùng để khai phá năng lực chuyên biệt từ một nền tảng lớn có sẵn. Nếu các cuộc kiểm thử độc lập xác nhận mức tăng này, đầu tư vào hậu huấn luyện — cùng việc đánh giá cẩn trọng trên quy trình phát triển phần mềm và bảo mật thực tế — có thể quan trọng không kém những cuộc so sánh đơn thuần về số lượng tham số.