Ox Alpha chính là GLM 5.3 Flash của Zhipu AI, được xác nhận ngày 26/8/2026 sau đợt thử nghiệm ẩn danh miễn phí bắt đầu từ ngày 20/8. Mô hình hướng đến lập trình, lập trình trực quan, tác vụ tác nhân AI và xử lý ngữ cảnh dài, với cửa sổ khoảng một triệu token, hỗ trợ văn bản, hình ảnh, video, tài liệu trực quan và tệp.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash là mô hình đứng sau endpoint Ox Alpha từng xuất hiện ẩn danh trên OpenRouter và một số công cụ dành cho nhà phát triển từ ngày 20/8/2026. Sáu ngày sau, Zhipu AI—công ty hoạt động quốc tế dưới thương hiệu Z.ai—xác nhận danh tính của mô hình này và phát hành trọng số mở. 3
4
Vụ việc biến một bí ẩn kéo dài khoảng một tuần thành một trong những màn ra mắt đáng chú ý của nhóm mô hình AI mở: GLM-5.3-Flash là hệ thống mixture-of-experts (MoE) có tổng cộng 320 tỷ tham số, chỉ kích hoạt 18 tỷ tham số cho mỗi token, hỗ trợ đa phương thức nguyên bản và có cửa sổ ngữ cảnh 1.048.576 token—thường được gọi là khoảng một triệu token. Trọng số của mô hình được phát hành theo giấy phép MIT. 3
6
8
Ox Alpha xuất hiện mà không có thẻ mô hình, tên nhà sản xuất hay bảng thông số chi tiết. Các nhà phát triển bắt gặp một endpoint miễn phí, hỗ trợ ngữ cảnh dài và đầu vào đa phương thức, rồi đưa nó vào các quy trình lập trình, sử dụng công cụ và xây dựng tác nhân AI. Chất lượng thực tế của mô hình nhanh chóng thu hút sự chú ý, kéo theo nhiều suy đoán về phòng thí nghiệm đứng phía sau. 13
16
Theo Zhipu, đây là một đợt thử nghiệm được cố ý che giấu danh tính. Công ty không công bố tên, thông số và thương hiệu để người dùng đánh giá hệ thống dựa trên đầu ra thay vì bị ảnh hưởng bởi danh tiếng, số lượng tham số hoặc hoạt động tiếp thị. Lưu lượng sử dụng trong thực tế cũng giúp Zhipu thu thập dữ liệu về các tác vụ phát triển phần mềm và tác nhân AI trước khi công bố chính thức. 13
15
Một số báo cáo cho biết phiên bản thử nghiệm có công suất miễn phí khoảng 100 nghìn tỷ token mỗi ngày. Patrick Collison, đồng sáng lập Stripe, nằm trong số những nhà phát triển nổi tiếng được cho là đã đánh giá cao chất lượng mô hình. Những phản hồi này góp phần biến endpoint ẩn danh thành một màn ra mắt được theo dõi rộng rãi, dù sự hưởng ứng của cộng đồng không thể thay thế cho một phép đánh giá có kiểm soát. 13
14
Zhipu cũng cho biết dịch vụ được vận hành trên các bộ tăng tốc AI do Trung Quốc sản xuất. South China Morning Post đưa tin thử nghiệm sử dụng một cụm gồm 100.000 chip như vậy và mô hình đã xử lý 62 nghìn tỷ token trước khi phát hành chính thức. Các con số về công suất và mức sử dụng khác nhau giữa các nguồn, vì vậy nên xem đây là số liệu do công ty hoặc báo chí đưa tin, chưa phải kết quả được kiểm toán độc lập. 7
13
GLM-5.3-Flash là mô hình mixture-of-experts, hay MoE. Tổng “kho tham số” của mô hình là 320 tỷ, nhưng chỉ 18 tỷ được kích hoạt khi xử lý mỗi token. Về nguyên tắc, thiết kế này cho phép mô hình sở hữu năng lực biểu diễn của một hệ thống rất lớn mà không phải áp dụng toàn bộ 320 tỷ tham số ở mọi bước suy luận. 3
4
Mô hình có 45 lớp và được giới thiệu là mô hình đầu tiên trong dòng GLM-5 hỗ trợ đa phương thức nguyên bản. Nó có thể xử lý văn bản, hình ảnh, video, tài liệu trực quan, tệp và các đầu vào kết hợp nhiều loại dữ liệu. Điều này phù hợp với những quy trình trong đó tác nhân AI cần quan sát giao diện, đọc ảnh chụp màn hình, phân tích tài liệu hoặc kiểm tra kết quả thực thi mã thay vì chỉ xử lý văn bản. 4
11
Zhipu quảng bá cửa sổ ngữ cảnh 1.048.576 token, tương đương khoảng một triệu token. Dung lượng này hướng đến việc xử lý kho mã nguồn lớn, phiên làm việc dài của tác nhân, bộ tài liệu đồ sộ hoặc quy trình kết hợp mã với hình ảnh và tệp. 3
4
Theo tài liệu của Zhipu, mô hình được huấn luyện từ một nền tảng mới với kiến trúc và công thức huấn luyện được thiết kế lại. Công ty cho biết đã sử dụng kho dữ liệu đa phương thức gồm 30 nghìn tỷ token, qua đó định vị GLM-5.3-Flash như một mô hình mới tập trung vào hiệu quả và năng lực đa phương thức, thay vì chỉ là phiên bản thu nhỏ của GLM-5.3. 4
16
GLM-5.3-Flash kết hợp linear attention và sparse attention. Linear attention nhằm giảm chi phí xử lý các quan hệ trong chuỗi dài, còn sparse attention lựa chọn những tương tác cần độ chính xác cao hơn. Mục tiêu là cân bằng giữa khả năng xử lý ngữ cảnh dài và chi phí suy luận dễ kiểm soát hơn. 4
16
Zhipu còn giới thiệu cơ chế IndexPool để giảm tải bộ nhớ và độ trễ khi lập chỉ mục ở các độ dài ngữ cảnh lớn. Kiến trúc cũng sử dụng manifold-constrained hyper-connections như một biện pháp cải thiện hiệu quả mở rộng. Giá trị thực tế của các kỹ thuật này vẫn phụ thuộc vào cấu hình máy chủ, độ dài chuỗi, phần cứng và loại tác vụ. 4
16
So với GLM-5.3, Zhipu tuyên bố GLM-5.3-Flash giảm 3,01 lần chi phí tính toán attention và 4,44 lần mức sử dụng KV-cache, trong khi vẫn duy trì chất lượng ở ngữ cảnh dài. Đây là những chỉ số đáng chú ý với các nhà phát triển vì attention và KV-cache thường trở thành nút thắt khi tác nhân hoạt động trong thời gian dài. Tuy nhiên, các tỷ lệ này chủ yếu đến từ tài liệu kỹ thuật của Zhipu, chưa nên được hiểu là mức tăng tốc được xác minh độc lập trong mọi môi trường. 4
GLM-5.3-Flash chủ yếu nhắm đến lập trình, lập trình trực quan, tác vụ tác nhân kéo dài và sử dụng công cụ. Khả năng thị giác nguyên bản cho phép tác nhân quan sát giao diện, kết quả hiển thị và phản hồi tương tác, tạo thành vòng lặp giữa mã nguồn, trình duyệt và giao diện đồ họa. 4
Các kết quả benchmark do Zhipu công bố gồm:
Những con số này phù hợp với định hướng lập trình và tác nhân AI của mô hình. Dù vậy, việc so sánh cần thận trọng: benchmark tác nhân có thể thay đổi đáng kể tùy prompt, công cụ, lớp điều phối, phần cứng, giới hạn thời gian và phiên bản bộ đánh giá. Vì thế, các kết quả trên nên được hiểu là số liệu do Zhipu báo cáo, không phải bảng xếp hạng cuối cùng giữa mọi mô hình cạnh tranh. 4
15
Zhipu đã phát hành trọng số GLM-5.3-Flash trên Hugging Face theo giấy phép MIT, bao gồm bản BF16. Tài liệu mô hình cho biết hệ thống có thể được triển khai thông qua các framework phục vụ suy luận như SGLang và vLLM. Điều này cho phép tổ chức thử nghiệm hoặc tự vận hành mô hình thay vì chỉ sử dụng API lưu trữ của Z.ai. 3
6
8
Việc mở trọng số làm thay đổi đáng kể bài toán triển khai. Nhà phát triển có thể kiểm tra mô hình trên kho mã, tài liệu, giao diện trực quan và môi trường tác nhân của chính họ; đội ngũ hạ tầng cũng có thể tự đánh giá chi phí phục vụ và yêu cầu phần cứng.
Tuy nhiên, tổng số 320 tỷ tham số vẫn khiến đây là một dự án kỹ thuật lớn. Thiết kế 18 tỷ tham số được kích hoạt mỗi token giúp giảm lượng tính toán, nhưng không đồng nghĩa toàn bộ checkpoint trở nên nhẹ hoặc dễ chạy trên phần cứng phổ thông.
Thử nghiệm Ox Alpha không chỉ là một chiêu gây chú ý. Nó kiểm tra xem các nhà phát triển có tiếp tục sử dụng và đánh giá cao mô hình khi không biết tên, số lượng tham số hay công ty đứng sau hay không. Người dùng thực tế đã cung cấp workload, lưu lượng và phản hồi trước khi mô hình được công bố, tạo ra một dạng thử nghiệm sản phẩm gần với điều kiện sử dụng hàng ngày. 13
15
Dù vậy, phương pháp này cũng có giới hạn. Quyền truy cập miễn phí có thể tạo ra lượng truy cập bất thường; lời khen công khai có thể chịu ảnh hưởng của yếu tố mới lạ; còn thử nghiệm ẩn danh không kiểm soát chặt prompt hoặc bảo đảm mọi hệ thống được so sánh trong cùng điều kiện.
Kết luận thận trọng nhất là: GLM-5.3-Flash đã tạo được sự quan tâm đáng kể từ cộng đồng phát triển trước khi danh tính được tiết lộ, và Zhipu đã tận dụng đợt thử nghiệm này để thu thập phản hồi thực tế cho màn phát hành chính thức.
GLM-5.3-Flash chính là Ox Alpha—một mô hình GLM mở, đa phương thức nguyên bản, được thiết kế cho lập trình và các tác vụ tác nhân AI hiệu quả hơn. Những thông số nổi bật gồm kiến trúc MoE 320 tỷ tham số tổng cộng và 18 tỷ tham số kích hoạt, 45 lớp, cửa sổ ngữ cảnh khoảng một triệu token, attention lai tuyến tính–thưa và trọng số theo giấy phép MIT. 3
4
11
Điểm đáng chú ý nhất của mô hình không chỉ nằm ở quy mô. Đó là sự kết hợp giữa ngữ cảnh dài, khả năng xử lý hình ảnh, sử dụng công cụ và mức chi phí phục vụ được Zhipu tuyên bố là thấp hơn, trong một mô hình mà nhà phát triển có thể tải xuống và tự vận hành.
Màn thử nghiệm ẩn danh đã mang lại phản hồi người dùng tương đối trực tiếp, nhưng vẫn cần các đánh giá độc lập, có thể tái lập để xác định những tuyên bố về kiến trúc, benchmark và hiệu quả phục vụ chuyển thành hiệu năng sản xuất như thế nào.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ox Alpha chính là GLM 5.3 Flash của Zhipu AI, được xác nhận ngày 26/8/2026 sau đợt thử nghiệm ẩn danh miễn phí bắt đầu từ ngày 20/8.
Ox Alpha chính là GLM 5.3 Flash của Zhipu AI, được xác nhận ngày 26/8/2026 sau đợt thử nghiệm ẩn danh miễn phí bắt đầu từ ngày 20/8. Mô hình hướng đến lập trình, lập trình trực quan, tác vụ tác nhân AI và xử lý ngữ cảnh dài, với cửa sổ khoảng một triệu token, hỗ trợ văn bản, hình ảnh, video, tài liệu trực quan và tệp.
GLM 5.3 Flash có tổng cộng 320 tỷ tham số nhưng chỉ kích hoạt 18 tỷ tham số cho mỗi token; Zhipu tuyên bố kiến trúc attention lai giúp giảm 3,01 lần chi phí tính toán attention và 4,44 lần bộ nhớ KV cache so với GLM 5.3.