Ngày 26/8/2026, Z.ai xác nhận Ox Alpha—mô hình từng xuất hiện ẩn danh và miễn phí—chính là GLM 5.3 Flash, với 320 tỷ tham số tổng cộng và 18 tỷ tham số hoạt động mỗi token. GLM 5.3 Flash tiếp nhận văn bản, hình ảnh và video, hỗ trợ khoảng một triệu token ngữ cảnh, dùng trọng số theo giấy phép MIT và có giá niêm yết...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ngày 26/8/2026, Z.ai khép lại một trong những dấu hỏi đáng chú ý nhất của cộng đồng AI: Ox Alpha, mô hình ẩn danh từng được cung cấp qua OpenRouter và OpenCode, chính là GLM-5.3-Flash. Z.ai giới thiệu đây là mô hình đa phương thức nguyên bản đầu tiên trong dòng GLM-5, với trọng số mở, cửa sổ ngữ cảnh một triệu token và định hướng cho lập trình cùng các tác vụ tác tử kéo dài. 1540
Điểm đáng chú ý không chỉ nằm ở danh tính của mô hình. Ox Alpha kết hợp quyền truy cập miễn phí, không gắn thương hiệu với lượng sử dụng lớn từ các nhà phát triển, sau đó mới được chuyển thành một sản phẩm có tên và có thể tải xuống. Cách làm này giúp Z.ai kiểm tra hạ tầng dưới tải thực tế, đồng thời tạo sự quan tâm trước khi công bố chính thức.
GLM-5.3-Flash là mô hình hỗn hợp chuyên gia (Mixture of Experts—MoE), có 320 tỷ tham số tổng cộng nhưng chỉ kích hoạt 18 tỷ tham số cho mỗi token. Mô hình tiếp nhận nguyên bản văn bản, hình ảnh và video, đồng thời tạo đầu ra dạng văn bản. Dung lượng ngữ cảnh được công bố vào khoảng một triệu token; con số hiển thị có thể khác nhau tùy nền tảng: tài liệu Z.ai mô tả thiết kế một triệu token, còn OpenRouter liệt kê cửa sổ 1.310.720 token. 12340
Z.ai phát hành trọng số theo giấy phép MIT, giúp mô hình dễ triển khai hơn đáng kể so với các hệ thống chỉ cho phép truy cập qua API đóng. Sau khi giai đoạn thử nghiệm ẩn danh kết thúc, mô hình cũng xuất hiện trên OpenRouter dưới tên công khai GLM-5.3-Flash. 348
GLM-5.3-Flash không phải là cùng một sản phẩm với GLM-5.3 lớn hơn được công bố trước đó trong tháng 8. Các báo cáo mô tả Flash là một SKU riêng, thuộc cấu hình 320B-A18B và có chi phí thấp hơn, thay vì phiên bản đồng nhất với dòng GLM-5.3 lớn. 10
Z.ai cho biết GLM-5.3-Flash cải thiện năng lực so với GLM-5.2 trong khi giảm chi phí phục vụ. Ở các kết quả được dẫn lại quanh thời điểm ra mắt, mô hình đạt 63,4 điểm trên DeepSWE v1.1, so với 46,2 điểm của GLM-5.2. Z.ai cũng báo cáo 29,0 điểm trên bài kiểm tra lập trình nội bộ, gần mức 29,5 điểm được nêu cho Claude Opus 4.8. 316
Những con số này hữu ích để hiểu vị trí mà Z.ai muốn mô hình chiếm giữ, nhưng chưa phải bằng chứng độc lập cho thấy GLM-5.3-Flash ngang bằng với mô hình của Anthropic. Kết quả còn phụ thuộc vào định nghĩa benchmark, thiết lập đánh giá, cách viết prompt và khả năng tái lập. Kết luận thận trọng nhất là Z.ai đang tuyên bố năng lực lập trình và tác tử mạnh với chi phí thấp hơn nhiều—không phải mô hình đã chắc chắn vượt qua các hệ thống đóng hàng đầu.
Đặc điểm dễ nhận thấy nhất của Ox Alpha là nhà phát triển có thể dùng thử miễn phí trong giai đoạn ẩn danh. Giai đoạn đó kết thúc khi mô hình được công bố danh tính. Giá niêm yết được Z.ai nêu là 0,15 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra. 13
Trong thời điểm ra mắt, OpenRouter hiển thị mức giá khuyến mại thấp hơn là 0,075 USD cho mỗi triệu token đầu vào và 0,25 USD cho mỗi triệu token đầu ra. 2 Cần phân biệt rõ ba điều kiện: bản xem trước miễn phí, giá niêm yết của Z.ai và mức giảm giá riêng trên một nền tảng.
Ngay cả ở mức giá niêm yết, bài toán kinh tế vẫn là điểm hút chính của mô hình. Các coding agent có thể tiêu thụ lượng lớn ngữ cảnh và nội dung đầu ra, vì vậy chi phí token thấp đôi khi ảnh hưởng đến quyết định chọn mô hình không kém một chênh lệch nhỏ trên bảng điểm benchmark.
Z.ai cho biết GLM-5.3-Flash được vận hành hoàn toàn trên các bộ tăng tốc AI do Trung Quốc sản xuất. 15 Các báo cáo về hệ thống phục vụ mô hình mô tả một nền tảng tùy biến dựa trên SGLang, sử dụng nhiều kỹ thuật như lượng tử hóa, song song hóa tensor, các định dạng bộ nhớ đệm hỗn hợp, tách lớp và kiến trúc Encode–Prefill–Decode tách biệt. Mục tiêu được nêu là cải thiện hiệu năng phục vụ đầu-cuối trong điều kiện phần cứng nội địa có những giới hạn riêng. 25
Điều này nối tiếp câu chuyện trước đó của Z.ai về dòng GLM. Công ty từng cho biết họ huấn luyện dòng GLM-5 trên bộ xử lý Huawei Ascend mà không sử dụng phần cứng Nvidia. Các báo cáo cũng lưu ý Z.ai nằm trong Danh sách thực thể của Mỹ, qua đó bị hạn chế tiếp cận các bộ tăng tốc Nvidia H100, H200 và B200. 26
Tuyên bố về hạ tầng có ý nghĩa chiến lược, nhưng nên được đọc như thông tin do công ty và ngành cung cấp, chứ chưa phải một phép so sánh hiệu năng phần cứng đã được kiểm toán đầy đủ. Kết luận chắc chắn hơn là Z.ai đang trình bày một hệ thống có khả năng phục vụ mô hình đa phương thức quy mô lớn mà không phụ thuộc vào các GPU trung tâm dữ liệu hàng đầu của Nvidia.
Cách phát hành ẩn danh cho thấy một chiến lược có chủ đích: tung ra một mô hình đủ năng lực nhưng không gắn tên nhà cung cấp, cho dùng miễn phí qua các kênh lập trình phổ biến, quan sát cách nhà phát triển sử dụng, rồi công bố sản phẩm sau khi đã thu được phản hồi thực tế. Z.ai từng được liên hệ với một thử nghiệm trước đó mang tên “Pony Alpha”, cũng dựa trên ý tưởng tương tự. Trong khi đó, cộng đồng cố truy tìm danh tính Ox Alpha thông qua đặc điểm tokenizer, dấu hiệu xử lý video và các mẫu lỗi API. 71113
Một số bài viết thời điểm ra mắt còn đề cập lượng sử dụng rất lớn và sự hưởng ứng mạnh từ giới phát triển. Tuy nhiên, các tài liệu hiện có không xác minh độc lập mọi con số hoặc phát biểu được trích dẫn. Vì vậy, những thông tin này nên được xem là tường thuật trong giai đoạn phát hành, không phải dữ liệu chấp nhận sản phẩm đã được kiểm toán. 14
GLM-5.3-Flash chưa chứng minh rằng Z.ai đã vượt OpenAI hay Anthropic trên toàn bộ các năng lực của mô hình biên. Điều sản phẩm này cho thấy rõ hơn là một tổ hợp có tính cạnh tranh cao: đầu vào đa phương thức, ngữ cảnh rất dài, trọng số mở theo giấy phép MIT, tối ưu cho coding agent và giá API thấp trong cùng một bản phát hành. 1540
Với nhà phát triển, tổ hợp này có thể làm giảm chi phí chuyển đổi và khiến việc tự triển khai hoặc kết hợp nhiều nhà cung cấp trở nên thực tế hơn. Với các hãng mô hình đóng, đây là thêm một sức ép lên giá và biên lợi nhuận—đặc biệt trong các tác vụ lập trình, nơi khối lượng token, độ trễ, quyền kiểm soát triển khai và khả năng tiếp cận hạ tầng có thể quan trọng không kém vị trí trên bảng xếp hạng.
Nói cách khác, câu chuyện lớn nhất của Ox Alpha không phải là một màn “đánh úp” đơn thuần. Đó là cách Z.ai biến một bản thử nghiệm vô danh thành phép thử quy mô sản xuất, rồi dùng kết quả ấy để ra mắt một mô hình mở, đa phương thức và có chi phí thấp. Nếu chiến thuật này được lặp lại, các phòng thí nghiệm AI sẽ không chỉ phải cạnh tranh bằng điểm benchmark, mà còn bằng cách đưa mô hình đến tay người dùng nhanh, rẻ và dễ triển khai hơn.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ngày 26/8/2026, Z.ai xác nhận Ox Alpha—mô hình từng xuất hiện ẩn danh và miễn phí—chính là GLM 5.3 Flash, với 320 tỷ tham số tổng cộng và 18 tỷ tham số hoạt động mỗi token.
Ngày 26/8/2026, Z.ai xác nhận Ox Alpha—mô hình từng xuất hiện ẩn danh và miễn phí—chính là GLM 5.3 Flash, với 320 tỷ tham số tổng cộng và 18 tỷ tham số hoạt động mỗi token. GLM 5.3 Flash tiếp nhận văn bản, hình ảnh và video, hỗ trợ khoảng một triệu token ngữ cảnh, dùng trọng số theo giấy phép MIT và có giá niêm yết 0,15 USD cho mỗi triệu token đầu vào, 0,50 USD cho mỗi triệu token đầu ra.
Màn ra mắt bí mật cho phép Z.ai đưa mô hình vào các luồng lập trình thực tế trước khi công bố thương hiệu—vừa là bài kiểm tra hạ tầng quy mô lớn, vừa là chiến lược tạo tiếng vang trên thị trường.