Ling 3.0 flash có 124 tỷ tham số tổng, nhưng chỉ kích hoạt khoảng 5,1 tỷ tham số cho mỗi token — điểm then chốt giúp giảm lượng tính toán khi suy luận. Mô hình được định vị cho lập trình, gọi công cụ và quy trình agent tần suất cao; cửa sổ ngữ cảnh gốc là 256K token và có thể mở rộng đến 1 triệu token.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
Khi triển khai AI cho các tác vụ lặp đi lặp lại như viết mã, gọi công cụ hay xử lý từng bước trong quy trình tự động, câu hỏi quan trọng thường không phải là mô hình nào có nhiều tham số nhất. Thực tế hơn, cần hỏi: mô hình nào đạt chất lượng đủ tốt với độ trễ và chi phí suy luận thấp nhất?
Ling-3.0-flash của Ant Group là một ví dụ đáng chú ý cho cách tiếp cận đó. Mô hình có 124 tỷ tham số tổng, nhưng chỉ kích hoạt khoảng 5,1 tỷ tham số trên mỗi token. Ant định vị đây là mô hình suy luận lai tối ưu chi phí cho các tác vụ tần suất cao, với cửa sổ ngữ cảnh gốc 256K token và khả năng mở rộng lên 1 triệu token.
Ling-3.0-flash dùng kiến trúc mixture-of-experts (MoE), hay mô hình hỗn hợp chuyên gia. Thay vì huy động toàn bộ tham số mỗi khi tạo một token, hệ thống định tuyến công việc đến một nhóm nhỏ các “chuyên gia” phù hợp.
Về mặt thực tế, mô hình vẫn lưu giữ một kho năng lực học được lớn, nhưng khối lượng tính toán cho từng lần sinh đầu ra nhỏ hơn nhiều. Ant cho biết Ling-3.0-flash chỉ bằng khoảng 12,4% số tham số tổng và 8,1% số tham số kích hoạt của mô hình Ring-2.6-1T thuộc nhóm 1 nghìn tỷ tham số. Tài liệu phát hành cũng mô tả kiến trúc attention tuyến tính lai, xen kẽ các lớp KDA và MLA, kết hợp định tuyến MoE thưa.
Điều này không có nghĩa tổng số tham số trở nên vô nghĩa. Quy mô tổng vẫn ảnh hưởng đến lượng tri thức và mẫu hình mà mô hình có thể biểu diễn; chất lượng định tuyến cũng quyết định MoE có khai thác được tiềm năng đó hay không. Tuy nhiên, kích hoạt thưa làm thay đổi bài toán kinh tế: tốc độ và chi phí phục vụ gắn chặt hơn với lượng tham số cùng phép tính attention thực sự dùng cho từng token, thay vì toàn bộ trọng số được lưu trong mô hình.
Ant cho biết Ling-3.0-flash ngang bằng hoặc vượt Ring-2.6-1T trong phần lớn so sánh benchmark mà hãng công bố. Tài khoản Ling của Ant trên X cũng mô tả mô hình này có thể sánh bằng hoặc vượt mẫu 1T của hãng trên đa số benchmark, dù chỉ dùng xấp xỉ một phần tám số tham số tổng và một phần mười hai số tham số kích hoạt.
Đây là một so sánh nội bộ đáng quan tâm, nhất là khi mô hình được thiết kế rõ ràng cho khối lượng công việc AI agent trong môi trường vận hành. Nhưng đây không phải bằng chứng rằng Ling-3.0-flash tốt hơn mọi mô hình đa dụng lớn hơn trong mọi tác vụ.
Ba lưu ý quan trọng là:
Vì thế, đội ngũ kỹ thuật nên thử trên khối lượng công việc đại diện của mình: schema công cụ thật, ngữ cảnh kho mã, yêu cầu độ trễ, hành vi thử lại và chi phí khi mô hình mắc lỗi.
Trang mô hình nêu các đánh giá như SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas và SkillsBench. Ling-3.0-flash cũng được liệt kê là dùng tốt với những môi trường hướng agent như Claude Code, Kilo Code, Qwen Code, Hermes Agent và OpenClaw. 1
Đây là các mục tiêu hợp lý vì một hệ thống agent có thể tiêu thụ lượng token rất lớn. Một quy trình đọc tệp, gọi công cụ, nhận kết quả, sửa kế hoạch rồi thử lại thường dùng nhiều token hơn đáng kể so với một lượt chatbot trả lời đơn lẻ. Trong bối cảnh đó, một mô hình rẻ hơn nhưng xử lý ổn định các bước thực thi thường ngày có thể giá trị hơn việc dùng mô hình đa dụng đắt tiền ở mọi lượt.
Một kiến trúc triển khai hợp lý có thể là phân tầng:
Ant công bố cửa sổ ngữ cảnh gốc 256K token, có thể mở rộng đến 1 triệu token. Điều này có thể hữu ích khi làm việc với kho mã lớn, lịch sử gọi công cụ dài hoặc trạng thái làm việc cần duy trì lâu.
Trên OpenRouter, cửa sổ ngữ cảnh được phục vụ cho mô hình là 262.144 token. 6
Dù vậy, ngữ cảnh dài không nên bị đồng nhất với năng lực đa agent đã được kiểm chứng. Nó có thể giúp lưu giữ thông tin chung xuyên suốt quy trình, nhưng một hệ thống đa agent đáng tin cậy còn phụ thuộc vào điều phối, thiết kế bộ nhớ, quyền truy cập công cụ, cơ chế bàn giao và đánh giá. Các nguồn hiện có ủng hộ thông số ngữ cảnh dài cùng định vị hướng agent, chứ chưa lượng hóa lợi thế của Ling-3.0-flash trong triển khai đa agent so với đối thủ.
Ling-3.0-flash được giới thiệu ngày 24/7/2026. Theo bài đăng phát hành của Ant, API được mở miễn phí có thời hạn trên OpenRouter và nền tảng của Ant đến ngày 3/8. Mô hình cũng có mặt trên Hugging Face, nơi dự án nhấn mạnh các benchmark và framework dành cho agent. 1
OpenRouter niêm yết mức giá 0,021 USD cho một triệu token đầu vào và 0,063 USD cho một triệu token đầu ra, với ngữ cảnh 262.144 token. 6 Mức giá này giúp việc thử nghiệm trên quy trình khối lượng lớn trở nên khả thi hơn, dù chi phí thực tế, độ trễ, mức sẵn sàng và chất lượng đầu ra vẫn có thể khác theo nhà cung cấp cùng điều kiện triển khai.
Trang khám phá mô hình của OpenRouter xếp Ling-3.0-flash theo các phân vị riêng: 49 cho năng lực tổng quát, 56 cho coding và 54 cho agentic. 12 Điều đó cũng cho thấy vì sao một xếp hạng tiêu đề duy nhất không đủ để đánh giá một mô hình tập trung vào tác vụ thực thi.
Thời điểm phát hành trùng với bài đăng đầu tiên của Jensen Huang trên X. CEO Nvidia chia sẻ một bức thư lập luận rằng các mô hình mở củng cố an toàn và an ninh mạng, thúc đẩy đổi mới, phổ biến công nghệ và hỗ trợ chủ quyền công nghệ, bên cạnh các mô hình biên đóng.
Sự trùng hợp này khiến Ling-3.0-flash trở thành ví dụ phù hợp cho tranh luận về AI open-weight: khi trọng số mô hình được cung cấp, nhà phát triển có thêm khả năng kiểm tra, tự lưu trữ, tinh chỉnh và tích hợp trực tiếp. Tuy nhiên, hai sự kiện không chứng minh có quan hệ đối tác hay kết nối kỹ thuật giữa Nvidia và Ant Group.
Ling-3.0-flash thuyết phục nhất khi được xem là minh họa cho chiến lược mô hình thực thi tối ưu theo chi phí. MoE thưa có thể kết hợp năng lực được lưu trữ rộng với số tham số kích hoạt trên mỗi token thấp hơn nhiều, từ đó có tiềm năng khiến các vòng lặp agent diễn ra thường xuyên nhanh và rẻ hơn.
Các tuyên bố hiệu năng vẫn cần được tái lập độc lập, và mô hình này không nên được coi là sự thay thế phổ quát cho những hệ thống đa dụng lớn nhất. Dù vậy, các thông số kỹ thuật, định hướng đánh giá cho agent, ngữ cảnh dài và mức giá API niêm yết thấp là những lý do đáng cân nhắc để thử nghiệm các mô hình MoE chuyên biệt ở nơi chi phí suy luận và độ trễ là ràng buộc trọng yếu. 1
6
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ling 3.0 flash có 124 tỷ tham số tổng, nhưng chỉ kích hoạt khoảng 5,1 tỷ tham số cho mỗi token — điểm then chốt giúp giảm lượng tính toán khi suy luận.
Ling 3.0 flash có 124 tỷ tham số tổng, nhưng chỉ kích hoạt khoảng 5,1 tỷ tham số cho mỗi token — điểm then chốt giúp giảm lượng tính toán khi suy luận. Mô hình được định vị cho lập trình, gọi công cụ và quy trình agent tần suất cao; cửa sổ ngữ cảnh gốc là 256K token và có thể mở rộng đến 1 triệu token.
Các tuyên bố vượt hoặc ngang Ring 2.6 1T chủ yếu đến từ đánh giá do Ant công bố, vì vậy doanh nghiệp vẫn cần kiểm thử bằng dữ liệu và quy trình thực tế.