
Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s planned Qwen 3.8 Flash Next release, how does its multimodal Mixture of Experts architecture (125 billion total parameters. Article summary: Qwen 3.8 Flash Next is being positioned as an early, open weight developer test of the architecture intended for Qwen 4—not as Alibaba’s finished flagship.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thum
Qwen 3.8-Flash-Next đang được Alibaba giới thiệu như một bản thử nghiệm sớm, có trọng số mở, dành cho nhà phát triển muốn làm quen với kiến trúc dự kiến trở thành nền tảng của Qwen 4 — chứ chưa phải flagship hoàn thiện của hãng. Điểm nhấn là tham vọng đạt năng lực gần nhóm mô hình dẫn đầu với mức chi phí huấn luyện và suy luận thấp hơn đáng kể. Tuy nhiên, hiệu suất, chi phí và thời điểm phát hành vẫn nên được xem là thông tin do nhà cung cấp công bố cho đến khi trọng số, tài liệu kỹ thuật và các đánh giá độc lập xuất hiện. 9
Theo thông tin được công bố, Qwen 3.8-Flash-Next là mô hình đa phương thức sử dụng kiến trúc Mixture-of-Experts (MoE), với tổng cộng 125 tỷ tham số. Con số này bao gồm 51 tỷ tham số embedding N-gram, trong khi chỉ khoảng 6 tỷ tham số được kích hoạt cho mỗi token. 9
Với MoE, mô hình không cần đưa toàn bộ mạng lưới vào xử lý mọi token. Thay vào đó, một bộ định tuyến sẽ chọn một nhóm chuyên gia phù hợp với từng phần dữ liệu — chẳng hạn văn bản, hình ảnh, mã nguồn hoặc thao tác công cụ. Cách làm này cho phép duy trì một “kho” năng lực lớn nhưng chỉ sử dụng một phần nhỏ trong mỗi lượt tính toán.
Về lý thuyết, cơ chế định tuyến thưa có thể giảm nhu cầu tính toán dấu phẩy động, băng thông bộ nhớ và chi phí vận hành so với một mô hình đặc toàn phần có quy mô tổng tương đương. Dù vậy, mức tiết kiệm thực tế còn phụ thuộc vào cách triển khai, phần cứng, độ cân bằng giữa các chuyên gia và chi phí truyền dữ liệu trong hệ thống phục vụ mô hình.
Mã nguồn là lĩnh vực có thể hưởng lợi rõ rệt từ chuyên môn hóa thưa. Các chuyên gia khác nhau có thể học những mẫu riêng cho từng ngôn ngữ lập trình, cấu trúc kho mã, sử dụng công cụ, sửa lỗi, gọi tác tử và xử lý các dự án có ngữ cảnh dài.
Vì vậy, tuyên bố về năng lực “gần nhóm dẫn đầu” với chi phí huấn luyện chỉ khoảng một phần chín Qwen 3.7-Plus nên được hiểu trước hết là mục tiêu hiệu quả đến từ định tuyến thưa, thay đổi kiến trúc và thiết kế embedding. Đây chưa phải bằng chứng cho thấy mô hình sẽ sánh ngang mọi hệ thống đóng hàng đầu trong tất cả bài kiểm tra hoặc quy trình lập trình thực tế.
Các đánh giá độc lập về khả năng viết mã vẫn cần được thực hiện trên nhiều tiêu chuẩn, repo và tình huống sử dụng khác nhau. Một điểm số do chính nhà phát triển công bố không đủ để kết luận về lợi thế toàn diện.
Cách Alibaba đặt tên và mô tả Flash-Next cho thấy đây là một bản phát hành thiên về khả năng tương thích và xây dựng hệ sinh thái. Nhà phát triển có thể dùng bản thử nghiệm để làm quen với:
Việc phát hành sớm cũng giúp Alibaba thu thập phản hồi từ cộng đồng trước khi hoàn thiện dòng Qwen 4. Do đó, phiên bản flagship cuối cùng vẫn có thể được huấn luyện thêm, trải qua quá trình hậu huấn luyện mạnh hơn, mở rộng công tác an toàn, bổ sung các biến thể lớn hơn và được đánh giá chuẩn hóa trước khi ra mắt.
Flash-Next xuất hiện trong bối cảnh Alibaba đang mở rộng nhiều tầng sản phẩm Qwen. Qwen3.8-27B đã được phát hành theo giấy phép Apache 2.0. Đây là mô hình đa phương thức khoảng 27 tỷ tham số, có cửa sổ ngữ cảnh gốc 262.000 token và có thể mở rộng lên 1 triệu token. 6
Ở đầu cao cấp, Qwen3.8-Max là biến thể lớn hơn. Tuy nhiên, các thông tin hiện có cho thấy trọng số của Max sử dụng giấy phép riêng với nhiều hạn chế hơn, thay vì hoàn toàn theo điều khoản Apache 2.0 như phiên bản 27B. 12
Sự phân tách này mang lại cho Alibaba hai lợi ích: mô hình nhỏ hơn có thể được cộng đồng dễ dàng tải xuống, tinh chỉnh và tích hợp; trong khi các năng lực đắt đỏ nhất vẫn giúp hãng duy trì đòn bẩy thương mại đối với khách hàng lớn và dịch vụ đám mây.
Nếu giấy phép của Max hoặc Flash-Next quy định ngưỡng doanh thu, yêu cầu ký thỏa thuận riêng hoặc nghĩa vụ chia sẻ doanh thu khi triển khai thương mại ở quy mô rất lớn, đó sẽ là giới hạn đáng kể đối với cách gọi “trọng số mở”.
Các thông tin hiện có cho thấy Max chịu một số hạn chế về giấy phép, nhưng ngưỡng áp dụng và điều khoản chia sẻ doanh thu cụ thể vẫn cần được đối chiếu với văn bản giấy phép chính thức. Vì vậy, chưa nên xem tuyên bố về nghĩa vụ chia sẻ doanh thu là một sự thật đã được xác lập chỉ dựa trên các bằng chứng hiện có. 12
Với doanh nghiệp, đây không chỉ là vấn đề kỹ thuật. Đội ngũ pháp chế cần kiểm tra chính xác quyền sử dụng, sửa đổi, phân phối, cung cấp dịch vụ và quy mô doanh thu trước khi đưa mô hình vào sản phẩm thương mại.
Các bản phát hành Qwen là một phần trong chiến lược AI toàn diện của Alibaba: cung cấp những mô hình mở hoặc dễ tiếp cận để thu hút nhà phát triển, tạo nhu cầu cho Alibaba Cloud, đồng thời đầu tư vào năng lực tính toán, trung tâm dữ liệu và hạ tầng cần thiết để huấn luyện cũng như phục vụ các hệ thống tiên tiến.
Alibaba cho biết toàn bộ khoản tiền thu được từ đợt phát hành cổ phiếu tại Hong Kong sẽ được dùng cho năng lực AI “full-stack”, tức trải dài từ hạ tầng đến mô hình và các lớp dịch vụ liên quan. 2
Cụ thể, hãng huy động 80 tỷ HKD, tương đương khoảng 10,2 tỷ USD, bằng cách bán 710 triệu cổ phiếu với giá 112,70 HKD mỗi cổ phiếu. 3 Mức giá này thấp hơn 8,4% so với giá đóng cửa phiên trước, trong khi sổ lệnh được cho là nhận khoảng 28 tỷ USD nhu cầu. 4
Đối với cổ đông, bài toán đánh đổi khá rõ: nguồn vốn mới giúp Alibaba đẩy nhanh đầu tư AI, nhưng việc phát hành cổ phiếu mới làm pha loãng tỷ lệ sở hữu và làm tăng rủi ro thực thi. Nếu chi tiêu cho AI không nhanh chóng tạo ra doanh thu từ đám mây, API và ứng dụng, nhà đầu tư có thể phải chờ lâu hơn để thấy hiệu quả tài chính. 4
Trong cuộc cạnh tranh mô hình có trọng số mở tại Trung Quốc, mục tiêu không đơn thuần là đứng đầu một bài benchmark. Các công ty còn muốn giành nhà phát triển, các bản tinh chỉnh hạ nguồn, khối lượng công việc trên đám mây và sự hỗ trợ từ hệ sinh thái công cụ trước các đối thủ như DeepSeek.
Những tham chiếu đến các hệ thống tiềm năng như “Ox Alpha” vẫn mang tính suy đoán nếu chưa đi kèm bản phát hành có thể xác minh, trọng số hoặc báo cáo kỹ thuật từ nguồn chịu trách nhiệm rõ ràng. Tương tự, tuyên bố về hệ sinh thái Qwen gồm hơn 460 mô hình hỗ trợ 119 ngôn ngữ nên được xem là chỉ số về hệ sinh thái do Alibaba đưa ra, không phải thước đo năng lực của riêng một mô hình Qwen.
Cược lớn của Alibaba là các mô hình đa phương thức, thưa và rẻ hơn để huấn luyện có thể giúp hãng cạnh tranh ở cả hai đầu thị trường: phổ biến mô hình mở trong cộng đồng và triển khai cao cấp trên quy mô đám mây.
Nhưng câu hỏi quan trọng vẫn chưa có lời giải: các đánh giá độc lập có xác nhận chất lượng lập trình và lợi thế chi phí huấn luyện hay không? Và các điều khoản giấy phép có cho phép doanh nghiệp lớn sử dụng mô hình mà không làm suy yếu giá trị cốt lõi của khái niệm “mở” hay không?
Cho đến khi những dữ liệu đó xuất hiện, Qwen 3.8-Flash-Next nên được nhìn nhận như một bản xem trước đáng chú ý của hướng đi Qwen 4 — một tín hiệu về tham vọng kiến trúc và chiến lược hệ sinh thái của Alibaba, hơn là bằng chứng cho một cuộc soán ngôi đã hoàn tất.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Qwen 3.8 Flash Next được định vị là bản thử nghiệm open weight dành cho nhà phát triển, nhằm phô diễn kiến trúc dự kiến dùng cho Qwen 4, không phải flagship hoàn thiện.
Qwen 3.8 Flash Next được định vị là bản thử nghiệm open weight dành cho nhà phát triển, nhằm phô diễn kiến trúc dự kiến dùng cho Qwen 4, không phải flagship hoàn thiện. Mô hình được báo cáo có 125 tỷ tham số, trong đó 51 tỷ là tham số embedding N gram, nhưng chỉ kích hoạt khoảng 6 tỷ tham số cho mỗi token.
Alibaba nhấn mạnh năng lực lập trình và mục tiêu đạt hiệu suất gần nhóm dẫn đầu với chi phí huấn luyện khoảng một phần chín Qwen 3.7 Plus; các tuyên bố này vẫn cần được kiểm chứng độc lập.