Alibaba đưa Qwen3.8 Flash lên QwenCloud với giá 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra, trong khi Flash Next là bản xem trước kiến trúc Qwen4 dưới dạng open weight. Flash Next có mô hình chính 125 tỷ tham số, thêm 51 tỷ tham số ở lớp embedding N gram nhưng chỉ kích hoạt 6 tỷ tham...
Đăng bởiBiên tập bằng GPT-5.6 LunaHình ảnh được tạo bằng GPT Image 1.5
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Alibaba đang triển khai Qwen3.8-Flash theo hai hướng bổ trợ nhau: Qwen3.8-Flash là mô hình đa phương thức dành cho môi trường sản xuất, cung cấp qua QwenCloud với mức giá rất thấp; còn Qwen3.8-Flash-Next là bản open-weight, tức công khai trọng số, nhằm hé lộ kiến trúc mà Alibaba định sử dụng cho gia đình Qwen4 trong tương lai. 5
15
Đây không chỉ là một lần ra mắt mô hình mới. Alibaba đang dùng dịch vụ suy luận giá rẻ để thu hút khối lượng công việc doanh nghiệp, đồng thời dùng trọng số mở để khuyến khích lập trình viên thử nghiệm, xây công cụ và làm quen với kiến trúc Qwen4. Tuy nhiên, phần lớn số liệu về chi phí và hiệu năng hiện vẫn đến từ Alibaba hoặc model card của hãng, thay vì các đánh giá độc lập.
Alibaba mô tả Qwen3.8-Flash là mô hình đa phương thức dạng mixture-of-experts (MoE), được tối ưu cho lập trình, công việc văn phòng và các tác vụ cần xử lý ngữ cảnh dài. Mô hình có cửa sổ ngữ cảnh mặc định 262.144 token, có thể mở rộng lên 1 triệu token để xử lý tệp lớn, hội thoại dài hoặc tài liệu nghiên cứu. 5
15
Mức giá được công bố trên QwenCloud là 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra. Alibaba cho biết API dành cho môi trường sản xuất sẽ sớm được cung cấp; các báo cáo sau đó mô tả QwenCloud đang phục vụ mô hình ở mức giá này. 4
15
Với mức giá trên, Flash được định vị không chỉ như một mô hình AI mà còn như một sản phẩm hạ tầng. Các nhà phát triển có thể thử nghiệm xử lý tài liệu, tác nhân lập trình và những quy trình có sản lượng token lớn mà không phải trả mức phí thường thấy ở các mô hình tiên tiến.
Flash-Next không đơn thuần là một gói API khác. Đây là mô hình open-weight được phát hành để giới thiệu trước các ý tưởng kiến trúc dành cho Qwen4. Thông tin trong kho mô hình nêu một mô hình chính 125 tỷ tham số, thêm 51 tỷ tham số ở embedding N-gram và chỉ 6 tỷ tham số được kích hoạt cho mỗi token.
Đây là thiết kế MoE thưa: mô hình chứa một kho tham số rất lớn, nhưng mỗi token chỉ sử dụng một phần nhỏ trong số đó. Về lý thuyết, cách làm này có thể giảm lượng tính toán cho từng token, đồng thời duy trì năng lực tổng thể cao hơn so với một mô hình đặc cùng quy mô.
Model card cho biết Flash-Next hỗ trợ tự nhiên 262.144 token, có thể mở rộng lên 1 triệu token bằng kỹ thuật YaRN. 13 Do Flash và Flash-Next là hai bản phát hành khác nhau, người dùng vẫn nên kiểm tra giới hạn chính xác, cách phục vụ và yêu cầu bộ nhớ trong tài liệu triển khai của phiên bản mình định sử dụng.
| Đặc điểm | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Vai trò | Mô hình sản xuất chạy trên đám mây | Bản xem trước kiến trúc open-weight cho Qwen4 |
| Ứng dụng chính | Đa phương thức, lập trình, văn phòng và tác vụ tác nhân | Lập trình đa phương thức, công việc văn phòng và tác vụ tác nhân dài hạn |
| Ngữ cảnh | Mặc định 262.144 token, có thể mở rộng lên 1 triệu | Tự nhiên 262.144 token, được báo cáo có thể mở rộng lên 1 triệu bằng YaRN |
| Giá API | 0,16 USD/một triệu token đầu vào; 0,47 USD/một triệu token đầu ra | Chưa có giá API Alibaba cho bản trọng số mở |
| Kiến trúc | Alibaba định vị dòng Flash là MoE đa phương thức | 125 tỷ tham số mô hình chính, 51 tỷ tham số embedding N-gram, 6 tỷ tham số kích hoạt mỗi token |
| Thời điểm | API sản xuất trên QwenCloud được công bố sẽ phát hành | Trọng số và thông tin model card xuất hiện vào cuối tháng 8/2026 |
Kho mô hình và tài liệu của Flash-Next xuất hiện trước hoặc cùng thời điểm Alibaba công bố API sản xuất. Điều này cho phép nhà phát triển xem trước kiến trúc trong lúc hãng chuẩn bị dịch vụ đám mây. 7
Alibaba cho biết dòng Flash chỉ cần khoảng một phần chín chi phí huấn luyện so với Qwen3.7-Plus, đồng thời cải thiện hiệu năng, đặc biệt ở các tác vụ lập trình và văn phòng. 5
15
Đây là một tuyên bố lớn nhưng nên được xem là số liệu do doanh nghiệp công bố, chưa phải nghiên cứu chi phí được kiểm toán độc lập. Chi phí huấn luyện còn phụ thuộc vào giá phần cứng, thời gian chạy, chuẩn bị dữ liệu, các lần huấn luyện thất bại và phương pháp hạch toán.
Dù vậy, kiến trúc thưa tạo ra cơ sở kỹ thuật hợp lý cho việc Alibaba nhấn mạnh hiệu quả. Chỉ một phần tham số được kích hoạt ở mỗi token có thể giúp giảm lượng tính toán trong cả huấn luyện lẫn suy luận. Với khách hàng, sự khác biệt rất thực tế: giá API là con số có thể dùng ngay để lập ngân sách, còn tuyên bố “một phần chín” nên được coi là tín hiệu chiến lược cho đến khi có phép đo bên ngoài để đối chiếu.
Model card của Flash-Next công bố các kết quả sau:
Trong bảng so sánh do model card tái hiện, Flash-Next đạt điểm cao hơn kết quả được liệt kê của Claude Opus 4.6 Max ở SWE-bench Pro, SWE-bench Multilingual, CoWorkBench và JobBench. Chẳng hạn, SWE-bench Pro là 62,5 so với 53,4, còn SWE-bench Multilingual là 81,0 so với 77,5.
Các số liệu này cho thấy Flash-Next có triển vọng ở kỹ thuật phần mềm và các tác vụ tác nhân trong môi trường công sở. Tuy nhiên, chúng không chứng minh Flash-Next luôn tốt hơn Claude hay mọi hệ thống AI tiên tiến khác. Các con số do nhà cung cấp công bố, thiết lập đánh giá có thể khác nhau, và kết quả của Flash-Next không nên mặc nhiên được xem là kết quả của mọi phiên bản Qwen3.8-Flash chạy trong môi trường sản xuất.
Các nguồn mô tả Flash-Next là mô hình open-weight. Một bản tóm tắt công bố giấy phép qwen-community-1.0, nhưng nhà phát triển nên kiểm tra giấy phép hiện hành trong kho chính thức và model card trước khi phân phối thương mại, tinh chỉnh hoặc triển khai dịch vụ. 6
“Open-weight” không đồng nghĩa với việc mọi hình thức sử dụng đều không bị hạn chế. Giấy phép có thể quy định về phân phối lại, ghi công, sử dụng hợp lệ hoặc các mô hình phái sinh. Dữ liệu hiện có chưa đủ để kết luận rộng hơn về quyền thương mại đối với mọi thành phần của bản phát hành.
Việc ra mắt Qwen3.8-Flash diễn ra trong bối cảnh Alibaba đang tăng mạnh đầu tư cho hạ tầng AI. Reuters đưa tin doanh thu đám mây theo quý tăng 45%, trong khi chi tiêu vốn tăng 75% và lợi nhuận ròng theo quý giảm 75%. 18
Reuters cũng đưa tin Alibaba đang huy động 10 tỷ USD thông qua đợt phát hành cổ phiếu tại Hong Kong để tài trợ cho tham vọng AI. Những con số này cho thấy sự đánh đổi rõ ràng: nhu cầu điện toán đám mây và AI đang tăng, nhưng chi phí xây dựng năng lực tính toán gây áp lực tức thời lên lợi nhuận và dòng tiền.
Trong bối cảnh đó, giá suy luận thấp có thể mang lại lợi ích chiến lược ngay cả khi biên lợi nhuận mô hình bị thu hẹp. Mức phí rẻ giúp tăng công suất sử dụng hạ tầng Alibaba, thu hút khối lượng công việc doanh nghiệp và biến Qwen thành lựa chọn đáng cân nhắc cho các ứng dụng xử lý ngữ cảnh dài.
Flash-Next giúp Alibaba tiếp cận cộng đồng ngoài API của chính hãng. Nhà phát triển có thể tải xuống, thử nghiệm, điều chỉnh hoặc tự vận hành mô hình, từ đó làm quen với công cụ và kiến trúc Qwen mà chưa cần lập tức cam kết với QwenCloud.
Cách phân phối này có thể hỗ trợ Alibaba theo bốn hướng:
Các nguồn hiện có ủng hộ cách hiểu đây là một chiến lược, nhưng chưa chứng minh Qwen đã giành được hệ sinh thái nhà phát triển tại Trung Quốc. Không có số liệu hiện tại đã được xác minh về lượng nhà phát triển, lượt tải xuống hay số doanh nghiệp triển khai Qwen.
Qwen3.8-Flash và Flash-Next nên được nhìn nhận như hai mảnh ghép của cùng một chiến lược. Flash là dịch vụ đám mây giá thấp, hỗ trợ ngữ cảnh dài; Flash-Next là công cụ xây dựng hệ sinh thái và bản thử nghiệm kiến trúc hướng tới Qwen4.
Sự kết hợp giữa giá đầu vào 0,16 USD, ngữ cảnh lên tới 1 triệu token, kiến trúc lớn nhưng chỉ 6 tỷ tham số được kích hoạt mỗi token, cùng các benchmark lập trình và tác vụ tác nhân do nhà cung cấp công bố khiến đợt phát hành này đáng chú ý với những nhà phát triển quan tâm đến kinh tế học của AI. 4
Dù vậy, các giới hạn bằng chứng vẫn rất quan trọng: không nên đánh đồng bản sản xuất với bản xem trước; tuyên bố về chi phí huấn luyện chưa được kiểm toán độc lập; benchmark do Alibaba công bố không phải đánh giá trung lập; và mức độ chấp nhận của thị trường chưa thể định lượng từ các nguồn hiện có.
Alibaba đang nổi lên như một đối thủ có nguồn lực và định hướng dài hạn trong cuộc đua AI tại Trung Quốc, nhưng chưa thể gọi là bên dẫn đầu không có đối thủ. Việc công ty chấp nhận đầu tư lớn cho thấy Qwen được xem là một canh bạc dài hạn về đám mây và hệ sinh thái, thay vì một nguồn lợi nhuận ngắn hạn. 18
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Alibaba đưa Qwen3.8 Flash lên QwenCloud với giá 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra, trong khi Flash Next là bản xem trước kiến trúc Qwen4 dưới dạng open weight.
Alibaba đưa Qwen3.8 Flash lên QwenCloud với giá 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra, trong khi Flash Next là bản xem trước kiến trúc Qwen4 dưới dạng open weight. Flash Next có mô hình chính 125 tỷ tham số, thêm 51 tỷ tham số ở lớp embedding N gram nhưng chỉ kích hoạt 6 tỷ tham số cho mỗi token, hướng tới giảm chi phí suy luận.
Alibaba tuyên bố dòng Flash chỉ cần khoảng một phần chín chi phí huấn luyện của Qwen3.7 Plus, song con số này chưa được kiểm chứng độc lập.
Alibaba đưa Qwen3.8 Flash lên QwenCloud với giá 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra, trong khi Flash Next là bản xem trước kiến trúc Qwen4 dưới dạng open weight. Flash Next có mô hình chính 125 tỷ tham số, thêm 51 tỷ tham số ở lớp embedding N gram nhưng chỉ kích hoạt 6 tỷ tham...
Đăng bởiBiên tập bằng GPT-5.6 LunaHình ảnh được tạo bằng GPT Image 1.5
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Alibaba đang triển khai Qwen3.8-Flash theo hai hướng bổ trợ nhau: Qwen3.8-Flash là mô hình đa phương thức dành cho môi trường sản xuất, cung cấp qua QwenCloud với mức giá rất thấp; còn Qwen3.8-Flash-Next là bản open-weight, tức công khai trọng số, nhằm hé lộ kiến trúc mà Alibaba định sử dụng cho gia đình Qwen4 trong tương lai. 5
15
Đây không chỉ là một lần ra mắt mô hình mới. Alibaba đang dùng dịch vụ suy luận giá rẻ để thu hút khối lượng công việc doanh nghiệp, đồng thời dùng trọng số mở để khuyến khích lập trình viên thử nghiệm, xây công cụ và làm quen với kiến trúc Qwen4. Tuy nhiên, phần lớn số liệu về chi phí và hiệu năng hiện vẫn đến từ Alibaba hoặc model card của hãng, thay vì các đánh giá độc lập.
Alibaba mô tả Qwen3.8-Flash là mô hình đa phương thức dạng mixture-of-experts (MoE), được tối ưu cho lập trình, công việc văn phòng và các tác vụ cần xử lý ngữ cảnh dài. Mô hình có cửa sổ ngữ cảnh mặc định 262.144 token, có thể mở rộng lên 1 triệu token để xử lý tệp lớn, hội thoại dài hoặc tài liệu nghiên cứu. 5
15
Mức giá được công bố trên QwenCloud là 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra. Alibaba cho biết API dành cho môi trường sản xuất sẽ sớm được cung cấp; các báo cáo sau đó mô tả QwenCloud đang phục vụ mô hình ở mức giá này. 4
15
Với mức giá trên, Flash được định vị không chỉ như một mô hình AI mà còn như một sản phẩm hạ tầng. Các nhà phát triển có thể thử nghiệm xử lý tài liệu, tác nhân lập trình và những quy trình có sản lượng token lớn mà không phải trả mức phí thường thấy ở các mô hình tiên tiến.
Flash-Next không đơn thuần là một gói API khác. Đây là mô hình open-weight được phát hành để giới thiệu trước các ý tưởng kiến trúc dành cho Qwen4. Thông tin trong kho mô hình nêu một mô hình chính 125 tỷ tham số, thêm 51 tỷ tham số ở embedding N-gram và chỉ 6 tỷ tham số được kích hoạt cho mỗi token.
Đây là thiết kế MoE thưa: mô hình chứa một kho tham số rất lớn, nhưng mỗi token chỉ sử dụng một phần nhỏ trong số đó. Về lý thuyết, cách làm này có thể giảm lượng tính toán cho từng token, đồng thời duy trì năng lực tổng thể cao hơn so với một mô hình đặc cùng quy mô.
Model card cho biết Flash-Next hỗ trợ tự nhiên 262.144 token, có thể mở rộng lên 1 triệu token bằng kỹ thuật YaRN. 13 Do Flash và Flash-Next là hai bản phát hành khác nhau, người dùng vẫn nên kiểm tra giới hạn chính xác, cách phục vụ và yêu cầu bộ nhớ trong tài liệu triển khai của phiên bản mình định sử dụng.
| Đặc điểm | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Vai trò | Mô hình sản xuất chạy trên đám mây | Bản xem trước kiến trúc open-weight cho Qwen4 |
| Ứng dụng chính | Đa phương thức, lập trình, văn phòng và tác vụ tác nhân | Lập trình đa phương thức, công việc văn phòng và tác vụ tác nhân dài hạn |
| Ngữ cảnh | Mặc định 262.144 token, có thể mở rộng lên 1 triệu | Tự nhiên 262.144 token, được báo cáo có thể mở rộng lên 1 triệu bằng YaRN |
| Giá API | 0,16 USD/một triệu token đầu vào; 0,47 USD/một triệu token đầu ra | Chưa có giá API Alibaba cho bản trọng số mở |
| Kiến trúc | Alibaba định vị dòng Flash là MoE đa phương thức | 125 tỷ tham số mô hình chính, 51 tỷ tham số embedding N-gram, 6 tỷ tham số kích hoạt mỗi token |
| Thời điểm | API sản xuất trên QwenCloud được công bố sẽ phát hành | Trọng số và thông tin model card xuất hiện vào cuối tháng 8/2026 |
Kho mô hình và tài liệu của Flash-Next xuất hiện trước hoặc cùng thời điểm Alibaba công bố API sản xuất. Điều này cho phép nhà phát triển xem trước kiến trúc trong lúc hãng chuẩn bị dịch vụ đám mây. 7
Alibaba cho biết dòng Flash chỉ cần khoảng một phần chín chi phí huấn luyện so với Qwen3.7-Plus, đồng thời cải thiện hiệu năng, đặc biệt ở các tác vụ lập trình và văn phòng. 5
15
Đây là một tuyên bố lớn nhưng nên được xem là số liệu do doanh nghiệp công bố, chưa phải nghiên cứu chi phí được kiểm toán độc lập. Chi phí huấn luyện còn phụ thuộc vào giá phần cứng, thời gian chạy, chuẩn bị dữ liệu, các lần huấn luyện thất bại và phương pháp hạch toán.
Dù vậy, kiến trúc thưa tạo ra cơ sở kỹ thuật hợp lý cho việc Alibaba nhấn mạnh hiệu quả. Chỉ một phần tham số được kích hoạt ở mỗi token có thể giúp giảm lượng tính toán trong cả huấn luyện lẫn suy luận. Với khách hàng, sự khác biệt rất thực tế: giá API là con số có thể dùng ngay để lập ngân sách, còn tuyên bố “một phần chín” nên được coi là tín hiệu chiến lược cho đến khi có phép đo bên ngoài để đối chiếu.
Model card của Flash-Next công bố các kết quả sau:
Trong bảng so sánh do model card tái hiện, Flash-Next đạt điểm cao hơn kết quả được liệt kê của Claude Opus 4.6 Max ở SWE-bench Pro, SWE-bench Multilingual, CoWorkBench và JobBench. Chẳng hạn, SWE-bench Pro là 62,5 so với 53,4, còn SWE-bench Multilingual là 81,0 so với 77,5.
Các số liệu này cho thấy Flash-Next có triển vọng ở kỹ thuật phần mềm và các tác vụ tác nhân trong môi trường công sở. Tuy nhiên, chúng không chứng minh Flash-Next luôn tốt hơn Claude hay mọi hệ thống AI tiên tiến khác. Các con số do nhà cung cấp công bố, thiết lập đánh giá có thể khác nhau, và kết quả của Flash-Next không nên mặc nhiên được xem là kết quả của mọi phiên bản Qwen3.8-Flash chạy trong môi trường sản xuất.
Các nguồn mô tả Flash-Next là mô hình open-weight. Một bản tóm tắt công bố giấy phép qwen-community-1.0, nhưng nhà phát triển nên kiểm tra giấy phép hiện hành trong kho chính thức và model card trước khi phân phối thương mại, tinh chỉnh hoặc triển khai dịch vụ. 6
“Open-weight” không đồng nghĩa với việc mọi hình thức sử dụng đều không bị hạn chế. Giấy phép có thể quy định về phân phối lại, ghi công, sử dụng hợp lệ hoặc các mô hình phái sinh. Dữ liệu hiện có chưa đủ để kết luận rộng hơn về quyền thương mại đối với mọi thành phần của bản phát hành.
Việc ra mắt Qwen3.8-Flash diễn ra trong bối cảnh Alibaba đang tăng mạnh đầu tư cho hạ tầng AI. Reuters đưa tin doanh thu đám mây theo quý tăng 45%, trong khi chi tiêu vốn tăng 75% và lợi nhuận ròng theo quý giảm 75%. 18
Reuters cũng đưa tin Alibaba đang huy động 10 tỷ USD thông qua đợt phát hành cổ phiếu tại Hong Kong để tài trợ cho tham vọng AI. Những con số này cho thấy sự đánh đổi rõ ràng: nhu cầu điện toán đám mây và AI đang tăng, nhưng chi phí xây dựng năng lực tính toán gây áp lực tức thời lên lợi nhuận và dòng tiền.
Trong bối cảnh đó, giá suy luận thấp có thể mang lại lợi ích chiến lược ngay cả khi biên lợi nhuận mô hình bị thu hẹp. Mức phí rẻ giúp tăng công suất sử dụng hạ tầng Alibaba, thu hút khối lượng công việc doanh nghiệp và biến Qwen thành lựa chọn đáng cân nhắc cho các ứng dụng xử lý ngữ cảnh dài.
Flash-Next giúp Alibaba tiếp cận cộng đồng ngoài API của chính hãng. Nhà phát triển có thể tải xuống, thử nghiệm, điều chỉnh hoặc tự vận hành mô hình, từ đó làm quen với công cụ và kiến trúc Qwen mà chưa cần lập tức cam kết với QwenCloud.
Cách phân phối này có thể hỗ trợ Alibaba theo bốn hướng:
Các nguồn hiện có ủng hộ cách hiểu đây là một chiến lược, nhưng chưa chứng minh Qwen đã giành được hệ sinh thái nhà phát triển tại Trung Quốc. Không có số liệu hiện tại đã được xác minh về lượng nhà phát triển, lượt tải xuống hay số doanh nghiệp triển khai Qwen.
Qwen3.8-Flash và Flash-Next nên được nhìn nhận như hai mảnh ghép của cùng một chiến lược. Flash là dịch vụ đám mây giá thấp, hỗ trợ ngữ cảnh dài; Flash-Next là công cụ xây dựng hệ sinh thái và bản thử nghiệm kiến trúc hướng tới Qwen4.
Sự kết hợp giữa giá đầu vào 0,16 USD, ngữ cảnh lên tới 1 triệu token, kiến trúc lớn nhưng chỉ 6 tỷ tham số được kích hoạt mỗi token, cùng các benchmark lập trình và tác vụ tác nhân do nhà cung cấp công bố khiến đợt phát hành này đáng chú ý với những nhà phát triển quan tâm đến kinh tế học của AI. 4
Dù vậy, các giới hạn bằng chứng vẫn rất quan trọng: không nên đánh đồng bản sản xuất với bản xem trước; tuyên bố về chi phí huấn luyện chưa được kiểm toán độc lập; benchmark do Alibaba công bố không phải đánh giá trung lập; và mức độ chấp nhận của thị trường chưa thể định lượng từ các nguồn hiện có.
Alibaba đang nổi lên như một đối thủ có nguồn lực và định hướng dài hạn trong cuộc đua AI tại Trung Quốc, nhưng chưa thể gọi là bên dẫn đầu không có đối thủ. Việc công ty chấp nhận đầu tư lớn cho thấy Qwen được xem là một canh bạc dài hạn về đám mây và hệ sinh thái, thay vì một nguồn lợi nhuận ngắn hạn. 18
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Alibaba đưa Qwen3.8 Flash lên QwenCloud với giá 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra, trong khi Flash Next là bản xem trước kiến trúc Qwen4 dưới dạng open weight.
Alibaba đưa Qwen3.8 Flash lên QwenCloud với giá 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra, trong khi Flash Next là bản xem trước kiến trúc Qwen4 dưới dạng open weight. Flash Next có mô hình chính 125 tỷ tham số, thêm 51 tỷ tham số ở lớp embedding N gram nhưng chỉ kích hoạt 6 tỷ tham số cho mỗi token, hướng tới giảm chi phí suy luận.
Alibaba tuyên bố dòng Flash chỉ cần khoảng một phần chín chi phí huấn luyện của Qwen3.7 Plus, song con số này chưa được kiểm chứng độc lập.