阿里巴巴將 Qwen3.8 Flash 定位為雲端生產模型,QwenCloud 價格為每百萬輸入 Token 0.16 美元、每百萬輸出 Token 0.47 美元;Flash Next 則是面向 Qwen4 的開放權重架構預覽。 Flash Next 的主模型包含 125B 參數,另有 51B N gram 嵌入參數,但每個 Token 僅啟用 6B 參數,目標是在維持大模型容量的同時降低推論成本。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
阿里巴巴旗下 Qwen 團隊此次推出兩個名稱相近、任務卻不同的版本:Qwen3.8-Flash 是面向生產環境的多模態模型,透過 QwenCloud 以極低 Token 價格提供服務;Qwen3.8-Flash-Next 則是開放權重版本,用來展示阿里巴巴為未來 Qwen4 家族規劃的架構方向。515
這兩款模型放在一起看,策略十分清楚:阿里巴巴希望用低價託管推論吸引企業工作負載,同時透過開放權重培養開發者採用、工具支援與對 Qwen4 架構的熟悉度。不過,文中多項效能與成本數據來自阿里巴巴或其模型卡,尚不能視為獨立測試結論。
阿里巴巴將 Qwen3.8-Flash 描述為多模態混合專家模型(Mixture of Experts,MoE),用途涵蓋程式設計、辦公室工作與長上下文任務。公司表示,模型預設上下文視窗為 262,144 Tokens,並可擴展至 100 萬 Tokens,以處理大型檔案、長篇對話與研究工作流。515
QwenCloud 公布的價格為:每百萬輸入 Tokens 0.16 美元、每百萬輸出 Tokens 0.47 美元。阿里巴巴當時表示生產 API 即將推出,後續報導則稱 QwenCloud 已按這一價格提供模型服務。415
這個定價讓 Flash 不只是一次模型發布,也是一項基礎設施產品。按照這個費率,開發者可以更低成本地測試文件處理、程式設計代理與大量資料工作流,而不必承擔前沿級模型通常較高的推論費用。
Flash-Next 並不是另一個單純的 API 方案,而是用來預覽 Qwen4 架構的開放權重模型。模型儲存庫列出 1250 億參數的主模型、額外 510 億個 N-gram 嵌入參數,以及每個 Token 僅啟用 60 億參數。
這是一種稀疏混合專家架構:模型保有龐大的參數池,但處理每個 Token 時只動用其中一小部分。理論上,這能降低每個 Token 的計算量,同時保留高於同規模稠密模型的容量上限。
模型卡相關資料顯示,Flash-Next 原生支援 262,144 Tokens 的上下文視窗,使用 YaRN 後可延伸至 100 萬 Tokens。13 由於 Flash 與 Flash-Next 是不同發布版本,開發者仍應按照實際部署版本的文件,確認上下文上限、服務行為與記憶體需求。
| 特性 | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 主要定位 | 雲端生產模型 | 面向 Qwen4 的開放權重架構預覽 |
| 模態與用途 | 多模態程式設計、辦公室與代理工作流 | 多模態程式設計、長時間代理任務 |
| 上下文 | 預設 262,144 Tokens,可擴展至 100 萬 | 原生 262,144 Tokens;據報使用 YaRN 可擴展至 100 萬 |
| 託管價格 | 每百萬輸入 Tokens 0.16 美元;每百萬輸出 Tokens 0.47 美元 | 開放權重版本尚未確立阿里巴巴 API 價格 |
| 主要架構數據 | 阿里巴巴將 Flash 系列定位為多模態 MoE | 125B 主模型、51B N-gram 嵌入參數、每 Token 啟用 6B |
| 可用時間 | 阿里巴巴宣布推出生產 API | 權重與模型卡資料於 2026 年 8 月下旬出現 |
Flash-Next 的發布時間也凸顯了兩者的關聯。其模型儲存庫與模型卡資料在生產 API 公告之前或前後公開,讓開發者能先了解架構方向,而阿里巴巴則同步準備託管服務。7
阿里巴巴表示,新的 Flash 系列訓練成本約為 Qwen3.7-Plus 的 九分之一,同時提升整體效能,尤其是在程式設計與辦公室任務上的表現。515
這是一項幅度很大的主張,但目前應視為公司公布的比較,而不是經過獨立審計的成本研究。訓練成本會受到硬體價格、訓練時間、資料整理、失敗實驗,以及成本計算方式等因素影響。
不過,稀疏架構確實為阿里巴巴強調訓練與推論效率提供了合理的技術背景:每個 Token 只啟用整體參數中的一小部分。對採購方而言,區分兩類資訊更實際:託管 Flash 的 API 價格可以直接用於預算估算;「九分之一」則應先視為架構與策略訊號,直到外部出現可比的測量結果。
阿里巴巴在 Flash-Next 模型卡中公布了以下結果:
在模型卡所重現的比較表中,Flash-Next 在 SWE-bench Pro、SWE-bench Multilingual、CoWorkBench 與 JobBench 的分數,高於表內列出的 Claude Opus 4.6 Max 結果。例如,SWE-bench Pro 的比較為 62.5 對 53.4,SWE-bench Multilingual 則為 81.0 對 77.5。
這些數據顯示,Flash-Next 在軟體工程與職場代理任務上具備不俗實力,但不能據此認定它在所有情境都優於 Claude 或其他前沿系統。相關數字由供應商公布,不同模型的評測設定也可能存在差異;Flash-Next 的結果更不能自動套用到每一種 Qwen3.8-Flash 生產部署。
來源將 Flash-Next 描述為開放權重模型。其中一份模型摘要列出的授權為 qwen-community-1.0,但開發者在商業再發布、微調或託管部署前,仍應以官方儲存庫與模型卡中的正式授權條款為準。6
「開放權重」不代表所有用途都不受限制。實際授權可能對再發布、署名、可接受用途或衍生模型設下條件。目前提供的證據不足以推論這次發布的所有元件都具備不受限制的商業使用權。
此次模型發布之際,阿里巴巴正大舉擴充 AI 基礎設施。路透社報導,公司季度雲端營收成長 45%,資本支出增加 75%,季度淨利潤則下滑 75%。18
路透社另報導,阿里巴巴正透過香港配股籌集 100 億美元,為 AI 抱負提供資金。 這些數字共同呈現出 Qwen 策略背後的取捨:雲端與 AI 運算需求正在成長,但建設算力的成本也立即壓縮獲利與現金生成能力。
因此,即使低價可能限制短期模型利潤,仍具備策略價值。便宜的推論服務可以提高阿里巴巴雲端基礎設施的使用率,吸引企業工作負載,並讓 Qwen 成為長上下文應用開發者的優先選項。
Flash-Next 的開放權重發布,讓 Qwen 的觸角超越自有 API。開發者可以測試、調整與自行託管模型,不必一開始就把工作負載綁定到 QwenCloud,卻能逐步熟悉 Qwen 的工具與架構。
這種分發方式可能從幾個方面支援阿里巴巴:
現有證據支持這是一項策略性解讀,但不能證明 Qwen 已經贏得中國開發者生態系。目前來源也沒有提供活躍開發者數量、下載量或企業部署量等可驗證的最新數據。
Qwen3.8-Flash 與 Flash-Next 最適合被理解為同一套產品策略的兩個部分:Flash 是低價、長上下文的雲端服務;Flash-Next 則是面向 Qwen4 的開放權重生態系與架構試驗場。
每百萬輸入 Tokens 0.16 美元、最高 100 萬 Tokens 上下文、在更大模型中採用據報 6B 啟用參數路徑,再加上供應商公布的程式設計與代理基準成績,讓這次發布對關注推論經濟效益的開發者而言相當重要。4
但幾項限制同樣不能忽略:生產模型與預覽模型不可混為一談;訓練成本降低至九分之一的說法尚未經獨立審核;基準比較主要由供應商公布;而 Qwen 的實際採用程度也還無法從現有證據量化。
阿里巴巴看來是中國 AI 競賽中資金充足、值得正視的競爭者,但還不是毫無爭議的領導者。公司願意大舉投入,也說明 Qwen 被視為長期雲端與生態系押注,而非追求短期獲利的單一模型產品。18
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
阿里巴巴將 Qwen3.8 Flash 定位為雲端生產模型,QwenCloud 價格為每百萬輸入 Token 0.16 美元、每百萬輸出 Token 0.47 美元;Flash Next 則是面向 Qwen4 的開放權重架構預覽。
阿里巴巴將 Qwen3.8 Flash 定位為雲端生產模型,QwenCloud 價格為每百萬輸入 Token 0.16 美元、每百萬輸出 Token 0.47 美元;Flash Next 則是面向 Qwen4 的開放權重架構預覽。 Flash Next 的主模型包含 125B 參數,另有 51B N gram 嵌入參數,但每個 Token 僅啟用 6B 參數,目標是在維持大模型容量的同時降低推論成本。
這次發布符合阿里巴巴更大的 AI 策略:雲端營收成長 45%,但資本支出增加 75%,季度淨利潤下滑 75%,顯示公司正以短期獲利換取長期 AI 基礎設施與生態系布局。