Qwen 3.8 Flash Next 被定位為 Qwen 4 架構的早期開放權重開發者測試版,不是阿里巴巴的最終旗艦模型。 據報導,模型總參數量為 1250 億,其中包含 510 億個 N gram 嵌入參數;但每個 token 約只啟用 60 億參數。[9] 稀疏混合專家模型(MoE)可讓不同專家專注於程式語言、除錯、工具使用和長上下文程式碼結構,這也是其強調 coding 表現的原因。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s planned Qwen 3.8 Flash Next release, how does its multimodal Mixture of Experts architecture (125 billion total parameters. Article summary: Qwen 3.8 Flash Next is being positioned as an early, open weight developer test of the architecture intended for Qwen 4—not as Alibaba’s finished flagship.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thum
阿里巴巴計畫推出的 Qwen 3.8-Flash-Next,目前更適合被理解為 Qwen 4 的「技術預覽」:讓開發者提前測試下一代架構、微調方法、推理工具鏈與多模態流程,而不是一款已完成、準備全面對標競爭者的旗艦模型。9
現階段最值得注意的,是它試圖以較少的實際運算量,換取接近前沿模型的能力。至於效能、成本與正式發布細節,仍應等到模型權重、完整技術文件及獨立評測出現後再下定論。
據報導,Qwen 3.8-Flash-Next 是原生多模態的混合專家模型(Mixture of Experts,MoE),標示總參數量達 1250 億,其中包括 510 億個 N-gram 嵌入參數;但每個 token 約只啟用 60 億參數。9
MoE 的核心概念,是把模型容量分成多個專家,再由路由機制按照輸入內容,選擇其中一小部分處理當前 token。換句話說,模型可以保留龐大的專業能力庫,卻不必在每一次推理時啟動全部參數。相較於總規模相近的密集模型,這種做法有機會降低浮點運算量、記憶體頻寬需求與服務成本。
N-gram 嵌入則可視為另一層加速設計:透過大量局部詞組或 token 組合的嵌入表,模型能更快處理部分常見模式。不過,僅憑參數數量與架構描述,不能直接推導出最終準確度或實際部署成本。
程式碼是稀疏專業化可能發揮優勢的場景。不同專家可以分別學習各種程式語言、程式庫與程式碼儲存庫的模式,也能針對工具調用、除錯、代理工作流程,以及長上下文中的程式碼結構建立專門能力。
因此,阿里巴巴所稱「接近前沿表現、訓練成本約為 Qwen 3.7-Plus 九分之一」,較合理的解讀是:這是一項由稀疏路由、架構調整與嵌入設計共同支撐的效率目標,而不是已經證明模型能在所有基準測試或真實 coding 工作流程中,全面追上領先的封閉模型。現有獨立程式設計評測仍不足以確認這項說法。
「Flash-Next」的命名與發布方式,反映出阿里巴巴更重視相容性與開發者生態。開發者可先熟悉下一代模型的推理堆疊、微調策略與圖像等多模態管線,為日後的 Qwen 4 做準備。9
這也代表最終 Qwen 4 仍可能具備更多訓練、進一步的後訓練調校、更完整的安全工作、更大或更多元的版本,以及正式的基準測試結果。Flash-Next 的早期版本不應被視為 Qwen 4 最終能力的完整代表。
阿里巴巴近期已推出 Qwen3.8-27B。這是一款 270 億參數級的原生多模態模型,採用 Apache 2.0 授權,原生上下文視窗為 262K tokens,並可擴展至 100 萬 tokens。6
相對地,Qwen3.8-Max 是高階版本,但相關報導指出,其模型權重採用獨立且限制較多的授權條款,而不是 Qwen3.8-27B 使用的標準 Apache 2.0。12 這種分層策略,一方面讓較小型模型更容易被開發者下載、修改與部署,另一方面也讓阿里巴巴保留對高成本旗艦能力的商業掌控。
如果 Max 或 Flash-Next 的授權包含使用門檻、要求另行簽約,或針對大型商業部署設置分潤義務,這將是企業採用時不可忽略的限制。現有報導支持 Qwen3.8-Max 存在授權差異,但具體的營收門檻、分潤觸發條件與適用範圍,仍須以正式授權文本確認;目前不宜把「大型用戶必須分潤」視為已確立的事實。12
Qwen 系列發布並非孤立的模型競賽,而是阿里巴巴「全棧 AI」策略的一部分:透過開放或較容易取得的模型培養開發者與下游需求,再把雲端服務、運算資源、資料中心與模型部署連接起來。阿里巴巴表示,香港配售所得將用於發展「全棧」AI 能力。2
為支應這項計畫,阿里巴巴以每股 112.70 港元發行 7.1 億股新股,籌得 800 億港元、約 102 億美元。3 配售價較前一交易日收市價折讓 8.4%,據報訂單簿需求約達 280 億美元。4
對股東而言,這筆資金可加快 AI 基礎建設與模型投資,但增發新股也會稀釋既有持股。如果 AI 支出未能及時轉化為雲端、API 與應用程式收入,投資回收與執行風險便會上升。這正是消息公布後市場關注股權稀釋與投資回報的原因。4
在中國的開放權重 AI 競賽中,勝負不只取決於單一基準測試的分數。模型能否吸引開發者、衍生微調模型、雲端工作負載與周邊工具支援,同樣是關鍵;這也是阿里巴巴需要在 DeepSeek 等競爭者之前建立生態位勢的原因。
至於「Ox Alpha」等可能出現的系統,若沒有可歸屬的正式發布、模型權重或技術報告,仍應視為推測。阿里巴巴所稱超過 460 個模型、支援 119 種語言的數字,也應理解為 Qwen 生態系的指標,而不是任何單一 Qwen 模型的能力評分。
Qwen 3.8-Flash-Next 的戰略押注很清楚:以便宜訓練、稀疏運算與多模態能力,讓阿里巴巴同時爭取廣泛的開放模型採用,以及高價值的雲端規模部署。
但在開發者與企業做出判斷前,仍有兩個問題沒有答案:獨立測試能否驗證其 coding 品質與訓練成本優勢?授權條款又是否允許大型企業在不犧牲「開放」價值的情況下採用它?在正式權重與文件公布前,Flash-Next 更像是一張技術路線圖,而不是已經兌現的性能承諾。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Qwen 3.8 Flash Next 被定位為 Qwen 4 架構的早期開放權重開發者測試版,不是阿里巴巴的最終旗艦模型。
Qwen 3.8 Flash Next 被定位為 Qwen 4 架構的早期開放權重開發者測試版,不是阿里巴巴的最終旗艦模型。 據報導,模型總參數量為 1250 億,其中包含 510 億個 N gram 嵌入參數;但每個 token 約只啟用 60 億參數。[9]
稀疏混合專家模型(MoE)可讓不同專家專注於程式語言、除錯、工具使用和長上下文程式碼結構,這也是其強調 coding 表現的原因。