Qwen3.8 Flash 是面向生產環境的多模態模型,輸入每百萬 Token 收費 $0.16,輸出每百萬 Token 收費 $0.47;Flash Next 則是預覽 Qwen4 架構的開放權重模型。 Flash Next 採用 125B 主模型及額外 51B N gram embedding,但每個 Token 只啟用 6B 參數,目標是在維持大型模型能力之餘降低推理成本。
發布者使用 GPT-5.6 Luna 編輯圖片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
阿里巴巴旗下 Qwen 團隊一次推出兩款定位不同、但策略上互相配合的新模型:Qwen3.8-Flash 是面向實際生產環境的多模態雲端模型,透過 QwenCloud 以極低 Token 價格提供服務;Qwen3.8-Flash-Next 則是開放權重版本,用來率先展示阿里巴巴聲稱將應用於 Qwen4 家族的架構方向。5
15
簡單講,前者負責吸引企業工作量,後者負責吸引開發者、工具整合及社群關注。技術規格和測試成績相當進取,但要留意,部分性能及成本數字主要來自阿里巴巴及其模型卡,尚未有獨立測試全面核實。
阿里巴巴形容 Qwen3.8-Flash 是一款支援多模態的混合專家模型(Mixture-of-Experts,MoE),針對寫程式、辦公室工作、代理式工作流程及長上下文任務設計。公司表示,模型預設上下文視窗為 262,144 個 Token,並可擴展至 100 萬個 Token,適合處理大型文件、長篇對話及研究資料。5
15
QwenCloud 公布的價格為:輸入每百萬 Token $0.16,輸出每百萬 Token $0.47。阿里巴巴表示生產 API 很快會推出,後續報道則指 QwenCloud 已按這個價格提供模型服務。4
15
這個定價不只是一個模型發布消息,更是基建生意的定價策略。對需要處理大量文件、運行編程代理或建立高用量工作流程的團隊來講,低價 API 可以大幅降低試用及擴展成本,亦令模型本身成為推動阿里雲用量的入口。
Flash-Next 並不是另一個 API 收費層級,而是用來展示未來 Qwen4 方向的開放權重模型。其模型資料列出 125B 參數主模型、額外 51B N-gram embedding 參數,以及每個 Token 僅啟用 6B 參數。
這種稀疏混合專家設計,意思是模型內藏有一個很大的參數池,但處理每個 Token 時只動用其中一小部分。理論上,這可以在保留較大模型容量的同時,降低每個 Token 所需的運算量。
現有模型卡資料列出其原生上下文視窗為 262,144 個 Token,利用 YaRN 可擴展至 100 萬個 Token。13 不過,Flash 與 Flash-Next 是兩個不同版本,開發者部署前仍應查清楚實際版本的上下文上限、記憶體要求及服務行為。
| 項目 | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 主要定位 | 面向生產環境的雲端模型 | 預覽 Qwen4 架構的開放權重模型 |
| 主要用途 | 多模態寫程式、辦公室工作及代理式流程 | 多模態寫程式、長時間代理式任務及文件處理 |
| 上下文視窗 | 預設 262,144 Token,可擴展至 100 萬 | 原生 262,144 Token;據報利用 YaRN 可擴展至 100 萬 |
| 雲端價格 | 輸入每百萬 Token $0.16;輸出每百萬 Token $0.47 | 開放權重版本目前沒有確定的阿里巴巴 API 價格 |
| 架構資料 | 阿里巴巴將 Flash 系列定位為多模態 MoE | 125B 主模型、51B N-gram embedding,每個 Token 啟用 6B |
| 可用時間 | 阿里巴巴宣布推出 QwenCloud 生產 API | 權重及模型卡資料於 2026 年 8 月下旬陸續公開 |
Flash-Next 的程式碼庫及模型卡資料在生產 API 公布前後出現,讓開發者可以先了解架構,再等待或轉用 QwenCloud 的託管服務。7
阿里巴巴表示,相比 Qwen3.7-Plus,新 Flash 系列的訓練成本大約只有 九分之一,同時在寫程式及辦公室任務上有更佳表現。5
15
這是一個非常大的宣稱,但目前應視為公司公布的比較,而不是經獨立審計的成本研究。實際訓練成本會受硬件價格、訓練時間、數據處理、失敗重跑次數及成本計算方法等因素影響。
稀疏架構確實為阿里巴巴強調效率提供了一定技術基礎:每個 Token 只啟用一小部分參數,理論上可以同時減少訓練及推理所需運算。不過對買家而言,兩個數字的實用性不同:$0.16 的 API 輸入價格可以直接用來做預算;「九分之一」則暫時較適合作為架構及策略訊號,直到有更多外部測試出現。
Flash-Next 模型卡公布了以下成績:
在模型卡列出的比較表中,Flash-Next 在 SWE-bench Pro、SWE-bench Multilingual、CoWorkBench 及 JobBench 均高於表內的 Claude Opus 4.6 Max 成績。例如,SWE-bench Pro 是 62.5 對 53.4,SWE-bench Multilingual 則是 81.0 對 77.5。
這些結果反映 Flash-Next 在軟件工程及辦公室代理任務上有相當強的表現,但不能據此斷言它全面勝過 Claude 或其他前沿模型。測試數字由供應商公布,測試環境及執行方式亦可能不同;而且 Flash-Next 的基準測試結果,不能自動等同於每一個 Qwen3.8-Flash 生產部署的表現。
資料將 Flash-Next 描述為開放權重模型。部分模型摘要列出授權為 qwen-community-1.0,但如果要進行商業重新發布、微調或自行託管,開發者仍應以官方程式碼庫及模型卡的最終授權條款為準。6
「開放權重」本身不代表所有用途都不受限制。實際授權可能涉及重新發布、署名、可接受用途或衍生模型等條件。現有證據不足以對這次發布所有組件的商業使用權作出更廣泛結論。
模型發布之際,阿里巴巴正大舉擴充 AI 基建。路透社報道,公司季度雲端收入上升 45%,資本開支增加 75%,但季度純利下跌 75%。18
路透社亦報道,阿里巴巴透過香港配股集資 100 億美元,用於支持 AI 押注。 這些數字呈現出 Qwen 策略的代價:雲端及 AI 運算需求正在增加,但建設相關容量的成本,已經即時壓低盈利及現金流表現。
因此,低價推理服務即使短期內壓縮模型毛利,仍可能具備戰略價值。更便宜的服務可以提高阿里雲基建的使用率,吸引企業工作量,亦令 Qwen 更有機會成為長上下文應用的預設選擇。
Flash-Next 令 Qwen 的觸及範圍不再局限於阿里巴巴自己的 API。開發者可以下載、測試、調整及自行託管模型,先熟悉 Qwen 的工具及架構,而不必一開始便完全依賴 QwenCloud。
這種分發方式至少有四個好處:
這是根據同時推出開放權重、低價 API 及大規模基建投資作出的策略解讀,並不等於已經證明 Qwen 贏得中國開發者生態。現有資料沒有提供活躍開發者、下載量或企業部署數字,不能用來量化 Qwen 的實際採用程度。
Qwen3.8-Flash 和 Flash-Next 最適合被視為同一套產品策略的兩個部分:Flash 是低價、長上下文的雲端服務;Flash-Next 則是面向 Qwen4 的開放權重生態及架構試驗場。
輸入每百萬 Token $0.16、上下文最多 100 萬 Token、在更大型模型中每個 Token 僅啟用 6B 參數,再加上供應商公布的編程及代理測試成績,令這次發布對關注 AI 推理成本的開發者相當重要。4
但幾點界線不能混淆:生產模型與預覽模型不是同一回事;訓練成本「九分之一」尚未經獨立審核;基準測試主要由供應商公布;而 Qwen 的開發者採用規模仍然無法從現有證據量化。
整體而言,阿里巴巴是中國 AI 競爭中一個資金充裕、不能忽視的對手,但並非已經沒有挑戰的領導者。公司願意大手投資,顯示 Qwen 被視為長期雲端及開發者生態押注,而不是短期內追求高利潤的單一模型產品。18
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Qwen3.8 Flash 是面向生產環境的多模態模型,輸入每百萬 Token 收費 $0.16,輸出每百萬 Token 收費 $0.47;Flash Next 則是預覽 Qwen4 架構的開放權重模型。
Qwen3.8 Flash 是面向生產環境的多模態模型,輸入每百萬 Token 收費 $0.16,輸出每百萬 Token 收費 $0.47;Flash Next 則是預覽 Qwen4 架構的開放權重模型。 Flash Next 採用 125B 主模型及額外 51B N gram embedding,但每個 Token 只啟用 6B 參數,目標是在維持大型模型能力之餘降低推理成本。
這次發布配合阿里巴巴更大規模的 AI 押注:雲端收入按季增長 45%,資本開支增加 75%,但季度純利同時下跌 75%。
Qwen3.8 Flash 是面向生產環境的多模態模型,輸入每百萬 Token 收費 $0.16,輸出每百萬 Token 收費 $0.47;Flash Next 則是預覽 Qwen4 架構的開放權重模型。 Flash Next 採用 125B 主模型及額外 51B N gram embedding,但每個 Token 只啟用 6B 參數,目標是在維持大型模型能力之餘降低推理成本。
發布者使用 GPT-5.6 Luna 編輯圖片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
阿里巴巴旗下 Qwen 團隊一次推出兩款定位不同、但策略上互相配合的新模型:Qwen3.8-Flash 是面向實際生產環境的多模態雲端模型,透過 QwenCloud 以極低 Token 價格提供服務;Qwen3.8-Flash-Next 則是開放權重版本,用來率先展示阿里巴巴聲稱將應用於 Qwen4 家族的架構方向。5
15
簡單講,前者負責吸引企業工作量,後者負責吸引開發者、工具整合及社群關注。技術規格和測試成績相當進取,但要留意,部分性能及成本數字主要來自阿里巴巴及其模型卡,尚未有獨立測試全面核實。
阿里巴巴形容 Qwen3.8-Flash 是一款支援多模態的混合專家模型(Mixture-of-Experts,MoE),針對寫程式、辦公室工作、代理式工作流程及長上下文任務設計。公司表示,模型預設上下文視窗為 262,144 個 Token,並可擴展至 100 萬個 Token,適合處理大型文件、長篇對話及研究資料。5
15
QwenCloud 公布的價格為:輸入每百萬 Token $0.16,輸出每百萬 Token $0.47。阿里巴巴表示生產 API 很快會推出,後續報道則指 QwenCloud 已按這個價格提供模型服務。4
15
這個定價不只是一個模型發布消息,更是基建生意的定價策略。對需要處理大量文件、運行編程代理或建立高用量工作流程的團隊來講,低價 API 可以大幅降低試用及擴展成本,亦令模型本身成為推動阿里雲用量的入口。
Flash-Next 並不是另一個 API 收費層級,而是用來展示未來 Qwen4 方向的開放權重模型。其模型資料列出 125B 參數主模型、額外 51B N-gram embedding 參數,以及每個 Token 僅啟用 6B 參數。
這種稀疏混合專家設計,意思是模型內藏有一個很大的參數池,但處理每個 Token 時只動用其中一小部分。理論上,這可以在保留較大模型容量的同時,降低每個 Token 所需的運算量。
現有模型卡資料列出其原生上下文視窗為 262,144 個 Token,利用 YaRN 可擴展至 100 萬個 Token。13 不過,Flash 與 Flash-Next 是兩個不同版本,開發者部署前仍應查清楚實際版本的上下文上限、記憶體要求及服務行為。
| 項目 | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 主要定位 | 面向生產環境的雲端模型 | 預覽 Qwen4 架構的開放權重模型 |
| 主要用途 | 多模態寫程式、辦公室工作及代理式流程 | 多模態寫程式、長時間代理式任務及文件處理 |
| 上下文視窗 | 預設 262,144 Token,可擴展至 100 萬 | 原生 262,144 Token;據報利用 YaRN 可擴展至 100 萬 |
| 雲端價格 | 輸入每百萬 Token $0.16;輸出每百萬 Token $0.47 | 開放權重版本目前沒有確定的阿里巴巴 API 價格 |
| 架構資料 | 阿里巴巴將 Flash 系列定位為多模態 MoE | 125B 主模型、51B N-gram embedding,每個 Token 啟用 6B |
| 可用時間 | 阿里巴巴宣布推出 QwenCloud 生產 API | 權重及模型卡資料於 2026 年 8 月下旬陸續公開 |
Flash-Next 的程式碼庫及模型卡資料在生產 API 公布前後出現,讓開發者可以先了解架構,再等待或轉用 QwenCloud 的託管服務。7
阿里巴巴表示,相比 Qwen3.7-Plus,新 Flash 系列的訓練成本大約只有 九分之一,同時在寫程式及辦公室任務上有更佳表現。5
15
這是一個非常大的宣稱,但目前應視為公司公布的比較,而不是經獨立審計的成本研究。實際訓練成本會受硬件價格、訓練時間、數據處理、失敗重跑次數及成本計算方法等因素影響。
稀疏架構確實為阿里巴巴強調效率提供了一定技術基礎:每個 Token 只啟用一小部分參數,理論上可以同時減少訓練及推理所需運算。不過對買家而言,兩個數字的實用性不同:$0.16 的 API 輸入價格可以直接用來做預算;「九分之一」則暫時較適合作為架構及策略訊號,直到有更多外部測試出現。
Flash-Next 模型卡公布了以下成績:
在模型卡列出的比較表中,Flash-Next 在 SWE-bench Pro、SWE-bench Multilingual、CoWorkBench 及 JobBench 均高於表內的 Claude Opus 4.6 Max 成績。例如,SWE-bench Pro 是 62.5 對 53.4,SWE-bench Multilingual 則是 81.0 對 77.5。
這些結果反映 Flash-Next 在軟件工程及辦公室代理任務上有相當強的表現,但不能據此斷言它全面勝過 Claude 或其他前沿模型。測試數字由供應商公布,測試環境及執行方式亦可能不同;而且 Flash-Next 的基準測試結果,不能自動等同於每一個 Qwen3.8-Flash 生產部署的表現。
資料將 Flash-Next 描述為開放權重模型。部分模型摘要列出授權為 qwen-community-1.0,但如果要進行商業重新發布、微調或自行託管,開發者仍應以官方程式碼庫及模型卡的最終授權條款為準。6
「開放權重」本身不代表所有用途都不受限制。實際授權可能涉及重新發布、署名、可接受用途或衍生模型等條件。現有證據不足以對這次發布所有組件的商業使用權作出更廣泛結論。
模型發布之際,阿里巴巴正大舉擴充 AI 基建。路透社報道,公司季度雲端收入上升 45%,資本開支增加 75%,但季度純利下跌 75%。18
路透社亦報道,阿里巴巴透過香港配股集資 100 億美元,用於支持 AI 押注。 這些數字呈現出 Qwen 策略的代價:雲端及 AI 運算需求正在增加,但建設相關容量的成本,已經即時壓低盈利及現金流表現。
因此,低價推理服務即使短期內壓縮模型毛利,仍可能具備戰略價值。更便宜的服務可以提高阿里雲基建的使用率,吸引企業工作量,亦令 Qwen 更有機會成為長上下文應用的預設選擇。
Flash-Next 令 Qwen 的觸及範圍不再局限於阿里巴巴自己的 API。開發者可以下載、測試、調整及自行託管模型,先熟悉 Qwen 的工具及架構,而不必一開始便完全依賴 QwenCloud。
這種分發方式至少有四個好處:
這是根據同時推出開放權重、低價 API 及大規模基建投資作出的策略解讀,並不等於已經證明 Qwen 贏得中國開發者生態。現有資料沒有提供活躍開發者、下載量或企業部署數字,不能用來量化 Qwen 的實際採用程度。
Qwen3.8-Flash 和 Flash-Next 最適合被視為同一套產品策略的兩個部分:Flash 是低價、長上下文的雲端服務;Flash-Next 則是面向 Qwen4 的開放權重生態及架構試驗場。
輸入每百萬 Token $0.16、上下文最多 100 萬 Token、在更大型模型中每個 Token 僅啟用 6B 參數,再加上供應商公布的編程及代理測試成績,令這次發布對關注 AI 推理成本的開發者相當重要。4
但幾點界線不能混淆:生產模型與預覽模型不是同一回事;訓練成本「九分之一」尚未經獨立審核;基準測試主要由供應商公布;而 Qwen 的開發者採用規模仍然無法從現有證據量化。
整體而言,阿里巴巴是中國 AI 競爭中一個資金充裕、不能忽視的對手,但並非已經沒有挑戰的領導者。公司願意大手投資,顯示 Qwen 被視為長期雲端及開發者生態押注,而不是短期內追求高利潤的單一模型產品。18
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Qwen3.8 Flash 是面向生產環境的多模態模型,輸入每百萬 Token 收費 $0.16,輸出每百萬 Token 收費 $0.47;Flash Next 則是預覽 Qwen4 架構的開放權重模型。
Qwen3.8 Flash 是面向生產環境的多模態模型,輸入每百萬 Token 收費 $0.16,輸出每百萬 Token 收費 $0.47;Flash Next 則是預覽 Qwen4 架構的開放權重模型。 Flash Next 採用 125B 主模型及額外 51B N gram embedding,但每個 Token 只啟用 6B 參數,目標是在維持大型模型能力之餘降低推理成本。
這次發布配合阿里巴巴更大規模的 AI 押注:雲端收入按季增長 45%,資本開支增加 75%,但季度純利同時下跌 75%。