一句講晒:Flash-Next係「試跑版」,唔係Qwen 4成品
Qwen 3.8-Flash-Next目前被定位為一個早期、開放權重嘅開發者測試版本,用嚟率先展示原本計劃應用喺Qwen 4家族嘅下一代架構。換句話講,阿里巴巴係先畀開發者試水溫,而唔係直接推出最終旗艦。
模型團隊嘅核心賣點,係用較少訓練同推理算力,換取接近前沿模型嘅能力。不過,模型權重、完整技術文件同獨立評測未齊之前,效能、成本同發布細節都應該當係供應商報告,唔可以當成已經證實嘅結論。
9
1250億參數,點解每個token只用60億?
據報,Qwen 3.8-Flash-Next係原生多模態嘅「混合專家」架構(Mixture-of-Experts,MoE),總參數量約1250億,當中包括510億個N-gram embedding參數;但每個token實際只啟用約60億參數。
9
可以將MoE理解成一間有大量專科部門嘅公司:模型保留一個好大嘅專家池,但處理每句文字、程式碼或者影像訊息時,只會揀相關專家出手,而唔係一次過動用全部參數。理論上,呢種稀疏路由可以減少浮點運算、記憶體頻寬需求,以及相對同等總規模密集模型嘅服務成本。
N-gram embedding則係另一個設計重點。簡單講,模型可以透過大規模嘅局部token組合表,較快處理部分常見文字或符號模式;但實際效果仍然要睇正式技術報告同測試,唔應單靠參數數字推斷。
「總參數多、每token啟用少」亦唔代表運行完全冇代價。部署時仍要考慮模型權重儲存、專家分配、記憶體容量、通訊開銷同推理框架支援。MoE係將成本重新分配,而唔係將所有硬件要求變成零。
點解特別強調編程?
編程工作往往適合稀疏專門化。唔同專家可以分別學習各種程式語言、程式庫、程式碼庫結構、工具調用、除錯流程,以及長上下文入面嘅程式碼關係。對要處理大型repository、連續修改多個檔案,或者配合代理工具完成任務嘅開發者嚟講,呢種路由設計有機會帶來效率優勢。
但「以大約九分之一嘅Qwen 3.7-Plus訓練成本,做到接近前沿表現」應該理解為一個架構效率目標,可能同稀疏路由、模型設計改動同embedding方案有關;佢唔係證明模型已經喺每個benchmark、每種真實編程流程都追上頂尖閉源模型。現階段獨立編程評測仍然唔足夠,尤其要留意長程代理任務、實際程式碼修復率同工具使用成功率。
點解係preview,而唔係flagship?
阿里巴巴將Flash-Next包裝成預覽版,反映佢更似一個兼容性同生態系統發布:開發者可以預先測試下一代架構、微調方法、推理堆疊,以及文字、圖片等多模態工作流程,為日後Qwen 4鋪路。
9
呢個定位亦為正式旗艦保留空間。Qwen 4日後可以有更多訓練、較強嘅後訓練、更加完整嘅安全工作、更大或更多樣化嘅版本,以及最終benchmark驗證。因此,Flash-Next嘅早期結果即使亮眼,都唔應直接等同Qwen 4最終能力。
同近期Qwen 3.8版本有咩關係?
阿里巴巴近期已推出Qwen3.8-27B,採用Apache 2.0授權。呢個係一款約270億參數級別嘅原生多模態模型,原生上下文窗口達262K tokens,並可擴展至100萬tokens。
6
另一邊,Qwen3.8-Max係高階版本。不過,相關報道指Max級模型嘅權重採用獨立而較嚴格嘅授權,唔係Qwen3.8-27B所用嘅純Apache 2.0條款。
12
呢種分拆有幾實際:較細嘅27B版本可以較容易被開發者下載、改造、微調同商用;最昂貴、最接近旗艦級嘅能力,就由阿里巴巴透過授權條款保留更多控制權。
「開放權重」唔等於一定可以無條件商用
如果Max或Flash-Next嘅授權包含用戶數、營收、服務規模門檻,或者要求大型商業部署另行簽約甚至分享收入,咁對企業採用就會係一個重要限制。
現有報道支持Max有授權限制,但具體收入分成觸發門檻同條款,仍然要以實際license文本確認。就目前證據,唔應該將「大型商業用戶必須分成」當成已經確立嘅事實。
12
對企業嚟講,真正要睇嘅唔止係模型權重有冇公開,仲包括:可唔可以修改同再發布、能否提供模型服務、品牌標示要求、收入門檻、地域限制,以及日後版本係咪沿用同一套條款。
呢件事點樣接上阿里巴巴嘅AI大棋?
Qwen模型系列唔單止係模型產品,亦係阿里巴巴「全棧式」AI策略嘅入口:透過開放或較容易接觸嘅模型吸引開發者,帶動微調、API調用、雲端運算同企業工作負載,再由阿里巴巴投資訓練前沿模型所需嘅算力、數據中心同基礎設施。阿里巴巴表示,香港配股所得款項將用於「全棧式」AI能力。
2
公司今次集資HK$800億(約102億美元),發售7.1億股新股,每股作價HK$112.70。
3 配股價較之前收市價低8.4%,但據報訂單簿吸引約280億美元需求。
4
對投資者嚟講,取捨相當直接:新資本可以加快AI投資,但發行新股會攤薄現有股東權益;如果AI支出未能夠及時轉化成雲服務、API同應用收入,公司亦要承受執行風險。
4
中國開放權重競賽,重點唔只係跑分
中國AI開放權重競賽入面,模型贏唔贏一個benchmark只係其中一環。更加關鍵嘅係可唔可以吸引開發者、下游微調模型、雲端工作負載同工具鏈支援,喺DeepSeek等競爭者之前建立足夠生態黏性。
市場提及嘅「Ox Alpha」等潛在系統,如果冇可歸屬嘅正式發布、模型權重或者技術報告,就仍然屬於推測,唔應該當成已發布產品。同樣,超過460個模型、支援119種語言等數字,應視為Qwen生態系統指標,而唔係任何一個Qwen模型單獨能力嘅證明。
最後要睇兩個答案
阿里巴巴押注嘅方向係:易於訓練、採用稀疏路由、同時支援多模態嘅模型,可以令公司兩頭兼顧——一邊擴大開放模型採用率,另一邊發展高端雲端部署。
但Qwen 3.8-Flash-Next真正值唔值得追,最後要等兩件事:
- 獨立測試能否驗證編程能力同訓練成本優勢;
- 授權條款能否令大型企業放心採用,而唔會削弱「開放」本身嘅價值。
喺呢兩點未有答案之前,Flash-Next更適合被視為一個值得開發者觀察同測試嘅架構預告,而唔係已經可以蓋棺論定嘅Qwen 4替代品。