Qwen 3.8 Flash Next被定位为Qwen 4下一代架构的开发者预览版,而非最终旗舰;目前关于性能、成本和发布时间的说法仍需等待权重、技术文档及独立评测验证。 据披露,该模型总参数量为1250亿,其中包括510亿个N gram嵌入参数,但每个Token仅激活约60亿参数,核心思路是用稀疏计算降低训练和推理开销。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s planned Qwen 3.8 Flash Next release, how does its multimodal Mixture of Experts architecture (125 billion total parameters. Article summary: Qwen 3.8 Flash Next is being positioned as an early, open weight developer test of the architecture intended for Qwen 4—not as Alibaba’s finished flagship.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thum
阿里巴巴即将推出的 Qwen 3.8-Flash-Next,更像是一次提前公开的技术试运行,而不是Qwen系列已经定型的下一代旗舰。Qwen团队将它描述为未来 Qwen 4 家族所采用架构的早期版本,目的是让开发者先行测试模型结构、微调方法、推理框架和多模态工作流。
这意味着,外界现在看到的重点并不是一张已经盖棺定论的性能成绩单,而是阿里对下一代模型路线的技术押注:在保留庞大模型容量的同时,尽量减少每次计算真正需要动用的参数。
据披露,Qwen 3.8-Flash-Next是一款原生多模态混合专家模型(Mixture of Experts,简称MoE),总参数量约为1250亿,其中包含约510亿个N-gram嵌入参数;但在处理每个Token时,实际激活的参数只有约60亿。
MoE的基本思路可以理解为:模型内部保留一组规模庞大的“专家”,不同专家分别擅长不同类型的模式;模型收到一个Token后,并不会调用全部专家,而是通过路由机制选择少数几个进行计算。
这种设计的潜在优势在于:
不过,“总参数量大”和“运行时成本低”并不等于模型可以在普通设备上轻松部署。模型仍然需要保存完整的专家参数,内存、带宽、路由效率以及并行部署方式,都会影响实际成本。所谓“每Token激活60亿”,主要描述的是计算路径,并不代表只需存储60亿参数。
代码任务非常适合检验稀疏模型的专业化能力。模型可以让不同专家学习不同编程语言、代码仓库结构、调试方式、工具调用和长程代码依赖,从而避免让同一套参数平均处理所有类型的问题。
阿里方面提出,Flash-Next有望以约为Qwen 3.7-Plus九分之一的训练成本,达到接近前沿模型的表现。这一说法更适合被理解为一个效率目标或厂商口径的技术主张,而不是已经得到独立验证的结论。
最终能否在真实的软件工程场景中成立,还要看几个关键指标:代码生成的正确率、跨文件修改能力、测试通过率、工具调用稳定性、长任务完成率,以及不同硬件上的推理速度。仅凭稀疏路由或参数激活数量,不能直接推导出它一定能在所有基准或实际工作流中追平顶尖闭源模型。
Flash-Next的命名和发布方式本身就释放了一个信号:阿里希望开发者先适应架构,而不是现在就把它包装成最终产品。
对开发者而言,这类提前发布可以带来几种价值:
而真正的Qwen 4旗舰仍可能拥有更多训练数据、更充分的后训练、更大的模型变体、更完整的安全工作,以及经过最终版本确认的基准成绩。因此,Flash-Next的定位更接近“开发者预览”和“生态铺路”,不能与最终旗舰直接画等号。
阿里近期已经发布了Qwen 3.8系列的不同规模模型。其中,Qwen 3.8-27B是约270亿参数的原生多模态模型,原生上下文窗口为262K Token,并可扩展至100万Token;该模型采用Apache 2.0许可证。
相比之下,Qwen 3.8-Max面向更高端的云端和旗舰级应用,相关权重采用独立的Qwen 3.8-Max许可证,而不是Qwen 3.8-27B使用的标准Apache 2.0条款。
这形成了相对清晰的产品梯度:
“开放权重”也不等同于“没有任何商业限制”。如果某一版本的许可证包含大规模商业部署门槛、单独签约要求或其他义务,企业在上线前仍需仔细核对原始许可文本。现有报道可以确认Max采用了不同于Apache 2.0的许可证,但关于具体收入分成触发条件等说法,不能在缺少正式条款的情况下视为已被完全证实。
Qwen模型并不是阿里AI战略的孤立产品。阿里希望通过更容易获得的模型吸引开发者、应用公司和云客户,再把模型使用需求导向阿里云的API、算力和基础设施服务。
为支持这项战略,阿里通过香港配售发行7.1亿股新股,以每股112.70港元的价格筹集800亿港元,约合102亿美元;公司表示,募集资金将用于包括基础设施在内的“全栈”AI能力建设。23
这笔融资获得了较强机构需求,订单据报约达到280亿美元;但发行价较此前收市价低8.4%,新股发行也引发了投资者对股权稀释和执行风险的担忧。4
投资者关注的问题并不复杂:大规模投入可以加快芯片、数据中心、模型和云服务建设,但如果AI支出不能足够快地转化为云收入、API调用量和应用业务增长,资本回报就可能承压。4
在中国的开放权重模型竞争中,模型是否在某个基准上领先只是第一步。更关键的竞争还包括:
DeepSeek等竞争者已经让开发者生态和开放权重成为重要战场。至于“Ox Alpha”等尚未伴随明确发布、权重或技术报告的名称,目前仍应视为推测,不能当作已经落地的竞争产品。
同样,阿里所强调的模型数量和语言覆盖范围,更适合作为其生态规模指标,而不是单个Qwen模型能力的直接证明。模型数量多,并不意味着每一个模型都具备相同的性能、可靠性或商业可用性。
Qwen 3.8-Flash-Next的核心赌注,是用MoE稀疏路由、N-gram嵌入和原生多模态能力,把更大的模型容量与更低的有效计算量结合起来。若阿里关于代码能力和训练成本的说法经得起独立评测,它可能同时服务于两端:一端是更广泛的开放模型采用,另一端是阿里云上的大规模商业部署。
但在权重、完整技术文档和第三方评测正式到位之前,最稳妥的判断仍是:它是一款值得关注的架构预览版,而不是已经证明能够挑战所有前沿模型的旗舰。接下来真正决定其影响力的,将是独立代码评测、实际推理成本,以及大型企业能否在许可证约束下放心采用。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Qwen 3.8 Flash Next被定位为Qwen 4下一代架构的开发者预览版,而非最终旗舰;目前关于性能、成本和发布时间的说法仍需等待权重、技术文档及独立评测验证。
Qwen 3.8 Flash Next被定位为Qwen 4下一代架构的开发者预览版,而非最终旗舰;目前关于性能、成本和发布时间的说法仍需等待权重、技术文档及独立评测验证。 据披露,该模型总参数量为1250亿,其中包括510亿个N gram嵌入参数,但每个Token仅激活约60亿参数,核心思路是用稀疏计算降低训练和推理开销。
阿里同时在推进从开源模型、云服务到芯片和数据中心的“全栈”AI战略,并通过香港配售筹集800亿港元;但新股发行也带来了股权稀释和投资回报压力。