阿里巴巴将面向生产环境的 Qwen3.8 Flash 与开放权重的 Flash Next 结合起来:前者通过 QwenCloud 提供服务,输入价格为每百万 Token 0.16 美元,输出为 0.47 美元。 Flash Next 采用 1250 亿参数主模型、510 亿参数 N gram 嵌入,并且每个 Token 仅激活约 60 亿参数,目标是在保留大模型能力的同时降低推理成本。
发布者使用 GPT-5.6 Luna 编辑图片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
阿里巴巴旗下 Qwen 团队此次发布的并不是两个完全同类的模型,而是一套分工明确的产品组合:Qwen3.8-Flash 面向生产环境,通过 QwenCloud 提供低价托管推理;Qwen3.8-Flash-Next 则以开放权重形式发布,用来展示阿里巴巴为未来 Qwen4 系列准备的架构方向。5
15
这背后的商业逻辑很清晰:用足够低的 API 价格吸引企业工作负载,同时用开放权重培养开发者、工具链和社区对 Qwen4 架构的熟悉度。技术指标颇具吸引力,但需要注意,训练成本和大部分基准成绩主要来自阿里巴巴及其模型卡,尚未经过充分的独立验证。
阿里巴巴将 Qwen3.8-Flash 描述为多模态混合专家模型,重点服务于编程、办公自动化、智能代理和长上下文任务。其默认上下文窗口为 262,144 个 Token,并可扩展至 100 万个 Token,适合处理大型文件、长对话和研究资料。5
15
QwenCloud 公布的价格为:输入每百万 Token 0.16 美元,输出每百万 Token 0.47 美元。阿里巴巴此前表示生产 API 将很快上线,后续报道则称 QwenCloud 已按照这一价格提供该模型。4
15
这个价格意味着,Flash 不只是一次模型发布,也是一项基础设施产品。对于文档处理、编程代理和高调用量应用来说,开发者可以在不承担顶级模型通常较高推理费用的情况下进行大规模试用。
Flash-Next 并不是 QwenCloud 的另一个 API 档位,而是一个用于预览 Qwen4 架构思路的开放权重模型。模型资料显示,它包含 1250 亿参数的主模型、额外的 510 亿 N-gram 嵌入参数,但每个 Token 只激活约 60 亿参数。
这是一种稀疏混合专家架构:模型拥有庞大的参数池,但处理每个 Token 时只调用其中一小部分。理论上,这种设计能够降低单 Token 的计算量,同时保留高于同规模稠密模型的容量上限。
公开模型卡显示,Flash-Next 原生支持 262,144 个 Token 的上下文窗口,并可通过 YaRN 扩展至 100 万个 Token。13不过,Flash 和 Flash-Next 是两个不同的发布版本,开发者仍应根据实际部署版本,核对上下文上限、显存需求和服务行为。
| 特性 | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 主要定位 | 面向生产环境的托管模型 | 面向 Qwen4 的开放权重架构预览 |
| 模态与场景 | 多模态编程、办公和智能代理工作流 | 多模态编程、办公及长周期智能代理任务 |
| 上下文窗口 | 默认 262,144 Token,可扩展至 100 万 Token | 原生 262,144 Token,据报道可通过 YaRN 扩展至 100 万 Token |
| 托管价格 | 输入每百万 Token 0.16 美元;输出每百万 Token 0.47 美元 | 尚未确定阿里巴巴 API 价格 |
| 主要架构信息 | 阿里巴巴将 Flash 系列描述为多模态 MoE 模型 | 1250 亿主模型参数、510 亿 N-gram 嵌入参数,每个 Token 激活 60 亿参数 |
| 可用性 | 阿里巴巴宣布 QwenCloud 生产 API 即将推出 | 模型权重和模型卡资料在 2026 年 8 月下旬出现 |
发布时间也强化了两者之间的关系。Flash-Next 的代码仓库和模型卡资料先于或接近生产 API 的公告出现,让开发者可以提前了解架构,而阿里巴巴则同步准备托管服务。7
阿里巴巴称,新 Flash 系列的训练成本约为 Qwen3.7-Plus 的 九分之一,同时在编程和办公任务上实现性能提升。5
15
这是一个幅度很大的说法,但目前更适合将其视为公司公布的对比,而不是经过独立审计的成本研究。训练成本会受到硬件价格、训练时长、数据处理、失败实验次数以及成本核算方法等多种因素影响。
不过,稀疏架构确实为阿里巴巴强调效率提供了技术基础:每个 Token 只激活部分参数,理论上可以同时降低训练和推理阶段的计算负担。
对模型采购方来说,二者的可操作性不同:每百万 Token 的托管价格可以直接用于 API 预算,而“九分之一”的训练成本则更像是架构和战略信号,在出现可比的第三方测量前不宜过度解读。
阿里巴巴在 Flash-Next 模型卡中公布了以下结果:
在模型卡列出的对比表中,Flash-Next 在 SWE-bench Pro、SWE-bench Multilingual、CoWorkBench 和 JobBench 上的成绩高于其中列出的 Claude Opus 4.6 Max。例如,SWE-bench Pro 的对比成绩为 62.5 对 53.4,SWE-bench Multilingual 则为 81.0 对 77.5。
这些结果显示,Flash-Next 在软件工程和办公智能代理任务上具备较强竞争力,但不能据此断言它在所有场景都优于 Claude 或其他前沿模型。相关数字由厂商公布,不同团队的评测工具、提示词和运行设置也可能存在差异;Flash-Next 的成绩更不能自动等同于所有生产环境中的 Qwen3.8-Flash 部署表现。
现有资料将 Flash-Next 描述为开放权重模型。一份公开模型摘要列出的许可证为 qwen-community-1.0,但开发者在商业再分发、微调或托管部署前,仍应以官方代码仓库和模型卡中的最终许可条款为准。6
“开放权重”本身并不意味着任何用途都不受限制。具体许可证可能会对再分发、署名、可接受用途或衍生模型提出要求。目前提供的证据不足以对该发布版本所有组件的商业使用权限作出更宽泛的结论。
这次模型发布之际,阿里巴巴正在大幅扩张 AI 基础设施。路透社报道,阿里巴巴季度云业务收入增长 45%,资本开支增长 75%,季度净利润则下降 75%。18
路透社还报道称,阿里巴巴通过香港配股筹集 100 亿美元,用于支持 AI 抱负。这些数字揭示了 Qwen 战略背后的现实取舍:云计算和 AI 算力需求正在增长,但建设基础设施的成本已经对利润和现金流造成即时压力。
在这种情况下,低价策略即使压缩模型短期利润,也可能带来更高的基础设施利用率,吸引企业工作负载,并让 Qwen 成为长上下文应用开发者的优先选项。
Flash-Next 的开放权重发布,让 Qwen 的影响力不再局限于阿里巴巴自己的 API。开发者可以下载、测试、调整并自行部署模型,在不立即使用 QwenCloud 的情况下熟悉 Qwen 的工具和架构。
这种分发方式可能通过几条路径帮助阿里巴巴:
现有证据支持将其理解为一种战略布局,但并不能证明 Qwen 已经赢得中国开发者生态。来源中没有提供活跃开发者数量、下载量或企业部署量等经过验证的最新数据。
Qwen3.8-Flash 和 Flash-Next 最好被视为同一产品战略的两个组成部分:Flash 是低价、长上下文的云端服务;Flash-Next 则是围绕 Qwen4 展开的开放权重生态入口和架构试验场。
每百万输入 Token 0.16 美元、最高 100 万 Token 上下文、在更大模型中每 Token 仅激活约 60 亿参数,再加上厂商公布的编程和智能代理基准成绩,使这次发布对关注推理经济性的开发者而言相当值得关注。4
但几个限制同样重要:生产版和预览版不能混为一谈;训练成本降至九分之一的说法尚未经过独立审计;基准成绩主要来自厂商;Qwen 的实际开发者采用规模也无法从现有证据中量化。
综合来看,阿里巴巴是中国 AI 竞争中资金充足、行动积极的严肃参与者,但还不能称为毫无争议的领先者。公司愿意大举投入并接受短期利润下滑,说明 Qwen 被视为一项长期的云业务和开发者生态押注,而不是追求短期利润的单一模型产品。18
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
阿里巴巴将面向生产环境的 Qwen3.8 Flash 与开放权重的 Flash Next 结合起来:前者通过 QwenCloud 提供服务,输入价格为每百万 Token 0.16 美元,输出为 0.47 美元。
阿里巴巴将面向生产环境的 Qwen3.8 Flash 与开放权重的 Flash Next 结合起来:前者通过 QwenCloud 提供服务,输入价格为每百万 Token 0.16 美元,输出为 0.47 美元。 Flash Next 采用 1250 亿参数主模型、510 亿参数 N gram 嵌入,并且每个 Token 仅激活约 60 亿参数,目标是在保留大模型能力的同时降低推理成本。
这次发布与阿里巴巴更广泛的 AI 战略一致:云业务收入增长 45%,但资本开支增长 75%,季度净利润下降 75%,显示公司正在用短期利润换取 AI 基础设施和生态位。
阿里巴巴将面向生产环境的 Qwen3.8 Flash 与开放权重的 Flash Next 结合起来:前者通过 QwenCloud 提供服务,输入价格为每百万 Token 0.16 美元,输出为 0.47 美元。 Flash Next 采用 1250 亿参数主模型、510 亿参数 N gram 嵌入,并且每个 Token 仅激活约 60 亿参数,目标是在保留大模型能力的同时降低推理成本。
发布者使用 GPT-5.6 Luna 编辑图片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
阿里巴巴旗下 Qwen 团队此次发布的并不是两个完全同类的模型,而是一套分工明确的产品组合:Qwen3.8-Flash 面向生产环境,通过 QwenCloud 提供低价托管推理;Qwen3.8-Flash-Next 则以开放权重形式发布,用来展示阿里巴巴为未来 Qwen4 系列准备的架构方向。5
15
这背后的商业逻辑很清晰:用足够低的 API 价格吸引企业工作负载,同时用开放权重培养开发者、工具链和社区对 Qwen4 架构的熟悉度。技术指标颇具吸引力,但需要注意,训练成本和大部分基准成绩主要来自阿里巴巴及其模型卡,尚未经过充分的独立验证。
阿里巴巴将 Qwen3.8-Flash 描述为多模态混合专家模型,重点服务于编程、办公自动化、智能代理和长上下文任务。其默认上下文窗口为 262,144 个 Token,并可扩展至 100 万个 Token,适合处理大型文件、长对话和研究资料。5
15
QwenCloud 公布的价格为:输入每百万 Token 0.16 美元,输出每百万 Token 0.47 美元。阿里巴巴此前表示生产 API 将很快上线,后续报道则称 QwenCloud 已按照这一价格提供该模型。4
15
这个价格意味着,Flash 不只是一次模型发布,也是一项基础设施产品。对于文档处理、编程代理和高调用量应用来说,开发者可以在不承担顶级模型通常较高推理费用的情况下进行大规模试用。
Flash-Next 并不是 QwenCloud 的另一个 API 档位,而是一个用于预览 Qwen4 架构思路的开放权重模型。模型资料显示,它包含 1250 亿参数的主模型、额外的 510 亿 N-gram 嵌入参数,但每个 Token 只激活约 60 亿参数。
这是一种稀疏混合专家架构:模型拥有庞大的参数池,但处理每个 Token 时只调用其中一小部分。理论上,这种设计能够降低单 Token 的计算量,同时保留高于同规模稠密模型的容量上限。
公开模型卡显示,Flash-Next 原生支持 262,144 个 Token 的上下文窗口,并可通过 YaRN 扩展至 100 万个 Token。13不过,Flash 和 Flash-Next 是两个不同的发布版本,开发者仍应根据实际部署版本,核对上下文上限、显存需求和服务行为。
| 特性 | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 主要定位 | 面向生产环境的托管模型 | 面向 Qwen4 的开放权重架构预览 |
| 模态与场景 | 多模态编程、办公和智能代理工作流 | 多模态编程、办公及长周期智能代理任务 |
| 上下文窗口 | 默认 262,144 Token,可扩展至 100 万 Token | 原生 262,144 Token,据报道可通过 YaRN 扩展至 100 万 Token |
| 托管价格 | 输入每百万 Token 0.16 美元;输出每百万 Token 0.47 美元 | 尚未确定阿里巴巴 API 价格 |
| 主要架构信息 | 阿里巴巴将 Flash 系列描述为多模态 MoE 模型 | 1250 亿主模型参数、510 亿 N-gram 嵌入参数,每个 Token 激活 60 亿参数 |
| 可用性 | 阿里巴巴宣布 QwenCloud 生产 API 即将推出 | 模型权重和模型卡资料在 2026 年 8 月下旬出现 |
发布时间也强化了两者之间的关系。Flash-Next 的代码仓库和模型卡资料先于或接近生产 API 的公告出现,让开发者可以提前了解架构,而阿里巴巴则同步准备托管服务。7
阿里巴巴称,新 Flash 系列的训练成本约为 Qwen3.7-Plus 的 九分之一,同时在编程和办公任务上实现性能提升。5
15
这是一个幅度很大的说法,但目前更适合将其视为公司公布的对比,而不是经过独立审计的成本研究。训练成本会受到硬件价格、训练时长、数据处理、失败实验次数以及成本核算方法等多种因素影响。
不过,稀疏架构确实为阿里巴巴强调效率提供了技术基础:每个 Token 只激活部分参数,理论上可以同时降低训练和推理阶段的计算负担。
对模型采购方来说,二者的可操作性不同:每百万 Token 的托管价格可以直接用于 API 预算,而“九分之一”的训练成本则更像是架构和战略信号,在出现可比的第三方测量前不宜过度解读。
阿里巴巴在 Flash-Next 模型卡中公布了以下结果:
在模型卡列出的对比表中,Flash-Next 在 SWE-bench Pro、SWE-bench Multilingual、CoWorkBench 和 JobBench 上的成绩高于其中列出的 Claude Opus 4.6 Max。例如,SWE-bench Pro 的对比成绩为 62.5 对 53.4,SWE-bench Multilingual 则为 81.0 对 77.5。
这些结果显示,Flash-Next 在软件工程和办公智能代理任务上具备较强竞争力,但不能据此断言它在所有场景都优于 Claude 或其他前沿模型。相关数字由厂商公布,不同团队的评测工具、提示词和运行设置也可能存在差异;Flash-Next 的成绩更不能自动等同于所有生产环境中的 Qwen3.8-Flash 部署表现。
现有资料将 Flash-Next 描述为开放权重模型。一份公开模型摘要列出的许可证为 qwen-community-1.0,但开发者在商业再分发、微调或托管部署前,仍应以官方代码仓库和模型卡中的最终许可条款为准。6
“开放权重”本身并不意味着任何用途都不受限制。具体许可证可能会对再分发、署名、可接受用途或衍生模型提出要求。目前提供的证据不足以对该发布版本所有组件的商业使用权限作出更宽泛的结论。
这次模型发布之际,阿里巴巴正在大幅扩张 AI 基础设施。路透社报道,阿里巴巴季度云业务收入增长 45%,资本开支增长 75%,季度净利润则下降 75%。18
路透社还报道称,阿里巴巴通过香港配股筹集 100 亿美元,用于支持 AI 抱负。这些数字揭示了 Qwen 战略背后的现实取舍:云计算和 AI 算力需求正在增长,但建设基础设施的成本已经对利润和现金流造成即时压力。
在这种情况下,低价策略即使压缩模型短期利润,也可能带来更高的基础设施利用率,吸引企业工作负载,并让 Qwen 成为长上下文应用开发者的优先选项。
Flash-Next 的开放权重发布,让 Qwen 的影响力不再局限于阿里巴巴自己的 API。开发者可以下载、测试、调整并自行部署模型,在不立即使用 QwenCloud 的情况下熟悉 Qwen 的工具和架构。
这种分发方式可能通过几条路径帮助阿里巴巴:
现有证据支持将其理解为一种战略布局,但并不能证明 Qwen 已经赢得中国开发者生态。来源中没有提供活跃开发者数量、下载量或企业部署量等经过验证的最新数据。
Qwen3.8-Flash 和 Flash-Next 最好被视为同一产品战略的两个组成部分:Flash 是低价、长上下文的云端服务;Flash-Next 则是围绕 Qwen4 展开的开放权重生态入口和架构试验场。
每百万输入 Token 0.16 美元、最高 100 万 Token 上下文、在更大模型中每 Token 仅激活约 60 亿参数,再加上厂商公布的编程和智能代理基准成绩,使这次发布对关注推理经济性的开发者而言相当值得关注。4
但几个限制同样重要:生产版和预览版不能混为一谈;训练成本降至九分之一的说法尚未经过独立审计;基准成绩主要来自厂商;Qwen 的实际开发者采用规模也无法从现有证据中量化。
综合来看,阿里巴巴是中国 AI 竞争中资金充足、行动积极的严肃参与者,但还不能称为毫无争议的领先者。公司愿意大举投入并接受短期利润下滑,说明 Qwen 被视为一项长期的云业务和开发者生态押注,而不是追求短期利润的单一模型产品。18
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
阿里巴巴将面向生产环境的 Qwen3.8 Flash 与开放权重的 Flash Next 结合起来:前者通过 QwenCloud 提供服务,输入价格为每百万 Token 0.16 美元,输出为 0.47 美元。
阿里巴巴将面向生产环境的 Qwen3.8 Flash 与开放权重的 Flash Next 结合起来:前者通过 QwenCloud 提供服务,输入价格为每百万 Token 0.16 美元,输出为 0.47 美元。 Flash Next 采用 1250 亿参数主模型、510 亿参数 N gram 嵌入,并且每个 Token 仅激活约 60 亿参数,目标是在保留大模型能力的同时降低推理成本。
这次发布与阿里巴巴更广泛的 AI 战略一致:云业务收入增长 45%,但资本开支增长 75%,季度净利润下降 75%,显示公司正在用短期利润换取 AI 基础设施和生态位。