Qwen3.8-Omni-Flash 是阿里推出的一款云端托管原生全模态模型:它可联合理解文本、图片、音频和视频,但当前文档所列的输出是文本。其关键卖点是 100 万 Token 上下文、思考模式、函数调用和联网搜索,因此更适合长音视频分析、混合资料处理及工具型工作流,而不是通用的语音或视频生成模型。
17
核心价值:把长篇、多介质资料放进同一个任务
不少实际任务并不是只读一份文档或一段对话。例如,团队可能需要将会议录音、演示文稿、屏幕截图和文字要求一并交给模型,要求它整理会议纪要、提取待办事项、核对内容,必要时再调用获授权的外部工具。
阿里云将 Qwen3.8-Omni-Flash 用于音视频理解、会议纪要、字幕及内容分析等场景。
17 它的 100 万 Token 上下文窗口意味着单次请求可以容纳非常庞大的材料集合。不过,上下文容量大,不等于模型一定能精准检索、正确引用或完成跨模态推理。真正上线前,仍应以自身的长视频、文档和工具调用链路测试召回率、事实依据、延迟和成本。
16
17
“Agent 能力”具体指什么?
阿里表示,Qwen3.8-Omni-Flash 支持思考、函数调用和联网搜索。
17 换句话说,应用可以让模型先理解视频、音频或图文资料;当模型判断需要外部信息或执行某项操作时,再发起工具调用请求。
但这不表示模型会脱离应用“自主行动”。工具清单、访问凭据、调用参数校验、失败处理机制,以及哪些高风险操作必须人工确认,仍由应用开发者和企业管理者决定。模型能力只是安全工作流中的一个环节。
输入、输出与 API 接入
Qwen3.8-Omni-Flash 支持文本、图片、音频和视频作为输入,输出则为文本。阿里云建议将其用于非实时音视频分析与文本生成;若需求是实时对话或语音输出,应选择其他 Qwen 产品。
17
该模型可通过阿里云百炼(Model Studio)使用。文档列出的可用地域包括北京、新加坡、中国香港、东京、法兰克福和弗吉尼亚;开发者需要使用对应地域的 API Key。
17
对于采用 OpenAI 风格接口的开发者,阿里云的 Responses API 明确支持在 qwen3.8-omni-flash 用户消息中传入 input_audio 和 input_video 内容类型。 模型列表还标注其支持思考与非思考模式、函数调用、联网搜索和上下文缓存。
相比 Qwen3.5-Omni-Plus 提升了什么?
与 Qwen3.5-Omni-Plus 相比,Qwen3.8-Omni-Flash 的重点并不只是更长上下文,而是将全模态理解、长上下文和面向 Agent 的工具能力结合起来。
阿里称,该模型在 29 项评测中的平均成绩较 Qwen3.5-Omni-Plus 提升超过 25%;其中,在面向多模态工具使用和 Agent 任务的 WildClawBench-MM 上提升 36.5 分,在 AgenticVBench 上提升 22.3 分。
16
成本方面,阿里还称,音频输入的每小时 API 价格较上一代下降超过 98%,音视频输入的每小时价格下降超过 93%。
16 这对大规模处理录音和视频的团队很有吸引力,但这些属于厂商数据;实际账单仍会受媒体格式、Token 计算方式、调用路径和地域等因素影响,不能代替生产环境的完整成本测试。
价格:可作参考,不能直接当预算结论
公开的第三方价格列表显示,无服务器调用的价格约为:每 100 万输入 Token 0.15 美元、每 100 万输出 Token 0.47 美元、每 100 万缓存输入 Token 0.016 美元。
5
9
价格可能因地域、调用路径、模态和最新价目表而变化。做采购或用量预估前,应以阿里云百炼当前的正式价格页为准。
基准成绩值得关注,但不是“通用第一”的证明
阿里公布的结果显示,Qwen3.8-Omni-Flash 在音视频、工具使用和长程任务方面相较前代有所提升,包括 LongAudioSpan 和 OmniVideoBench 等评测。
16
不过,这些结果不能直接推导出它在所有任务上都优于 Gemini、OpenAI、Anthropic 或其他中国厂商的模型。100 万 Token 上下文与较好的基准分数,并不能保证模型在每一种语言、视频类型、工具链或安全要求下都表现最佳。
对采购方而言,更实际的问题是:针对某一明确工作负载,它能否满足所需的质量、延迟、治理要求和总成本?
云端闭源服务,另有开源配套项目
Qwen3.8-Omni-Flash 本身是托管服务,并非可下载权重的开放模型。阿里另行开放了 Qwen3.8-Flash-Next 的权重;这是不同的多模态混合专家(MoE)模型,并被描述为 Qwen4 所用架构的早期预览。
19
20
与此同时,Qwen 还发布了 Qwen-MM-Plugins 和 Qwen-Live Harness 两个开源配套工具,分别面向多模态应用构建及持续实时交互。
19
22 这些工具可以降低集成门槛,但并不意味着 Omni-Flash 的模型权重已经开源。
它在 AI 市场中的意义
Qwen3.8-Omni-Flash 的意义,在于把三类过去往往部署成本较高的能力打包到一起:广泛的媒体理解、超长上下文,以及便于接入 Agent 工作流的工具能力。对于需要处理大量会议、录音、视频或混合媒体知识库,且尤其在意输入成本的团队,这一定位具有现实吸引力。
16
17
它也反映出中国 AI 市场围绕性价比的竞争正在加速。路透社此前报道称,阿里更广泛的 Qwen3.8-Flash 发布强调了更低训练成本,以及更强的编程和办公任务能力。
1
这并不意味着单一模型发布就能决定中美 AI 厂商之间的竞争格局。但对于高吞吐量音视频分析与工具型工作流,Qwen3.8-Omni-Flash 已应被纳入评估清单,并与最符合企业地域覆盖、合规、语言能力和系统集成需求的其他供应商进行同场测试。
结论
可以把 Qwen3.8-Omni-Flash 理解为一层全模态分析与任务编排能力:它接收文本、图片、音频和视频,支持最高 100 万 Token 上下文,并能参与工具调用工作流,最终返回文本结果。
17
它最突出的场景不是“什么都能生成”,而是兼顾成本的长上下文媒体理解与 Agent 能力。在将其视为其他前沿模型替代品之前,仍应使用有代表性的真实数据和业务链路,独立验证阿里公布的质量与成本优势。