Qwen3.7‑Max 是阿里巴巴在 2026 年发布的旗舰大模型,专为 AI 代理(Agent)设计,强调推理、编程与多步骤任务执行能力。[1][12] 官方演示显示模型可连续运行约 35 小时并完成 1000 多次工具调用,用于自主代码编写与内核优化等复杂流程。[4][12] 早期基准测试显示其 Artificial Analysis Intelligence Index 约为 57,在 LM Arena 文本榜单约排全球第 13,同时为当时排名最高的中国模型之一。[6][18][39]

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s new Qwen3.7‑Max AI model, and what are its key capabilities, benchmarks, and real‑world applications—including its agentic. Article summary: Alibaba’s Qwen3.7-Max is a new flagship Qwen large language model positioned less as a chatbot and more as an “agent-era” model: it is built for coding, tool use, reasoning, office automation, and long-running autonomous. Topic tags: general, news, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Alibaba launches Qwen3-Max, its largest and most capable AI model to date. **Alibaba has released Qwen3-Max, the biggest and most capable AI model in its lineup. The new model is" source context "Alibaba launches Qwen3-Max, its largest and most capable AI ..." Reference image 2: visual subject "# Alibaba
人工智能模型正在从“回答问题”转向“自己完成工作”。阿里巴巴最新发布的旗舰大模型 Qwen3.7‑Max 正是围绕这一趋势设计。
该模型在 2026 年阿里云峰会 上发布,被定位为 AI 代理(AI Agents)的基础模型——不仅能对话,还能规划任务、编写和调试代码、调用外部工具,并在较长时间内持续执行复杂流程。
换句话说,Qwen3.7‑Max 的目标不只是聊天,而是让 AI 真正参与软件开发、办公流程和企业运营等实际工作。
Qwen3.7‑Max 属于阿里巴巴 通义千问(Qwen)大模型家族 的最新旗舰版本,专门针对“Agent 工作负载”设计——即需要 AI 拆解问题、使用工具并连续执行多个步骤的任务场景。
官方介绍中,该模型重点强化了几项能力:
这体现了 AI 行业正在发生的变化:从生成答案的模型,转向可以直接完成任务的系统。
Qwen3.7‑Max 最受关注的演示之一,是其长时间自主执行能力。
在一项由阿里团队报告的实验中,模型进行了 约 35 小时的自动内核优化任务,过程中调用工具超过 1000 次。
整个流程类似典型的 AI 代理循环:
对于大模型来说,在如此长的任务链条中保持目标一致性非常困难。很多系统会在长流程中丢失上下文或陷入循环,因此这一演示被视为 Agent 能力的一次重要展示。不过,这些结果仍属于 厂商或早期报告的数据,尚需更多独立验证。
从目前公开的基准测试数据看,Qwen3.7‑Max 已进入全球第一梯队,但仍未在所有榜单上领先。
在综合多个高难度评测的 Artificial Analysis Intelligence Index 中,Qwen3.7‑Max 得分约 57。
这一水平接近当前最强模型,但仍略低于一些顶级系统。例如 GPT‑5.5 在同一指数中约为 60。
在众包评测平台 LM Arena(原 Chatbot Arena) 上,Qwen3.7‑Max‑Preview 的 Elo 评分约 1475,文本能力 全球排名约第 13。
其子榜单成绩包括:
Qwen3.7‑Max 的核心定位之一是 AI 编程代理(coding agent)。
相关报告显示,它在多种开发流程中表现较强,例如:
模型被设计为可以持续与工具互动,例如编译器、API、解释器或开发环境,从而 不断修改并测试代码直到达到目标结果。
这与传统“单次提示生成代码”的 AI 助手不同,更接近 自动化软件开发流程。
阿里在 Qwen 系列中持续强化 长上下文(Long Context) 能力,使模型能够一次处理大量文档或代码库。
官方文档显示,一些 Qwen 系列模型支持 几十万到约 100 万 token 的上下文窗口。
不过,目前公开资料中 Qwen3.7‑Max 的确切最大上下文长度尚未明确确认,因此常见的“100 万 token”说法仍需等待官方模型卡或 API 文档进一步验证。
阿里将 Qwen3.7‑Max 定位为 企业级 AI 代理基础模型,可应用于多个领域。
在这些场景中,AI 不只是生成文本,而是 规划任务 → 调用工具 → 执行步骤 → 完成目标。
在中国 AI 生态中,Qwen3.7‑Max 被认为是目前最强的国产模型之一,在部分榜单上超过 Kimi、DeepSeek、GLM 等竞争系统。
但在全球范围内,它仍与顶级模型存在差距。来自美国实验室的一些系统——如 OpenAI、Anthropic 和 Google 的旗舰模型——在综合排行榜上仍保持领先。
这反映出当前 AI 竞争的特点:
各家公司在不同维度不断追赶和突破。
Qwen3.7‑Max 的意义不只在于排行榜成绩。
更重要的是,它代表着 AI 技术的一次方向变化:从对话式 AI,走向能够自主执行任务的系统。
未来的 AI 模型将越来越多地被设计为:
Qwen3.7‑Max 正是这种趋势的典型例子——一个不是为聊天而生,而是为了 真正完成工作流程 的 AI 模型。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Qwen3.7‑Max 是阿里巴巴在 2026 年发布的旗舰大模型,专为 AI 代理(Agent)设计,强调推理、编程与多步骤任务执行能力。[1][12]
Qwen3.7‑Max 是阿里巴巴在 2026 年发布的旗舰大模型,专为 AI 代理(Agent)设计,强调推理、编程与多步骤任务执行能力。[1][12] 官方演示显示模型可连续运行约 35 小时并完成 1000 多次工具调用,用于自主代码编写与内核优化等复杂流程。[4][12]
早期基准测试显示其 Artificial Analysis Intelligence Index 约为 57,在 LM Arena 文本榜单约排全球第 13,同时为当时排名最高的中国模型之一。[6][18][39]