阿里巴巴強調模型具備幾個核心能力:
這反映整個 AI 產業的一個趨勢:從生成答案的模型,轉向能替使用者直接完成任務的 AI 系統。
Qwen3.7‑Max 最受關注的展示之一,是其長時間自主運行能力。
根據阿里巴巴與媒體報導,在一次內部實驗中,該模型完成了一個 長達 35 小時的核心優化(kernel optimization)任務。在整個過程中,它透過工具調用超過 1,000 次,不斷生成程式碼、執行測試、分析結果並改進實作。
這類任務通常遵循一個典型的「智能體循環」:
讓語言模型在如此長的工作流程中保持一致性其實非常困難。多數系統在長時間運行後容易忘記目標或陷入循環,因此這類展示備受關注——不過目前仍屬於廠商或早期報導的結果,需要更多獨立驗證。
早期測試結果顯示,Qwen3.7‑Max 已經進入全球 AI 模型的第一梯隊,但仍未全面領先整個產業。
在 Artificial Analysis Intelligence Index(整合多項困難測試的指標)上,Qwen3.7‑Max 得分約 57。
這一分數與多家頂級 AI 研究機構的模型接近,但目前最高分的模型仍稍微領先,例如部分 OpenAI 系列模型。
在眾包評測平台 LM Arena(原 LMArena) 上,Qwen3.7‑Max‑Preview 的 Elo 評分約為 1,475,在文字能力排行榜上約 全球第 13 名。
預覽版在不同子榜單中的表現包括:
同時,該模型在發布時也被認為是 Arena 排名最高的中國 AI 模型。
Qwen3.7‑Max 的設計明顯偏向 AI 編程智能體(coding agents)。
報導與測試顯示,它在多種開發場景中表現突出,例如:
模型架構能與編譯器、API、解譯器或開發工具整合,使 AI 可以反覆修改與測試程式碼,直到達到預期結果。
這種能力意味著它更像是能工作的開發代理(AI coding agent),而不是單次回答問題的助手。
Qwen 系列模型近年來的一個重點是 長上下文(long context)能力,讓 AI 可以一次閱讀大量文件、程式碼庫或資料。
官方文件顯示,部分 Qwen 模型的上下文窗口可達 數十萬到約 100 萬 tokens。
不過,目前公開資料尚未明確確認 Qwen3.7‑Max 的最大全文長度,因此外界常提到的「100 萬 tokens」能力仍需要模型卡或 API 文件進一步證實。
阿里巴巴將 Qwen3.7‑Max 定位為 企業 AI 智能體的基礎模型,可用於多個產業場景。
在這些場景中,AI 不只是輸出文字,而是規劃任務、呼叫工具並完成整個行動流程。
在中國 AI 生態中,Qwen3.7‑Max 被視為目前最強的模型之一,在部分基準比較中超越多個本土競爭者,例如 Kimi、DeepSeek 和 GLM 系列。
但放在全球範圍來看,情況更為複雜:
這反映了當前 AI 競爭的格局:全球多家研究機構正在從推理能力、編程能力、成本效率與智能體能力等多個維度競逐。
Qwen3.7‑Max 的真正意義,可能不在於排行榜分數,而在於它所代表的方向。
新一代 AI 系統正逐漸從單純回答問題的聊天機器人,轉變為能夠:
Qwen3.7‑Max 可以被視為這一趨勢的典型例子:一個不是為對話而設計,而是為「完成工作」而打造的 AI 模型。
未來,像「連續數十小時自主寫程式」這樣的展示能否在更多獨立測試中得到證實仍有待觀察。但可以確定的是,AI 的發展方向正在從「回答」走向「行動」。