官方強調幾個核心能力:
呢個方向其實反映整個 AI 行業嘅趨勢:模型唔再只係生成內容,而係 直接幫用戶完成任務。
Qwen3.7‑Max 最引人注目嘅展示之一,就係 長時間自主運行能力。
根據阿里巴巴內部測試同媒體報導,模型曾經完成一個 長達約 35 小時嘅內核優化任務。喺整個過程中,AI 進行超過 1,000 次工具調用,包括:
整個流程完全自動進行。
呢類流程通常被稱為 agent loop:
對大型語言模型嚟講,要喺幾十個鐘嘅任務中保持邏輯一致其實非常困難,因為好多模型會逐漸忘記目標或者陷入無限循環。所以呢個示範被視為 AI Agent 能力嘅一個重要指標。不過目前仍然主要來自官方示範,仍需要更多獨立測試驗證。
喺 Artificial Analysis 的 Intelligence Index 綜合評測中,Qwen3.7‑Max 得分大約 57 分,屬於全球頂級模型梯隊。
同一排行榜中,一些美國 AI 實驗室模型(例如 GPT 系列或 Claude)仍然略高,但差距已經相對接近。
喺眾包評測平台 LM Arena 上,Qwen3.7‑Max‑Preview:
細分能力排名包括:
同時,呢個版本亦被認為係 當時 Arena 排名最高嘅中國 AI 模型。
Qwen3.7‑Max 特別針對 AI 編程代理(coding agents)。
報導同測試顯示佢喺以下任務表現突出:
模型可以與編譯器、開發環境、API 等工具互動,並反覆修改程式直到達到目標。
呢種模式同傳統「打一個 prompt → 得到答案」完全唔同,而係 持續運作嘅 AI 工程代理。
Qwen 系列模型近年亦強調 長上下文(long context) 能力。
部分 Qwen 模型已經支援 數十萬到接近 100 萬 token 的上下文視窗,可以一次處理:
不過,目前公開資料未完全確認 Qwen3.7‑Max 的最終最大上下文限制,因此常見嘅「100 萬 token」說法仍需以官方文件為準。
阿里巴巴將 Qwen3.7‑Max 定位為 企業 AI Agent 的基礎模型。
常見應用包括:
喺呢啲情境中,AI 不只生成文字,而係 規劃任務 → 調用工具 → 執行多步驟行動 去完成目標。
喺中國 AI 生態中,Qwen3.7‑Max 被視為當前最強模型之一,並喺多個測試中超越其他中國模型,例如 Kimi、DeepSeek 或 GLM 系列。
不過放眼全球,形勢更加微妙。
雖然 Qwen3.7‑Max 已經進入全球第一梯隊,但部分綜合基準測試顯示,美國頂級模型(例如 GPT、Claude、Gemini)仍然保持領先。
這反映 AI 競賽已經變成多維度競爭:
Qwen3.7‑Max 最重要嘅意義,其實唔係排行榜分數。
而係佢代表一個清晰趨勢——AI 正逐漸變成 自主代理(autonomous agents)。
未來嘅 AI 模型會更加強調:
從呢個角度睇,Qwen3.7‑Max 可以說係目前最典型嘅 Agent 時代 AI 模型之一:唔只係回答問題,而係開始真正幫人做工作。