Qwen2.5-Max 的推出,重要之處未必是它是否在每一項測試都擊敗對手,而是阿里巴巴證明了一件事:前沿級 AI 模型的研發,並非只集中在少數美國實驗室。
阿里巴巴於 2025 年 1 月 28 至 29 日公布這款模型。當時 DeepSeek-V3 才剛引起全球關注,Qwen2.5-Max 就以高規模訓練、進取的效能聲稱,以及阿里雲現成的企業分發渠道登場。29
它未有證明自己在所有工作、所有環境都全面超越 GPT-4o、Claude 3.5 Sonnet 或 DeepSeek-V3。不過,Qwen2.5-Max 的策略意義相當清晰:一家大型中國雲端服務商,可以把一款接近前沿水平的模型迅速推向市場,同時維持一個包含可下載模型、開發者工具及託管 API 的更大生態。
Qwen2.5-Max 究竟係咩?
Qwen2.5-Max 被阿里巴巴形容為一款大規模混合專家(Mixture of Experts,MoE)大型語言模型。MoE 的做法,是按照輸入內容選擇不同的「專家」網絡處理問題,而不是每次都啟動模型內所有組件。這樣可以在維持較大總容量的同時,只啟用部分計算資源,改善模型規模與推理效率之間的取捨。
不過,阿里巴巴在公開發布資料中,並未提供足夠細節,讓外界準確確認 Qwen2.5-Max 的總參數量或每次實際啟用的參數量。9
阿里巴巴表示,Qwen2.5-Max 以超過 20 萬億 tokens作預訓練,之後再以整理過的**監督式微調(SFT)及人類回饋強化學習(RLHF)**進行後訓練。簡單講,預訓練主要建立模型的語言及知識基礎;SFT 和 RLHF 則用來改善模型跟從指示、組織答案及配合人類偏好的能力。259
要留意的是,Qwen2.5-Max 並不等於可以下載的 Qwen2.5 模型。較廣泛的 Qwen2.5 系列,包含由 5 億至 720 億參數的基礎模型及指令微調模型,亦有量化版本,開發者可以透過 Hugging Face、ModelScope 及 Kaggle 取得。132
相比之下,Max 被定位為託管式旗艦模型,而不是另一個公開下載的 checkpoint。當時的分析指出,阿里雲 Model Studio 是它的主要服務入口。13
一邊開放、一邊託管:阿里巴巴的雙軌策略
這種安排反映出阿里巴巴很清楚的兩條路線:
- 託管高端模型: 透過 Model Studio 及 Qwen 相關介面,阿里巴巴可以控制最強模型的存取、運算及商業化方式。
- 開放權重模型: 開發者可以下載 Qwen 家族其他成員,自行修改、量化、微調及部署。
Qwen2.5 技術報告列出超過 100 款可透過 Hugging Face、ModelScope 及 Kaggle 等平台取得的模型及變體,亦列出可於阿里雲 Model Studio 使用的 Qwen2.5 MoE 託管版本。132
對開發者而言,這等於在「方便」與「控制」之間作選擇。託管 API 可以省卻自行管理 GPU、部署及維護基礎設施的工夫;開放權重則讓企業更能掌握部署地點、資料流向、客製化程度及微調方式。
阿里巴巴因此可以用開放模型吸引開發者,再透過 Model Studio 把使用量轉化成雲端需求。換句話說,開放模型不一定只代表免費下載,也可以成為雲端商業模式的入口。
Benchmark 表現:聲稱很進取,但要識睇條件
阿里巴巴表示,Qwen2.5-Max 在多項測試中大致追平 Claude 3.5 Sonnet,並勝過 GPT-4o、DeepSeek-V3 及 Llama 3.1 405B。公司特別提到 MMLU-Pro、GPQA-Diamond、LiveCodeBench、LiveBench 及 Arena-Hard 等評估,涵蓋知識、艱深推理、編程、整體能力及人類偏好取向。29
但這些數字必須放回正確背景理解:模型開發商自行進行的評估,只能證明公司在特定設定下量度到甚麼結果,並不能直接證明模型在所有實際生產環境都全面優勝。benchmark 版本、提示語、模型設定,以及訓練資料是否可能與測試內容重疊,都會影響比較結果。當時的報道亦提醒,相關聲稱應該審慎看待。254
較獨立的訊號,來自 2025 年 2 月初報道的群眾評測 Chatbot Arena 排名。Qwen2.5-Max 當時以 1332 分列總榜第七;報道指它在數學及編程分類排名第一,在 Hard prompts 排名第二。1012
這個結果支持了 Qwen2.5-Max 是一款認真、有接近前沿水平的模型,但仍不足以證明它適合每一種任務。Chatbot Arena 也未有全面衡量可靠性、安全性、工具使用、延遲、資料治理或企業支援等部署時同樣重要的因素。
同 GPT-4o、Claude 及 DeepSeek 點樣比較?
較穩妥的結論,應該比阿里巴巴的宣傳標題收窄一點:
- 對 GPT-4o: 阿里巴巴報稱 Qwen2.5-Max 在多項 benchmark 有廣泛優勢,但這些結果應歸於阿里巴巴,並限於所列出的特定測試。29
- 對 Claude 3.5 Sonnet: 阿里巴巴主要將 Qwen2.5-Max 描述為整體相若,而不是證明自己在所有方面都領先。29
- 對 DeepSeek-V3: 這次發布尤其具象徵性,因為阿里巴巴能夠在 DeepSeek 迅速走紅後很快作出回應,並聲稱在多項評估中勝過這個中國競爭對手。25
所以,討論焦點由「中國模型有沒有能力競爭?」逐漸變成「針對哪一種工作負載、部署方式、語言及預算,邊款模型最合適?」
Qwen2.5-Max 與早期 Qwen2.5 有咩關係?
Qwen2.5-Max 延續了 Qwen2.5 這一代模型,但在產品組合中擔當不同角色。較早的 Qwen2.5 家族,重點是提供一系列可以公開取得的模型尺寸,由適合實驗及原型開發的輕量版本,到 720 億參數的旗艦版本都有。132
Max 則補上一個高端託管選項,讓阿里巴巴可以展示接近前沿模型的能力,而不必公開旗艦模型的所有內容,包括權重、完整架構細節及訓練資料。
因此,Qwen 的模式並不是簡單二分為「開源」或「閉源」,而是一種產品組合策略:開放模型用來吸引開發者、建立衍生作品及擴大採用;託管模型則負責商業分發、企業部署及雲端收入。
Qwen 生態亦相當重視多語言及編程場景,除中文及英文外,也支援西班牙文、法文及日文等語言。40 對需要服務亞洲及全球市場的企業而言,這種語言覆蓋和本地化能力,有時比英文 benchmark 上一兩分的差距更實際。
Qwen3:令這套策略更加清楚
阿里巴巴下一步的重要發展,是於 2025 年 4 月推出 Qwen3 開放權重模型家族。首批版本包括 6 款由 6 億至 320 億參數的密集模型,以及 2 款 MoE 模型;其中一款總參數量為 2,350 億,實際啟用參數為 220 億。阿里巴巴透過 Hugging Face、GitHub 及 ModelScope 等渠道,向全球提供這批模型。171831
Qwen3 令 Qwen 產品組合背後的邏輯更加一目了然:阿里巴巴可以把高價值或專門能力留在託管服務內,同時公開一系列不同大小的模型,讓開發者自行執行及改造。Model Studio 就成為開放生態的雲端一端,讓團隊由實驗、微調一路走到託管部署。1718
這個生態後來亦不只停留在模型權重。阿里巴巴介紹過可以在 Apple 硬件上運行的量化 Qwen3 版本,以及在 AMD Instinct MI300X GPU 上支援較大型 Qwen3 模型的方案;針對 Arm 架構流動裝置,也有較輕量的版本。22
這些整合反映,模型競爭不只是比拼預訓練規模,也要看一款模型能否容易地在不同雲端、加速器、手提電腦及邊緣裝置上運行。
點解 Qwen2.5-Max 令前沿模型競賽升溫?
1. 中國 AI 競爭不再似係單一公司的故事
DeepSeek-V3 已經挑戰外界對中國模型能力的既有想像。阿里巴巴的回應則顯示,DeepSeek 並非唯一有能力向接近前沿水平發起衝擊的中國開發者。一家擁有成熟模型家族及大型雲端平台的企業,可以迅速推出新模型、公布強勁結果,再透過現有服務分發。2
2. 模型的「質素」開始包括分發能力
一款模型的商業價值,從來不只由 benchmark 分數決定。開發者同樣會關心 API 是否容易接入、可否自行部署、多語言表現、硬件支援、整合工具,以及能否微調或自建服務。
阿里巴巴在 Qwen 家族及 Model Studio 之間,串連了其中多個渠道。11722
3. 更便宜、更靈活的替代方案開始具備說服力
如果一款模型已經足夠應付編程助手、翻譯、資訊檢索、客戶服務或企業內部 copilot,買家未必需要每一項前沿評估都攞最高分。開放權重、較有效率的 MoE 架構,以及可以經雲端 API 使用的服務,都可以降低採用門檻。
這會迫使昂貴的專有模型供應商,包括 Anthropic,不能只靠「前沿」二字定價,而要用實際優勢證明價值,例如可靠性、安全性、工具使用、長上下文處理、企業控制及服務質素。當時的報道亦形容,中國模型一邊縮窄能力差距,一邊以成本及存取方式積極競爭。47
較可能出現的結果,不是市場即時由某一方完全取代另一方,而是進一步分層:部分企業仍會為最強的封閉模型付費;其他企業則會因為成本、資料控制、本地化及部署彈性,選擇中國模型或開放權重替代品。
「Ox Alpha」到底係咩?
現有提供的證據,未能證實曾有一款名為 Ox Alpha 的中國前沿模型,以已公開發布及可核實的形式,與 DeepSeek-V3 或 Qwen2.5-Max 相提並論。
因此,Ox Alpha 應視為未經核實的名稱或推測,而不應用作評估中國 AI 能力的證據。
即使撇開這個未獲證實的名稱,結論仍然成立:Qwen、DeepSeek 及其他中國開發者,令 AI 前沿變得更加多極。真正的競爭武器,不只是一個更大的模型,還包括 MoE 效率、開放權重、多語言覆蓋、雲端 API、硬件可移植性,以及把模型家族發展成全球開發者生態的能力。