Qwen2.5-Max 喺 2025 年 1 月登場時,外界焦點唔只係「又一個新模型」,而係阿里巴巴以大型雲服務商身份,將一個聲稱接近前沿水平嘅模型,直接接入企業可用嘅 API 及產品介面。呢個組合令中國 AI 競爭由 DeepSeek 引起嘅單點震撼,進一步變成多家公司、多種商業模式之間嘅正面較量。259
Qwen2.5-Max 到底係咩?
阿里巴巴於 2025 年 1 月 28 至 29 日公布 Qwen2.5-Max,形容佢係當時 Qwen 系列最大、能力最強嘅大型語言模型。模型採用混合專家(Mixture-of-Experts,MoE)架構,預訓練數據超過 20 萬億 tokens,之後再以經整理嘅監督式微調(SFT)及人類反饋強化學習(RLHF)進行後訓練。29
MoE 嘅重點係:模型可以擁有大量總參數,但每次處理請求時,只啟用部分「專家」網絡。理論上,呢種做法可以喺維持較高模型容量嘅同時,減低每次推理所需嘅計算量。不過,阿里巴巴當時公布嘅資料,未足以讓外界獨立確認 Qwen2.5-Max 嘅精確總參數量或實際啟用參數量。9
要分清楚,Qwen2.5-Max 並唔等同於較早推出、可以下載嘅 Qwen2.5 模型。Qwen2.5 開放權重家族包括 0.5B、1.5B、3B、7B、14B、32B 及 72B 等不同尺寸,亦有量化版本;相關模型可經 Hugging Face、ModelScope 同 Kaggle 取得。相反,Max 版本初期主要係託管式服務,並非一開始就公開權重。113
點樣接入?不只是發布模型
Qwen2.5-Max 初期主要經 Alibaba Cloud Model Studio API,以及面向 Qwen 嘅聊天及產品介面提供。對企業客戶而言,呢個安排代表可以直接用 API 將模型接入內部工具、客服系統或其他應用;對阿里巴巴而言,就係將模型能力轉化為雲端用量同企業收入。13
呢個「開放模型生態+託管旗艦模型」嘅策略亦相當關鍵。較細或開放權重模型可以吸引開發者自行部署、微調同整合,Model Studio 就負責託管 API、部署及企業級服務。Qwen2.5 技術報告更提到,公開渠道上可以接觸到超過 100 個模型及變體。1
性能聲稱有幾強?要留意證據層次
阿里巴巴聲稱,Qwen2.5-Max 喺多項評測上大致追平 Claude 3.5 Sonnet,並且幾乎全面勝過 GPT-4o、DeepSeek-V3 及 Llama 3.1 405B。259 公司特別強調嘅測試包括 MMLU-Pro、GPQA-Diamond、LiveCodeBench、LiveBench 同 Arena-Hard,覆蓋艱深知識、數學、編程、推理及一般能力等範疇。912
但要講清楚:呢啲係廠商公布嘅基準測試聲稱,唔可以直接理解成模型喺所有真實生產環境都勝過對手。基準測試會受題目版本、提示詞、評分方法及模型設定影響,亦未必完全反映安全性、穩定性、工具使用能力、長期可靠度或企業整合成本。
早於 2025 年 2 月嘅報道中,Qwen2.5-Max 喺眾包 Chatbot Arena 排行榜取得 1332 分,總排名第七;報道指佢喺數學及編程分類領先,硬題目排名第二。1012 呢個結果顯示模型獲得唔錯嘅用戶偏好,但 Chatbot Arena 始終係會隨時間、參與模型及提示內容變動嘅排行榜,唔係一份涵蓋所有企業需求嘅綜合審核。
所以較穩妥嘅結論係:Qwen2.5-Max 係一個可信嘅前沿水平挑戰者;至於佢係咪「確定擊敗」GPT-4o、Claude 3.5 Sonnet 或 DeepSeek-V3,就應該限定喺阿里巴巴聲稱及特定評測範圍內。29
開放權重同多語言能力,點解會改變戰局?
Qwen2.5 較廣泛嘅開放權重家族,支援多種語言同編程用途,令企業可以按自己需要選擇雲端 API、自建部署或者進一步微調。對唔想完全依賴單一海外供應商、或者有數據管治及部署自主權要求嘅機構而言,呢種彈性本身就係競爭力。1
阿里巴巴之後再以 Qwen3 擴大呢個方向。2025 年 4 月推出嘅 Qwen3 包括六個 dense 模型,尺寸由 0.6B 至 32B;另有兩個 MoE 模型,其中一個總參數量 235B、啟用參數量 22B。478 阿里巴巴亦表示,Qwen3 支援 119 種語言及方言,令其多語言定位更加突出。3
硬件支援同樣係生態策略一部分。阿里巴巴後來推廣可喺 Apple 裝置運行嘅量化 Qwen3 變體,亦提到 AMD Instinct 硬件對 Qwen3 模型嘅支援。換句話講,模型唔一定要綁死喺單一雲平台或加速器供應商上。15
點解 Qwen2.5-Max 令競爭突然升溫?
第一,佢出現喺 DeepSeek-V3 引起全球關注之後,令市場開始相信中國 AI 能力唔係一間公司嘅偶然突破,而係存在更深、更廣嘅研發競爭。阿里巴巴作為成熟雲服務商,可以迅速以 Qwen 家族回應,並將模型放到大規模商業部署渠道。25
第二,競爭焦點由「邊個模型排行榜最高」轉向「邊個模型足夠好、夠平、夠易部署」。對編程、客服、翻譯、文件檢索及內部 Copilot 呢類高用量工作負載,只要模型性能達到實用門檻,較低 API 成本、開放權重、自建部署及本地化支援,都可能令企業重新考慮供應商。
呢個趨勢會迫使 Anthropic、OpenAI 等西方前沿模型公司證明,較高價格可以換來持續性能優勢、更可靠嘅安全控制、工具使用、長上下文表現、企業管理功能及服務支援。近期報道亦形容,中國模型正逐步收窄能力差距,同時以成本優勢競爭。61119
較可能出現嘅唔係即時全面取代,而係市場分層:最重視頂尖能力嘅用戶,仍然可能選擇最強嘅專有模型;對成本、數據自主權或部署靈活性較敏感嘅企業,就會更多考慮中國模型及其他開放權重方案。
「Ox Alpha」係咪另一個中國前沿模型?
就現有可靠資料而言,未有足夠證據證明「Ox Alpha」係一個已正式發布、而且可以同 DeepSeek-V3 或 Qwen2.5-Max 比較嘅中國前沿模型。因此,呢個名稱應視為未經核實嘅標籤或推測,唔應該用作判斷中國 AI 能力嘅證據。
真正重要嘅結論唔依賴 Ox Alpha:Qwen、DeepSeek、Moonshot、Z.ai 等模型開發者,正令前沿 AI 變得更加多極。開放權重、MoE 架構、雲端 API 同較低運行成本,已經由附加賣點變成爭奪開發者、企業客戶及部署市場嘅核心武器。46