神秘面紗喺 2026 年 8 月 26 日揭開:Z.ai 證實,之前透過 OpenRouter 同 OpenCode 匿名提供嘅 Ox Alpha,其實就係 GLM-5.3-Flash。Z.ai 形容佢係 GLM-5 系列首款原生多模態模型,採用開放權重、約 100 萬 token 上下文,主打 coding 同長時間運行嘅 agent 任務。 1540
不過,今次新聞重點唔只係「Ox Alpha 到底係邊個」。Z.ai 先以免費、匿名預覽形式推出模型,等開發者喺真實工作流程入面大量使用,之後先將佢變成有正式名稱、可以下載嘅產品。換句話講,呢次發佈同時係一次大規模基建壓力測試、產品驗證,同埋相當高明嘅市場造勢。
Z.ai 實際推出咗咩?
GLM-5.3-Flash 係一款混合專家模型(Mixture-of-Experts,MoE),總共有 3,200 億參數,但每個 token 推理時只啟用 180 億參數。佢原生支援文字、圖片同影片輸入,輸出則以文字為主。模型設計上下文容量約為 100 萬 token;但唔同平台顯示嘅確實上限略有差異:Z.ai 文件描述為 100 萬 token 設計,而 OpenRouter 列出嘅上下文窗口就係 1,310,720 token。 12340
Z.ai 以 MIT License 發放模型權重,對於想自行部署、微調或者建立多供應商架構嘅開發者嚟講,彈性比單純使用封閉式 API 高得多。匿名預覽結束後,模型亦以正式名稱登上 OpenRouter。 348
要留意,GLM-5.3-Flash 唔等於 Z.ai 早前喺 8 月公布嘅較大型 GLM-5.3。報道將 Flash 描述為獨立嘅 320B-A18B、較低成本型號,而唔係大型 GLM-5.3 系列嘅同一個 SKU。 10
效能幾吸引,但主要仍然係廠商自己公布
Z.ai 表示,GLM-5.3-Flash 比 GLM-5.2 有更好表現,同時降低服務成本。發佈期間引用嘅結果包括:DeepSWE v1.1 得分 63.4,高過 GLM-5.2 嘅 46.2;Z.ai 亦報告其內部 coding benchmark 得分為 29.0,接近 Claude Opus 4.8 報告嘅 29.5。 316
呢啲數字可以反映 Z.ai 想將模型放喺市場邊個位置,但唔代表已經有獨立測試證實佢同 Anthropic 模型完全同級。Benchmark 嘅定義、測試設定、prompt 寫法同結果能否重現,都會影響比較。較穩妥嘅結論係:Z.ai 聲稱自己以大幅較低成本,提供強勁 coding 同 agent 能力;但未足以證明 GLM-5.3-Flash 已經全面超越封閉式前沿模型。
免費試用完結,價格取代神秘感
Ox Alpha 最初最吸引開發者嘅地方,就係匿名預覽期間可以免費試用。但模型正式公開身份後,呢個免費階段亦告一段落。Z.ai 列出嘅正式價格係:每 100 萬輸入 token 0.15 美元,每 100 萬輸出 token 0.50 美元。 13
發佈前後,OpenRouter 顯示過較低嘅推廣價格:每 100 萬輸入 token 0.075 美元,輸出 token 0.25 美元。 2 呢度要分清楚三件事:Ox Alpha 嘅免費預覽、Z.ai 官方標價,同平台限時折扣,係三種唔同嘅使用條件。
即使按官方標價計,模型嘅成本效益仍然係賣點。Coding agent 往往會消耗大量上下文同輸出 token,所以當開發者揀模型時,token 價格可能同細微嘅 benchmark 差距一樣重要,甚至更加關鍵。
中國製芯片帶出嘅基建訊號
Z.ai 表示,GLM-5.3-Flash 完全運行喺中國製 AI 加速器上。 15 有關服務系統嘅報道就提到,一套以 SGLang 為基礎嘅定制推理架構,加入量化、tensor parallelism、混合 cache 格式、layer splitting,同埋分開 encode、prefill、decode 嘅架構。據報,目標係喺國產硬件限制下改善端到端服務效率。 25
呢個方向延續咗 Z.ai 過往對 GLM 系列嘅說法:公司曾表示,GLM 系列訓練時使用華為 Ascend 處理器,而冇使用 Nvidia 硬件。相關報道亦指出,Z.ai 被列入美國 Entity List 後,取得 Nvidia H100、H200 同 B200 加速器受到限制。 26
呢個推理部署聲稱具備戰略意義,但現階段應該視為公司及業界報告,而唔係經全面審計嘅硬件效能比較。較可靠嘅重點係:Z.ai 正展示自己嘅模型服務堆棧,可以唔依賴 Nvidia 頂級數據中心 GPU,部署大型多模態模型。
點解要先用「Ox Alpha」個名?
匿名推出似乎唔係臨時起意,而係一套有計劃嘅「神秘發佈」玩法:先唔公開品牌,透過熱門 coding 路線免費提供一款有能力嘅模型,觀察開發者點用,再等系統累積真實反饋後揭曉身份。Z.ai 過去亦曾被指用類似方式測試「Pony Alpha」。至於今次,社群就嘗試由 tokenizer 行為、影片處理特徵同 API 錯誤模式,推測 Ox Alpha 背後嘅模型。 71113
發佈期間亦有報道提到非常高嘅使用量同開發者反應,但現有資料未能獨立核實每一個數字或者引述內容。因此,呢啲資料較適合視為發佈期報道,而唔係經審計嘅採用數據。 14
呢種玩法嘅巧妙之處,在於模型一開始已經置身真實工作負載,而唔係只係喺實驗室 benchmark 入面接受測試。Z.ai 可以睇到模型喺大型 coding agent 場景下嘅實際需求、成本同錯誤模式;到正式揭曉時,市場亦已經對個模型產生好奇同初步印象。
對 AI 競爭有咩啟示?
GLM-5.3-Flash 並未證明 Z.ai 已經喺所有前沿模型能力上超越 OpenAI 或 Anthropic。佢真正展示嘅,係幾項條件可以一次過出現:多模態輸入、超長上下文、MIT 開放權重、針對 coding agent 嘅設計,以及相對低廉嘅 API 價格。 1540
對開發者嚟講,呢種組合可以降低轉換模型嘅成本,亦令自行部署或者採用多供應商架構更加實際。對封閉式模型供應商嚟講,壓力就唔只係排行榜排名,仲包括價格、利潤率、延遲、部署控制權同硬件供應。
尤其喺 coding agent 工作負載入面,模型每次任務可能消耗大量 token;只要能力夠用,較低價格同可下載權重,就可能比單純追求最高 benchmark 分數更有吸引力。Ox Alpha 最終變成 GLM-5.3-Flash,亦正正顯示 AI 模型競爭開始由「邊個模型最強」擴展到「邊個可以用更低成本,穩定地服務真實工作」。