謎底在 2026 年 8 月 26 日揭曉:Z.ai 證實,先前以匿名身分在 OpenRouter 與 OpenCode 提供的模型 Ox Alpha,正式名稱是 GLM-5.3-Flash。Z.ai 將它定位為 GLM-5 系列首款原生多模態模型,具備開放權重、約 100 萬 token 上下文,以及針對程式設計與長時間執行代理任務的設計重點。1540
但真正值得注意的,不只是「Ox Alpha 到底是誰」。這次發布採取了先免費、匿名試用,之後才公布品牌與模型權重的做法。Z.ai 因此得以在沒有先公開產品身分的情況下,觀察開發者如何使用模型,並讓服務在真實工作負載中接受考驗。
Z.ai 發布了什麼?
GLM-5.3-Flash 是一款混合專家模型(Mixture of Experts,MoE),總參數量達 3,200 億,但每次處理 token 時實際啟用約 180 億參數。它原生支援文字、圖片與影片輸入,輸出則以文字為主。模型設計的上下文容量約為 100 萬 token;不同平台顯示的精確上限略有差異:Z.ai 文件描述的是 100 萬 token 設計,OpenRouter 則列出 1,310,720 token 的上下文視窗。12340
Z.ai 以 MIT License 發布模型權重,意味著開發者在符合授權條款的前提下,能比使用純封閉 API 的模型更彈性地部署與整合。匿名預覽結束後,模型也以正式名稱登上 OpenRouter。348
需要留意的是,GLM-5.3-Flash 並不是 8 月稍早公布的較大型 GLM-5.3 同一個產品 SKU。相關報導將 Flash 描述為獨立的 320B-A18B 低成本版本,而非較大型 GLM-5.3 產品線的同一模型。10
表現亮眼,但目前主要仍是公司公布的數據
Z.ai 表示,GLM-5.3-Flash 在提升能力的同時,也降低了服務成本。發布時引用的測試結果顯示,它在 DeepSWE v1.1 得分 63.4,高於 GLM-5.2 的 46.2;Z.ai 內部程式設計基準則得分 29.0,接近其公布的 Claude Opus 4.8 29.5。316
這些數字有助於理解 Z.ai 想把模型放在市場的哪個位置,但不能直接視為 Anthropic 模型同等表現的獨立證明。基準測試的定義、評估設定、提示詞與可重現性,都會影響結果。
較穩妥的結論是:Z.ai 宣稱 GLM-5.3-Flash 能以大幅較低的成本,提供強勁的程式設計與代理能力;至於它是否已確定超越封閉式前沿模型,現有資料仍不足以下定論。
免費預覽結束,價格成為新賣點
Ox Alpha 最受矚目的地方之一,是開發者在匿名預覽期間可以免費試用。但模型正式公開身分後,免費階段也隨之結束。Z.ai 公布的牌價為:每百萬輸入 token 0.15 美元,每百萬輸出 token 0.50 美元。13
在發布初期,OpenRouter 顯示的促銷價格更低,為每百萬輸入 token 0.075 美元、每百萬輸出 token 0.25 美元。2 這三種情況應分開理解:免費匿名預覽、Z.ai 官方牌價,以及平台限定的發布優惠,並不是同一種存取條件。
即使按照官方牌價計算,成本仍是這款模型吸引開發者的核心。程式設計代理往往會消耗大量上下文與輸出 token,因此在實際選型時,低 token 成本可能和些微的基準分數差距一樣重要。
中國製 AI 加速器帶來的基礎設施訊號
Z.ai 表示,GLM-5.3-Flash 完全運行於中國製 AI 加速器之上。15 有關其服務系統的報導則提到,Z.ai 建立了客製化、以 SGLang 為基礎的推理技術堆疊,採用了量化、張量並行、混合快取格式、層級切分,以及分離式的 encode–prefill–decode 架構。據報導,這些設計旨在提升端到端服務效率,同時因應國產硬體的資源限制。25
這延續了 Z.ai 過去圍繞 GLM 系列建立的另一條敘事:公司曾表示,GLM 系列在訓練時使用華為昇騰處理器,沒有依賴 Nvidia 硬體。相關報導也指出,Z.ai 被列入美國「實體清單」後,取得 Nvidia H100、H200 與 B200 加速器受到限制。26
這項推理運行宣稱具有戰略意義,但目前仍應視為公司說法與產業報導,而不是經完整稽核的硬體效能比較。較明確的訊號是:Z.ai 正試圖證明,無須依靠 Nvidia 頂級資料中心 GPU,也能大規模服務具備多模態能力的模型。
為什麼 Ox Alpha 的發布方式重要?
這次匿名發布看起來像是一套刻意設計的「隱形發布」流程:先不公布模型歸屬,以免費方式透過熱門程式設計工具提供服務,觀察開發者的實際使用情況,累積回饋後才揭曉產品身分。Z.ai 先前也曾被指與採用類似思路的「Pony Alpha」測試有關;社群研究者則透過 tokenizer 行為、影片處理線索與 API 錯誤模式,嘗試辨認 Ox Alpha 的來源。71113
這種做法的價值在於,模型不是只在實驗室或封閉測試環境裡接受評估,而是直接面對真實的程式設計代理工作負載。對 Z.ai 來說,這同時是一場基礎設施壓力測試、一個蒐集產品回饋的管道,也是一種在正式發布前就累積市場注意力的行銷策略。
發布期間也出現大量使用量與開發者熱烈反應的說法,但現有資料無法獨立驗證每一項數字或引述。因此,這些內容較適合作為發布期間的報導,而非經審計的採用數據。14
對 AI 競爭的真正啟示
GLM-5.3-Flash 並沒有證明 Z.ai 已在所有前沿模型能力上超越 OpenAI 或 Anthropic。它真正展示的是另一種更具顛覆性的組合:多模態輸入、超長上下文、MIT 授權開放權重、針對程式設計代理的最佳化,以及低廉 API 價格,全部集中在同一款產品中。1540
對開發者而言,這種組合可以降低更換模型供應商的成本,也讓自行託管或採用多供應商架構變得更實際。對封閉模型服務商而言,這會增加價格與利潤壓力,尤其是在程式設計工作負載中:token 用量、延遲、部署控制權與硬體可取得性,往往和排行榜上的細小差距同樣關鍵。
換句話說,Ox Alpha 的最大訊息不是「匿名模型擊敗了所有競爭者」,而是 Z.ai 證明了一種值得關注的發布與競爭路線:先用真實流量驗證服務能力,再以開放權重和低價格把模型推向更廣泛的開發者市場。