六天之內,開發者大量使用一個名為 Ox Alpha 的強大模型,卻不知道它來自哪家實驗室。這個模型於 2026 年 8 月 20 日以免費、無開發者署名的形式出現在 OpenRouter 和 OpenCode,提供 1,048,576 Token 的上下文視窗,並能處理文字、圖片與影片。8 月 26 日,Z.ai——智譜 AI(Zhipu AI)的國際品牌——正式確認:Ox Alpha 就是 GLM-5.3-Flash,也是 GLM-5 系列首款原生多模態模型。
2
5
9
這場揭曉,將一次匿名的公開測試轉化為產品發布。GLM-5.3-Flash 隨後以 MIT 授權釋出開放權重,搭配相對低廉的 API 定價,以及針對長上下文程式設計與代理式工作流設計的架構。
6
7
9
Ox Alpha 到底發生了什麼?
Ox Alpha 首次在 OpenRouter 和 OpenCode 上線時,沒有公開開發者、價格為零,具備 1,048,576 Token 上下文上限,並支援文字、圖片和影片輸入。開發者很快把它放進程式設計代理、終端機任務與長上下文工作流中測試。
4
5
8
社群也開始尋找模型身分的蛛絲馬跡。據報導,Ox Alpha 的 Tokenizer 行為與 GLM 系列相似,API 錯誤訊息的模式也透露出線索,因此不少開發者猜測背後可能是智譜 AI。最終,Z.ai 在 8 月 26 日自行確認兩者的關係,並表示匿名部署的目的,是在正式發布前收集真實世界的使用回饋。
5
9
這次預覽帶來異常龐大的使用量。同期一份報告稱,模型在六天內處理了 42 兆個 Token;另一份報告則引用約 44 兆個 Token,以及 503,000 名 OpenCode 使用者。由於這些數字來自不同報告與統計時間點,不應視為單一、已獨立驗證的總數。
8
11
16
GLM-5.3-Flash 是什麼?
GLM-5.3-Flash 是一款針對程式設計、長時間代理任務與多模態工作流打造的開放權重模型。Z.ai 稱它是 GLM-5 家族首款原生多模態模型,支援視覺輸入與百萬 Token 上下文視窗。換句話說,一個任務可以同時納入大型程式碼庫、文件、截圖及其他輸入,而不必頻繁壓縮或捨棄歷史內容。
7
20
它最受矚目的架構,是一個總計 3,200 億參數的混合專家模型(MoE),但每個 Token 僅啟用180 億參數。實際運作時,模型擁有龐大的參數容量,卻只會將每個 Token 路由至其中一部分參數。Z.ai 也表示,GLM-5.3-Flash 結合稀疏注意力與線性注意力,以降低推論時的計算量與 Key-Value Cache 需求。
6
20
這正是「Flash」定位的由來:它並不是小型模型,但目標是在總參數量相近的情況下,比完整啟用所有參數的密集模型更省伺服成本。實際速度與成本仍會受到硬體、推論軟體、批次處理方式及工作負載影響,不能只從模型參數量推斷。
程式設計能力有多強?
Z.ai 報告稱,GLM-5.3-Flash 在 DeepSWE v1.1 的得分為 63.4,高於 GLM-5.2 的 46.2。Z.ai 另公布一項與 Claude Opus 4.8 的內部比較,分數為 29.0 對 29.5。
7
8
這些數字可以視為有用訊號,但不是模型品質的通用排名。DeepSWE 成績屬於供應商公布的基準測試結果,而 Claude 的比較則是內部評估。提示詞、工具、代理框架、測試資料是否遭到污染,以及評分方式的差異,都可能大幅影響結果。在獨立且可重現的測試出現前,還不能據此認定它在整體能力上等同任何封閉式前沿模型。
對開發者而言,更實際的賣點是工作流是否合適:模型能否檢視大型程式碼庫、理解視覺資訊,並在長時間代理任務中持續工作,而不必不斷重新整理任務歷史。真正的生產環境表現,還取決於可靠性、工具使用、延遲和錯誤復原能力,而不只是單一基準分數。
價格、授權與使用方式
Z.ai 公布的 API 標準價格為:每百萬個輸入 Token 0.15 美元,每百萬個輸出 Token 0.50 美元。其文件之後列出限時五折優惠,活動期間價格降至輸入 0.075 美元、輸出 0.25 美元。
2
模型權重則以 MIT 授權發布於 Hugging Face,授權方式比僅提供託管服務的模型更為寬鬆。一般而言,MIT 授權允許商業使用與修改,但實際部署時仍應檢查模型本身的授權條款、相依套件、硬體需求,以及特定部署方式所附帶的義務。
2
9
Z.ai 的開發者文件也將 GLM-5.3-Flash 列入其開發者與程式設計方案生態,API 參考文件則說明了多模態聊天完成輸入及工具使用能力。
17
20
21
「中國製 AI 加速器」說法可信嗎?
這次發布還牽涉另一個更具戰略意味的故事。Z.ai 表示,匿名測試期間的 Ox Alpha 完全部署在中國製 AI 加速器上,並使用客製化、以 SGLang 為基礎的服務堆疊。Z.ai 的工程資料將這次部署描述為:針對國產硬體改善推論效率的實際嘗試。
部分二手報導進一步重述,稱客製化服務堆疊讓端到端效能提升至原本的三倍。不過,目前可取得的來源尚未獨立稽核所使用的加速器種類與規模、精確的效能比較方式,以及整個部署在多大程度上不依賴外國元件。
10
這個區分相當重要。若相關說法獲得驗證,這次部署將對中國在美國晶片出口管制下建立高能力 AI 服務具有戰略意義。但現階段,更適合把它視為一項重要的公司披露,而非國產硬體已全面縮小基礎設施差距的決定性證據。
為什麼 Z.ai 要匿名測試?
Ox Alpha 策略讓 Z.ai 得到傳統產品發布通常難以取得的資料:大量、真實而且混亂的開發者使用情境。使用者之所以把它放進程式設計代理和長上下文工作流,是因為它免費且能力突出,而不是受到一張行銷規格表驅動。Z.ai 表示,匿名測試的目的就是在正式發布前收集回饋。
5
9
這種做法也符合開放權重的分發策略。透過寬鬆授權的模型權重、低 API 價格和廣泛的開發者存取,Z.ai 可以鼓勵實驗、快速取得回饋,並在傳統封閉模型訂閱之外建立使用量。較早的匿名模型實驗,包括據報導的 Pony Alpha 測試,也顯示這可能不是一次性的點子;不過,目前來源對該項早期計畫的細節有限。
這次揭曉對 AI 競爭意味著什麼?
GLM-5.3-Flash 本身並不能證明 Z.ai 已經建立新的整體前沿標竿。目前較有力的證據,是公開規格、異常成功的公開預覽,以及公司公布的基準測試與基礎設施說法。它在程式設計、多模態推理、工具使用、延遲和可靠性方面究竟如何,仍須交由獨立評估與長期生產使用來回答。
但它釋放出的競爭訊號很清楚:一款具備百萬 Token 上下文、原生多模態輸入、開放權重,而且 API 價格以「每百萬 Token 幾角美元」計算的模型,會直接對昂貴封閉式系統的經濟模式造成壓力。這也顯示,匿名預覽可以同時充當真實世界壓力測試與開發者分發引擎。
Ox Alpha 的身分謎團已經解開:它就是 Z.ai 的 GLM-5.3-Flash。接下來真正值得關注的,已不再是模型究竟來自哪裡,而是它從免費、引發話題的預覽,走向可重複、可依賴的生產工作負載後,能否兌現低成本與長上下文的承諾。