一個叫 Ox Alpha 嘅 AI 模型,曾經喺 OpenRouter 同 OpenCode 免費開放畀開發者使用,但冇有註明由邊間公司開發。由 2026 年 8 月 20 日登場開始,佢憑住約 104 萬 Token 上下文、文字加圖片及影片輸入能力,迅速成為編程代理人同長上下文工作流程嘅熱門工具。到 8 月 26 日,Z.ai——智譜 AI(Zhipu AI)嘅國際品牌——終於確認,Ox Alpha 嘅真正身份係 GLM-5.3-Flash。
2
5
9
呢次公開身份,將一場匿名試用變成正式產品發布:模型以開放權重形式推出,採用 MIT 授權,API 定價亦相對低廉,目標係令長上下文編程同 AI 代理工作更具成本效益。
6
7
9
Ox Alpha 點解會引起熱議?
Ox Alpha 初次出現時,開發者見到嘅資料相當有限:模型由 OpenRouter 同 OpenCode 提供、價格係零美元、上下文上限為 1,048,576 個 Token,並支援文字、圖片同影片。大家隨即將佢放入編程代理、終端機任務,以及需要處理大型程式碼庫嘅工作流程實測。
4
5
8
社群之後開始「尋根究底」。有開發者留意到模型嘅 Tokenizer 行為似乎帶有 GLM 系列特徵,API 出錯時顯示嘅錯誤模式亦露出線索,於是推測幕後可能係智譜 AI。最終由 Z.ai 親自確認,並表示匿名部署係為咗喺正式發布前收集真實世界使用回饋。
5
9
匿名試用期間嘅使用量亦非常誇張。同期報道有指,模型喺六日內處理咗 42 萬億個 Token;另一個統計就提到約 44 萬億個 Token,同埋 503,000 名 OpenCode 用戶。不過,呢啲數字來自唔同報道同統計時間點,唔應該當成一個已獲獨立驗證嘅單一總數。
8
11
16
GLM-5.3-Flash 係咩模型?
GLM-5.3-Flash 係一款針對編程、長時間執行嘅 AI 代理任務,以及多模態工作流程而設嘅開放權重模型。Z.ai 形容佢係 GLM-5 系列首個原生多模態模型,即係模型本身由設計開始就能夠處理視覺輸入,而唔係只靠外部工具將圖片或影片轉成文字。
7
20
模型支援最長 1,048,576 個 Token。簡單講,一次任務可以放入大型程式碼庫、文件、截圖、介面畫面等大量資料,減少開發者反覆截短或整理上下文嘅需要。
2
7
佢嘅核心係 3,200 億參數嘅混合專家(Mixture of Experts,MoE)架構,但每個 Token 只會啟用 180 億參數。即係模型整體容量非常大,但處理每一段輸入時,只會揀選其中一部分專家參與運算。
Z.ai 同時表示,GLM-5.3-Flash 結合稀疏注意力同線性注意力,目標係減少推理期間嘅計算量,以及降低 Key-Value Cache 嘅記憶體需求。
6
20
所以「Flash」唔代表佢係一款細模型,而係強調以較少嘅每 Token 運算,提供相對低成本嘅服務。實際速度同成本,仍然會受硬件、服務軟件、批次處理方式同工作負載影響。
編程能力有幾強?
Z.ai 報告指,GLM-5.3-Flash 喺 DeepSWE v1.1 嘅得分係 63.4,高過 GLM-5.2 嘅 46.2。Z.ai 亦公布一項內部比較,GLM-5.3-Flash 同 Claude Opus 4.8 嘅分數分別係 29.0 對 29.5。
7
8
呢啲數字可以視為參考訊號,但唔等於一個涵蓋所有能力嘅全球排名。DeepSWE 成績係模型公司公布嘅基準測試結果,而 Claude 嘅比較亦屬於內部評估;提示詞、工具、代理框架、測試資料及評分方法,都可能影響最終分數。要判斷佢係咪普遍接近任何閉源前沿模型,仍然需要獨立及可重現嘅測試。
對開發者嚟講,更實際嘅賣點係工作流程配合度:模型能否一次過睇大型程式碼庫、理解畫面內容、使用工具,並喺長時間代理任務入面保持目標同上下文。真正放落生產環境,穩定性、延遲、工具調用、錯誤復原能力,往往比單一基準分數更重要。
API 價格、授權同使用方式
Z.ai 公布嘅 API 牌價係:每百萬個輸入 Token 0.15 美元,每百萬個輸出 Token 0.50 美元。官方文件其後列出限時五折優惠,優惠期間價格降至輸入 0.075 美元、輸出 0.25 美元。
2
模型權重就以 MIT 授權上載到 Hugging Face。一般而言,MIT 授權容許商業使用、修改同再發布,彈性比只提供雲端 API 嘅模型高。不過,實際部署前仍然要檢查模型本身嘅授權條款、依賴套件、硬件要求,以及個別部署方式附帶嘅責任。
2
9
Z.ai 文件亦列明,GLM-5.3-Flash 可用於其開發者及編程方案;API 介面支援多模態對話輸入,以及工具使用。
17
20
21
中國 AI 加速器部署:重要,但仍有待核實
發布之後,GLM-5.3-Flash 仲帶出另一條故事線。Z.ai 表示,Ox Alpha 匿名試用期間嘅全部流量,均由中國製 AI 加速器處理;公司亦使用咗基於 SGLang 定制嘅服務架構,並將呢次部署形容為提升國產硬件推理效率嘅工程。
部分二手報道進一步重複一項「端到端效能提升三倍」嘅說法。不過,現有資料未有獨立審核加速器集群規模、實際比較基準,以及整個部署有幾大程度不依賴外國組件。
10
呢個分別相當關鍵。如果相關說法日後獲得驗證,將對中國喺美國晶片出口限制下建立 AI 服務能力具有戰略意義。但以目前證據嚟講,較穩妥嘅理解係:呢次係一項值得注意嘅公司披露,未足以證明中國國產硬件已經全面填補 AI 基礎設施差距。
點解要匿名測試?
Ox Alpha 嘅玩法,畀咗 Z.ai 一種傳統產品發布未必做到嘅測試環境:大量、真實而且唔太「乾淨」嘅開發者使用數據。用戶係因為模型免費、容量大、能力實用而攞嚟寫程式、跑終端機任務同測試 AI 代理,唔係因為睇完一張市場規格表先決定試用。Z.ai 表示,匿名測試目的係正式發布前收集回饋。
5
9
呢種做法亦配合佢嘅開放權重策略。Z.ai 將較寬鬆嘅模型授權、低 API 價格同廣泛開發者接入放埋一齊,鼓勵大家試用、回報問題,再喺傳統閉源訂閱模式以外建立使用量。公司過往據報亦曾經進行名為 Pony Alpha 嘅匿名模型實驗,顯示 Ox Alpha 未必係一次孤立嘅點子;不過,公開資料對前一個項目嘅細節相對有限。
對 AI 競爭有咩意思?
GLM-5.3-Flash 本身未足以證明 Z.ai 已經建立全新嘅整體前沿。現時較有力嘅證據,係公開規格、一次異常成功嘅公開試用,以及公司公布嘅基準同基礎設施說法。佢喺編程、多模態推理、工具使用、延遲同可靠性方面嘅長期表現,仍然要靠獨立評估同實際生產部署決定。
但競爭訊號已經相當清楚:一款擁有百萬 Token 上下文、原生多模態輸入、開放權重,而且 API 價格以每百萬 Token 幾角美金計嘅模型,會直接向高價閉源系統嘅經濟模式施壓。佢亦展示咗匿名預覽可以同時做到兩件事——做大規模真實壓力測試,亦做開發者分發渠道。
Ox Alpha 嘅謎底已經揭開:佢就係 Z.ai 嘅 GLM-5.3-Flash。下一個真正值得關注嘅問題,已經唔係「幕後邊個」,而係模型由免費、帶病毒式傳播效果嘅試用,轉入可重複、可維持嘅生產工作負載之後,低成本同長上下文承諾究竟頂唔頂得順。