Ox Alpha 其實係一個短暫登場嘅匿名預覽模型,正式身份係 Z.ai GLM 系列嘅 GLM-5.3-Flash。佢喺 2026 年 8 月 20 日,以供應商名稱「Stealth」出現於 OpenRouter 同 OpenCode,提供 1,048,576 Token 上下文、文字/圖片/影片輸入、工具呼叫功能,而且預覽期間免費使用。Z.ai 之後確認,曾經以 ox-alpha 呢個匿名名稱測試 GLM-5.3-Flash,然後先推出正式版本。110
呢次事件之所以值得留意,唔只係因為「神秘模型」終於搵到幕後公司,更加反映咗一個新趨勢:一個模型可以靠分發渠道、超寬鬆使用條件,同埋針對 AI Agent 嘅實用功能,喺正式發表完整模型卡或者基準成績之前,已經先行爆紅。
Ox Alpha 當時有咩料?
匿名上架頁面將 Ox Alpha 定位為面向程式編寫、長時間 Agent 工作,以及生產環境工作負載嘅推理模型。佢喺免費預覽期間嘅規格相當進取:
- 模型 ID:
stealth/ox-alpha
- 上下文容量: 1,048,576 Token
- 最大輸出: 131,072 Token
- 輸入形式: 文字、圖片、影片
- 功能: 推理、原生工具呼叫、結構化輸出
- 預覽價格: 輸入及輸出 Token 均免費
OpenRouter 同 OpenCode 對免費期嘅講法唔完全一樣。OpenRouter 指向較短嘅路由使用期限,而 OpenCode 就形容由 8 月 20 日起大約免費一星期。因此,免費渠道大概喺 8 月 24 日至 27 日之間陸續完結,而唔係所有平台都有一個完全相同嘅截止時間。2412
要留意,擁有 100 萬 Token 上下文,唔代表模型必然更勁,但會改變開發者可以點樣工作。編碼 Agent 可以喺同一個工作階段保留更多程式庫內容、工具輸出、錯誤日誌同視覺資料,減少反覆總結或者刪走舊資訊嘅需要。再加上影片輸入,Ox Alpha 亦適合介面測試等唔止係純文字生成程式碼嘅工作流程。343
點解開發者咁快就留意到?
Ox Alpha 初期最吸引人嘅地方,其實係夠實用,而唔係單純得個神秘。開發者可以零 Token 成本,試用一個長上下文、多模態、支援工具嘅編碼模型,而且供應量相對寬鬆。對於測試程式庫修復、瀏覽器互動,同埋長時間軟件工程任務嘅 Agent 開發者嚟講,入場門檻低咗好多。
模型嘅曝光亦升得好快。佢曾經短暫終結 DeepSeek 喺 OpenCode 排行榜連續 56 日排第一嘅紀錄,亦有報道指使用量喺單日急升。不過,發布期間流傳嘅超大容量同 Token 數字,唔係全部都有獨立審核,所以較適合視為「市場反應非常熱烈」嘅訊號,而唔應該當成精準嘅生產規模統計。114
呢個分別好重要:免費試用期間嘅人氣,通常同時反映模型能力、新鮮感、價格同可用程度,唔可以單靠人氣判斷一個模型係咪整體最強。
DeepSWE 80% 成績亮眼,但未足以下定論
最廣為流傳嘅早期消息,係 Ox Alpha 喺 DeepSWE 測試取得 80%,即係 10 個任務入面完成 8 個。呢個結果的確令人鼓舞,但樣本只有 10 個任務,唔足以支持穩定嘅排行榜排名。其後較大規模測試報告約為 63%,而 Z.ai 後來公布 GLM-5.3-Flash 喺 DeepSWE v1.1 嘅正式成績係 63.4%。7634
其他完整測試則錄得較低結果,包括一次涵蓋 113 個任務嘅報告,結果係 58.4%。該測試指出,部分失分同輸出格式及實作問題有關,亦正好顯示 Agent 基準測試會受到測試框架、工具權限、時間限制,以及成功標準影響。4142
所以,較穩妥嘅結論應該收窄少少:Ox Alpha 展現出強勁嘅編碼 Agent 能力,部分測試中接近頂尖閉源模型,但現有證據未能證明佢持續超越 Claude Fable 5,或者全面壓過其他前沿模型。
點解同 Claude 比較時好似互相矛盾?
因為唔同測試採用咗唔同任務子集、Agent 框架同評估條件。早期 10 個任務有 8 個成功,當然可以得出 80%,但未必代表完整基準測試。較大規模測試約 63%,而 58.4% 嘅完整測試就可能額外計入格式錯誤或測試框架行為造成嘅失分。
之後有報道指 DeepSWE 團隊認為,模型整體能力大致接近 Claude Opus 4.8,而唔係有足夠證據證明佢超越 Claude Fable 5。35 因此,閱讀基準數字時,應該連同測試範圍同設定一齊睇,唔可以將唔同環境下嘅百分比當成同一張乾淨排行榜上嘅分數。
點解連知名開發者都讚佢?
知名用家嘅正面評價,同 Ox Alpha 嘅工作流程定位係一致嘅。Stripe 聯合創辦人兼行政總裁 Patrick Collison 透過 Agent harness 試用後,形容 Ox Alpha「非常令人印象深刻」;HermesAgent 創辦人亦表示,模型表現超過團隊多項內部評估標準。3335
呢類評價對了解實際使用感受有參考價值,尤其係編碼同 Agent 任務方面,但唔等於受控跨基準測試已經證明 Ox Alpha 全面優勝。一個模型可能因為上下文長度、工具呼叫表現、速度、多模態支援或者成本低,而特別適合某種工作流程,即使佢嘅整體基準排名仍然未完全確定。
身份係點樣被社群追查出嚟?
官方揭盅之前,研究者將 Ox Alpha 嘅可觀察行為,同 Xiaomi MiMo 團隊、Google DeepMind,以及智譜 AI(Zhipu AI)嘅 GLM 系列逐一比較。
Xiaomi 同 MiMo
Xiaomi 之所以成為候選者,部分原因係 MiMo 團隊之前曾經用過匿名測試名稱「Hunter Alpha」。但報道指能力特徵唔太吻合:MiMo 模型一般同音訊支援扯上關係,而 Ox Alpha 支援文字、圖片同影片,卻唔接受音訊輸入。換句話講,Xiaomi 係一個合理猜測,但唔係有力歸因。2229
Google DeepMind
同 Google 有關嘅提示及社交平台貼文,亦令外界出現另一輪猜測。但現有線索未能證明 DeepMind 建造或者營運該 API 端點,最多只屬間接迹象。
GLM 嘅技術指紋
揭盅前最有力嘅方向,係智譜 AI 嘅 GLM 系列。社群測試發現,Ox Alpha 喺各種提示下嘅 Token 計數,與 GLM-5.3 嘅表現一致,只有一個約 75 Token 嘅固定偏移;另外,影片測試亦發現其 Token 消耗模式,喺多項編碼特徵上同 GLM 視覺模型吻合。1821
其他被提及嘅線索包括:
reasoning_effort 參數錯誤訊息似乎同 GLM API 回應相近;
- 部分圖片解析失敗時出現中文提示;
- 影片 Token 化行為同智譜多模態模型一致;以及
- 名稱被部分觀察者聯想到智譜過往嘅「Pony Alpha」命名。212629
每一項線索單獨睇,都可能由路由、包裝層、共用基礎設施,甚至模仿行為造成。多項線索放埋一齊,令 GLM 理論愈來愈有說服力,但始終唔可以代替官方聲明。最後真正拍板嘅證據,係 Z.ai 確認 Ox Alpha 就係 GLM-5.3-Flash,並公開正式版本資料。1043
揭盅之後,Ox Alpha 變成咗一件正式產品
身份公開之後,Ox Alpha 由「搵幕後主人」嘅謎題,變成 GLM-5.3-Flash 嘅產品預覽。Z.ai 文件形容,GLM-5.3-Flash 採用混合架構,總共 3,200 億參數,每個 Token 實際啟用 180 億參數;同時具備原生視覺能力,可以觀察介面、渲染結果同互動回饋,形成涵蓋程式碼、瀏覽器同 GUI 嘅閉環。43
正式命名亦解決咗匿名端點最大嘅問題:開發者唔知道服務會唔會突然消失。報道指 GLM-5.3-Flash 以 MIT 授權發布,並提供模型權重,令有需要嘅開發者可以更大程度控制部署方式。1950
當然,MIT 授權唔代表每種部署都自動安全或者便宜。團隊仍然要自行評估硬件要求、推理效能、API 條款、私隱處理、速率限制、工具呼叫可靠性,以及輸出穩定性。
免費期過後,咩因素決定佢能否留低?
免費預覽可以製造聲勢,但長期採用始終要睇更實際嘅產品條件:
- 成本: 收費 API 定價要繼續同其他高能力編碼模型競爭。
- 可靠性: 開發者需要穩定服務、可預測嘅速率限制,同一致嘅工具呼叫表現。
- 私隱: 團隊要清楚提示、程式碼同視覺輸入會點樣儲存或者使用。
- 可重現性: 獨立評估要交代模型喺完整基準測試及真實應用嘅表現。
- 部署選擇: MIT 授權權重同自行託管可以減少對臨時雲端路由嘅依賴,但前提係團隊有能力應付營運要求。
Ox Alpha 最值得記住嘅教訓,唔係一個匿名模型曾經短暫擊敗某個知名對手,而係模型只要工作流程設計夠吸引,開發者又可以大規模、低成本試用,就有機會喺正式公開之前先行走紅。
最初流傳嘅基準測試標題,的確比後來較完整嘅證據更誇張;但長上下文、多模態、工具使用、Agent 編碼同免費接入嘅組合,本身已經足以解釋點解佢受到追捧。如今身份已經確認為 GLM-5.3-Flash,真正考驗就係:當新鮮感同免費使用唔再幫手,呢套組合仲有冇足夠實用價值令開發者繼續用落去。