Ox Alpha 登場嗰陣,幾乎冇人知道佢係邊間公司整嘅。呢個模型大約喺 8 月 20 日登上 OpenRouter,以免費「stealth model」身份提供服務,主打程式編寫、長時間運作嘅 AI 代理任務,以及實際生產工作流程。短短幾日,佢已經衝上平台使用量榜首,更一度超越 DeepSeek。1710
謎底喺 8 月 26 日揭開:北京 AI 公司 Z.AI(亦稱智譜、Zhipu)確認,Ox Alpha 係旗下 GLM 系列嘅新模型。公司同時表示會公開模型權重,令一次原本帶有神秘色彩嘅市場預覽,變成中國開放權重模型能否持續吸引全球開發者嘅實戰測試。318
Ox Alpha 到底係咩模型?
OpenRouter 將 Ox Alpha 描述為面向程式開發及「代理式」工作的推理模型,適合處理長週期軟件工程、複雜推理,以及結合文字同視覺內容嘅工作流程。15
佢公開標示嘅能力包括:
- 約一百萬 token 上下文窗口
- 接受文字、圖片及影片輸入
- 支援工具呼叫
- 程式編寫及軟件工程任務
- 可以持續運行嘅 AI 代理工作流程
- 預覽期間限時免費使用1517
對開發者嚟講,超大上下文窗口特別適合用嚟測試大型程式碼庫,或者畀 AI 代理保留大量任務歷史。不過,目前報道未有交代完整技術規格,包括獲確認嘅參數規模;而且亦未有足夠獨立測試,可以全面證實佢喺各類基準測試中嘅表現。
點解佢可以成為 OpenRouter 最大型發布之一?
Ox Alpha 爆紅,主要係三樣嘢互相推動:免費、表現同神秘感。
第一,模型唔使錢。開源程式開發代理 OpenCode 表示,預覽期大約維持一星期,使用量接近不限;但 OpenRouter 另一則通知就指,相關路由可能早至 8 月 24 日結束。換句話講,當時唔同公告對免費試用確實完結日期並唔一致。1715
第二,開發者早期試用反應唔錯。有人將模型接入編程工具,直接放入真實軟件庫測試,令 Ox Alpha 唔只係基準測試愛好者嘅玩具,而係迅速接觸到真正做開發工作嘅用戶。5
第三,匿名身份製造咗一場「盲測」效果。開發者喺唔知道品牌嘅情況下評估模型,大家對佢來源嘅猜測亦進一步推高社交平台討論度。到 8 月 26 日,Ox Alpha 已經登上 OpenRouter 排行榜首位,報道指其使用量超過 DeepSeek 兩倍。3810
不過,呢個數字要睇得精準啲。佢反映嘅係單一模型市場、喺大量補貼嘅預覽期內嘅活動量,唔代表全球整體使用量,更唔係模型質素嘅最終排名。免費服務本身就會鼓勵大量試用,而匿名設定亦令唔少人出於好奇而親自測試。
Z.AI 確認:Ox Alpha 來自 GLM 系列
Z.AI 嘅確認,將 Ox Alpha 同公司嘅 GLM 模型家族連接起來。Z.AI 早前已經將 GLM-5.3 定位為主打程式編寫同 AI 代理能力嘅開放模型,並聲稱喺部分測試中接近 Anthropic 嘅 Fable 5。
公司公布嘅數據包括 Terminal-Bench 3.0 得分 28.3%,以及 DeepSWE 1.1 得分 66.9%。呢啲數字由 Z.AI 自己發布,並被公司形容為開放模型中嘅領先成績。
但要留意,廠商公布嘅數據唔等於獨立證明 GLM-5.3 或 Ox Alpha 可以擊敗所有頂尖閉源模型。現有資料其中一項比較顯示,GLM-5.3 喺 Z.AI 自己嘅程式編寫基準測試中仍低於 Fable 5;其他測試就各有勝負。
較穩妥嘅結論係:Z.AI 已經做出一個認真嘅程式編寫及 AI 代理競爭者,而唔係單憑 Ox Alpha 事件,就可以話中國模型已經全面領先。
「牛來」係咩意思?邊啲仍然未獲確認?
中國網民就用「Ox」呢個字,將 Ox Alpha 同近期上映嘅中國動畫電影《牛來》聯繫起來,並開始叫佢做「牛來」。由於模型一開始冇正式公開身份,呢個外號很快就喺網上流傳。2
現有報道支持兩點:一係「牛來」係社群叫法,二係供應商喺預覽期間刻意隱藏身份。但資料未能證實 Z.AI 曾經公開交代,點解要借用電影相關稱呼,或者點解要隱藏模型所有權。因此,「牛來」應該理解為社群外號,而唔一定係產品正式名稱。17
匿名測試帶來嘅掌聲,同時亦有風險
呢次發布受到嘅關注,遠遠超出專業基準測試圈。Stripe 行政總裁 Patrick Collison 形容 Ox Alpha「非常令人印象深刻」;喺身份揭曉之前,開發者同觀察人士就曾經估佢可能來自 Z.AI、Microsoft 或其他 AI 實驗室。91116
呢種反應正好反映匿名測試嘅優點同限制。刪走熟悉品牌,可能減少用戶因品牌聲譽而產生嘅預期效應;但同一時間,開發者亦失去部署模型時通常需要知道嘅基本資料,例如由邊間公司營運、提示內容喺邊度處理、資料會保留幾耐,以及預覽結束後有冇支援。
更實際嘅問題係資料治理。據報 OpenRouter 嘅模型頁面曾經提示,提示內容同模型回覆會由匿名供應商保留。1 如果開發者將專有程式碼放入去測試,咁就唔可以只睇性能,亦要考慮資料會去邊、點樣保存同有冇合規風險。
公開權重、免費試用,以及未公開嘅長遠價格
Z.AI 表示,Ox Alpha 匿名預覽結束後會公開模型權重。其後報道指,公開版本名為 GLM-5.3-Flash,並已經透過 Hugging Face 提供權重,開發者可以下載、修改同以此為基礎開發新工具。3
呢個分別相當重要。託管式預覽主要係畀你經 API 使用服務;公開權重就有機會令機構喺自己嘅基礎設施上運行、調整或者評估模型,當然仍然要視乎適用授權條款、硬件要求同安全控制。
至於預覽期,公開說法普遍係限時免費約一星期。當時可見報道未有提供可靠嘅長期 API 價格,所以開發者唔應該將暫時零成本,當成模型日後商業模式或者實際運算成本嘅證據。115
Ox Alpha 反映中國 AI 競爭去到邊一步?
Ox Alpha 唔係一場孤立嘅「神秘發布」,而係更大趨勢嘅一部分。中國 AI 實驗室愈來愈集中發展程式編寫、自主代理、快速發布、低價入場,以及公開模型權重。阿里巴巴嘅 Qwen3.8-Max 亦曾被報道喺部分基準測試中追平甚至超越 Anthropic 嘅 Fable 5;不過,呢類比較同樣要留意測試設計同能否由獨立團隊重現。
對美國 AI 公司嚟講,最直接嘅壓力會出現喺開發者 API 同開放權重生態。只要一個能力夠強嘅模型可以免費試用,或者公開後以較低成本運行,開發者就更容易做實驗,市場亦會面對更大減價壓力,唔再咁依賴閉源平台。
但使用量高,唔代表策略一定賺錢。報道指,智譜 2025 年收入上升 132%,但公司喺 1 月上市後亦公布咗相當大嘅經調整虧損。呢組數字帶出一個核心商業問題:用補貼換返來嘅試用同病毒式增長,究竟可唔可以變成持續收入同健康利潤率?
對開發者最實際嘅啟示
Ox Alpha 嘅重要性,唔只係一個匿名模型曾經喺 OpenRouter 使用量榜超越 DeepSeek。真正值得留意嘅係佢採用嘅發布方法:先隱藏品牌、取消價格門檻,畀開發者喺真實工作流程中試用,再將產品接返去一個公開模型家族。
呢種做法可以喺短時間內製造全球關注,亦畀實驗室收集用戶反饋同採用數據。不過,對開發者嚟講,模型來源、資料處理、授權條款、基準測試方法,以及預覽結束後嘅價格,都必須逐項核實,尤其唔應該未搞清楚之前,就將敏感程式碼或者正式生產工作交畀模型處理。
所以,Ox Alpha 最適合被理解為 AI 競爭正在加速嘅證據,而唔係證明任何一個國家嘅模型已經全面超越其他對手。