Ox Alpha(stealth/ox-alpha)是一個在 2026 年 8 月 20 日突然出現在 OpenRouter 的匿名推理模型。OpenRouter 將它定位為適合高效能程式設計、長時間自主代理工作,以及實際生產環境的模型,但供應商只標示為「Stealth」。開發方表示,在預覽期間選擇保持匿名;截至 8 月 21 日,也沒有任何公司公開承認開發或營運這個模型。72141
免費使用、原生多模態輸入,加上異常龐大的上下文窗口,讓 Ox Alpha 很快成為開發者測試的焦點。它早期的程式設計測試成績確實亮眼,但目前證據仍只足以支持「值得關注的預覽模型」這個結論,還不能把它視為已驗證的整體業界第一。
Ox Alpha 公開的規格
模型在初期預覽期間免費提供,預計持續約一週。公開規格顯示,它的上下文窗口為 1,048,576 Token,最大輸出長度為 131,072 Token;輸入則支援文字、圖片與影片,主要面向程式設計及長時間代理工作流程。2122
| 規格 |
公開資訊 |
| 模型 ID |
stealth/ox-alpha |
| 供應商 |
匿名的「Stealth」供應商 |
| 上線日期 |
2026 年 8 月 20 日 |
| 預覽價格 |
預覽期間免費 |
| 上下文窗口 |
1,048,576 Token |
| 最大輸出 |
131,072 Token |
| 輸入類型 |
文字、圖片、影片 |
| 主要用途 |
程式設計、長時間代理工作、生產環境工作負載 |
這種規模的上下文窗口,對需要一次處理整個程式碼庫、長篇技術文件,或必須保留大量工作資料的代理工作流程相當有吸引力。不過,上下文容量大,不代表模型能可靠地理解或推理其中的所有內容;「能放多少」與「實際表現如何」是兩個不同指標。
DeepSWE 約 80%:成績吸睛,但不能直接當作排名
最受關注的數字,來自一項針對 10 個 DeepSWE 任務的獨立測試。該測試回報 Ox Alpha 的表現約為 80%,相較之下,Claude Fable 5 為 65%,GPT-5.6 Sol 為 52%。611
這些結果顯示,在該測試者的設定下,Ox Alpha 尤其擅長處理涉及真實程式碼庫與修補程式的軟體工程任務。但它們不能構成最終排名,原因包括:
- 測試只涵蓋 DeepSWE 更大規模基準中的 10 項任務。
- 這是獨立評估,不是模型官方提交的成績。
- Ox Alpha 尚未列入 DeepSWE 官方排行榜。
- 小樣本容易受到任務選擇、提示詞、模型設定,以及「接近成功但是否算通過」等判定方式影響。
相關報導也明確指出,Ox Alpha 尚未被納入 DeepSWE 官方排行榜。12 因此,目前最穩妥的說法是:它在早期測試中釋放出強烈訊號,而不是已經確定在程式設計能力上全面超越所有比較模型。
OpenCode 與 OpenRouter 的資料政策並不完全相同
Ox Alpha 同時透過 OpenCode 提供。OpenCode 的預覽訊息宣稱採用「零資料保留」,並表示供應商不會使用客戶資料進行訓練。4549
但 OpenRouter 的模型頁面使用了不同措辭:提示詞與回應會由供應商保留,但不會用於訓練。4354 這兩種說法不能混為一談。「不拿來訓練」不一定代表「完全不保存」;「零資料保留」則是對儲存行為更嚴格的承諾。
對開發者而言,實際使用哪一條存取路徑,本身就是隱私判斷的一部分。OpenCode 宣稱的政策,不應自動被推定適用於 OpenRouter 或其他中介服務。在匿名營運者、資料保留條款及預覽結束後的條件都尚未清楚之前,敏感原始碼、憑證、內部文件與各類密鑰,都不應放進測試提示詞。3248
為什麼社群懷疑是智譜 AI/Z.ai?
社群研究人員試圖透過模型的行為與技術「指紋」追查來源。相關分析提到分詞器行為、Token 計數、影片編碼器、回應風格,以及部分輸入處理模式的相似之處;多項線索被認為與智譜 AI(現稱 Z.ai)及其 GLM 系列有關,推測對象包括尚未發布的多模態 GLM-5.x 變體。1425
這是目前最受支持的來源理論,但仍屬間接證據。另有報導指出,Ox Alpha 表面上展現的服務容量,並不能與這項推論完全吻合;而智譜 AI 也沒有正式聲明自己開發或營運 Ox Alpha。14
這個區分相當重要:技術指紋可能暗示模型共用了某些元件、屬於相近模型家族,或採用了相同的服務配置,但它不等於供應商正式公布身分。現有報導尚不足以支持對某一個具體 GLM 版本作出近乎確定的機率判斷。
小米 MiMo 是另一個可能,但證據不足
部分社群討論則提出小米 MiMo 系列。這項推測在大方向上並非毫無道理,因為 MiMo 同樣與多模態及程式設計導向的模型開發有關;然而,目前提供的證據並未證實兩者存在關聯。1
因此,在目前的資料截點,最準確的表述是:智譜 AI/Z.ai 的 GLM 系列是主要假說,小米 MiMo 是替代理論,而真正的開發者仍然未知。
這種發布方式,像是早期的「神秘模型」預覽
Ox Alpha 的發布方式,也讓人聯想到過去與中國 AI 實驗室有關的匿名模型測試。其中一個常被拿來比較的案例是 Pony Alpha;先前報導稱,該匿名模型在公開身分前,曾被認為與智譜的 GLM-5 有關。1454
兩者相似之處主要在發布策略:高能力模型先以臨時名稱或匿名身分上線,讓開發者大規模測試;營運方則可在掛上公開品牌前,先收集真實世界的使用回饋。這種模式或許能解釋 Ox Alpha 為何如此發布,但不能證明它與 Pony Alpha 擁有相同的持有人、架構或訓練血統。
結論:值得測試,但還不到可以盲目信任的程度
Ox Alpha 是一次相當罕見、條件也十分寬鬆的公開預覽:大約一週免費使用、1,048,576 Token 上下文窗口、131,072 Token 最大輸出,並支援文字、圖片與影片輸入。它在 DeepSWE 早期測試中拿下約 80%,確實值得注意,但測試只有 10 項任務,而且不是官方排行榜成績。
目前最強的來源推測,將它指向智譜 AI/Z.ai 尚未發布的 GLM 系統;小米 MiMo 仍是未獲證實的另一種可能。隱私方面則必須看使用路徑:OpenCode 宣稱零資料保留,OpenRouter 的說法則是供應商會保留資料、但不拿來訓練。
在匿名營運者公開身分、發布長期資料政策,並提供更大規模、可重現的評估之前,Ox Alpha 最適合被視為一項值得在隔離環境中試用的實驗,而不是已經驗證的生產標準。