開發者 Ben Davis 讓 Ox Alpha 完成 DeepSWE 的 10 項任務,通過 8 題、約 80%;同一有限測試中,Claude Fable 5 為 65%,GPT 5.6 Sol 為 52%。但樣本太小,不能據此宣稱它登上完整基準測試榜首。 Ox Alpha 擁有 1,048,576 token 上下文視窗,支援文字、圖片與影片輸入,並提供約一週的免費預覽;分詞器與影片編碼等技術指紋,讓外界懷疑它源自智譜 AI 的 GLM 家族,但尚未獲官方證實。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is known about the anonymous AI model “stealth/ox-alpha,” which appeared on OpenRouter on August 20, 2026 with no disclosed creator, a. Article summary: Ox Alpha is an anonymous, short-preview “stealth” model, not a verified new frontier-model release. The evidence makes a Zhipu AI / Z.ai GLM-family origin plausible, but it was still unconfirmed as of August 21, so it sh. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Ox Alpha 最穩妥的定位,是一款匿名公開預覽的「隱身模型」,而不是已經獲得確認的新一代前沿模型發布。它在 2026 年 8 月 20 日出現在 OpenRouter,限時約一週免費使用,主打程式設計、長時間執行的 AI 代理任務,以及結合文字與視覺內容的工作流程。從技術指紋來看,它很可能與智譜 AI(Z.ai)的 GLM 家族有關,但這仍是分析推論,並非已公布的事實。
OpenRouter 將 stealth/ox-alpha 列為由第三方模型供應商開發與營運的模型。供應商在預覽期間選擇不公開身分;OpenRouter 則強調自己只負責轉送請求,並不是 Ox Alpha 的開發者、擁有者或供應商。
這款模型在免費預覽期間標示的規格相當進取:
OpenCode 也透過免費方案提供 Ox Alpha。該平台宣稱模型擁有寬鬆限制及「接近不限量」的使用量,並表示每日可處理 100 兆 token。不過,這是營運方提出的容量說法,並非經獨立審核的實際吞吐量測量。
開發者 Ben Davis 從 DeepSWE 軟體工程基準測試中抽取 10 項任務測試 Ox Alpha。據報它完成其中 8 項,通過率約為 80%;在同一組有限比較中,Claude Fable 5 為 65%,GPT-5.6 Sol 為 52%。
這個結果確實吸睛,但不應被說成 Ox Alpha 正式擊敗了 DeepSWE 全部參賽模型。DeepSWE v1.1 共包含 113 項原創、長流程軟體工程任務,涵蓋 91 個程式碼儲存庫;10 項測試只佔整個基準的一小部分。
這次比較還有幾項不能忽略的限制:
截至當時可見的公開排行榜快照,Claude Opus 5 以 73.6% 居首,GPT-5.6 Sol 為 72.7%,Claude Fable 5 則為 69.7%。 因此,較精確的結論是:Ox Alpha 在 Davis 的 10 項實驗中表現非常強,但這不足以證明它是整體最好的通用程式設計模型。
目前最受關注的身分推測,將 Ox Alpha 與智譜 AI(Zhipu AI,亦稱 Z.ai)及其 GLM 模型家族連在一起。這套說法不是來自公司公告,而是建立在模型行為「指紋」的比對上。
一項報導中的測試,以 25 組提示詞比較 Ox Alpha 與 GLM-5.3 的 token 化行為。結果顯示,扣除固定多出的 75 token 包裝內容後,兩者的原始 token 數量相符。另一些影片測試則聲稱,兩者在視覺 token 的處理上也出現相似特徵,包括畫面取樣、影片長度縮放及解析度處理方式。
外界還指出,Ox Alpha 在回應風格、API 行為及音訊輸入處理方式上,也與 GLM 系列存在相似之處。單獨來看,任何一項線索都可能由共用包裝層、相同基礎設施,甚至模仿行為造成;但分析者認為,多項相對獨立的指紋同時對上,形成了更符合智譜統一多模態 GLM 系列的證據組合。
智譜過去曾以匿名或隱身形式推出模型,例如 Pony Alpha,這為相關推測增添了背景脈絡,但仍不能證明 Ox Alpha 就是由智譜開發。
在報導涵蓋的期間,沒有任何公司公開認領 Ox Alpha,智譜也沒有確認這項歸屬。 外界曾猜測它可能是某個 GLM 變體,但現有證據還無法确定它究竟是尚未發布的模型、生產版本、微調系統,還是使用相關基礎設施的獨立模型。
因此,目前最能站得住腳的描述是:Ox Alpha 很可能衍生自 GLM,並可能與智譜有關,但開發者及確切模型身分仍未獲證實。 個別分析者流傳的信心百分比,也不應被當成官方身分鑑定結果。
對開發者而言,Ox Alpha 最值得留意的實務問題之一,是它的私隱與資料留存說法。
OpenRouter 的 Ox Alpha 模型頁面表示,提示詞與回覆會由底層供應商保留,但不會被用於訓練。
這與 OpenRouter 的一般資料政策並不相同。OpenRouter 表示,除非使用者主動啟用輸入/輸出記錄,否則平台本身不會儲存提示詞或回覆;同時,平台也會分開列出各模型供應商的資料政策。換句話說,路由平台與實際模型供應商可能有不同的留存規則。
另一方面,OpenCode 宣傳 Ox Alpha 具備「零資料留存」政策。 這句話可能是在描述 OpenCode 自己如何處理請求,但不會自動抵銷 OpenRouter 路由所附帶的供應商留存聲明。也就是說,「OpenCode 不保留資料」與「底層模型供應商保留提示詞和回覆」,可以同時描述同一請求路徑中的不同階段。
在供應商發布單一且具合約效力的資料處理政策前,較審慎的做法,是假設模型供應商可能保留使用者提交的內容。開發者不應因為服務免費,或因為平台聲稱不會使用提示詞訓練,就直接上傳專有程式碼、憑證、個人資料或受監管資訊。
Ox Alpha 引起關注,主要有三個原因:限時免費的短期預覽、超大型上下文視窗與多模態能力,以及早期測試中亮眼的程式設計表現。但現有證據支持的是審慎解讀,而不是「匿名實驗室已經確定擊敗所有前沿模型」這種結論。
所謂 80% DeepSWE 成績,實際上是 10 題中完成 8 題,並非完整 113 題基準測試的結果。公開排行榜當時仍由 Claude Opus 5 領先,而 Ox Alpha 也尚未完成官方評測流程。
技術指紋讓智譜/GLM 成為目前最合理的歸屬推測,但尚無公開確認能证明其開發者身分。對於模型實驗而言,Ox Alpha 無疑是值得測試的神秘新選項;但若要用於生產系統或處理敏感程式碼,匿名營運、供應商層級的資料留存,以及未解決的模型身分,都是需要先審慎評估的風險。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
開發者 Ben Davis 讓 Ox Alpha 完成 DeepSWE 的 10 項任務,通過 8 題、約 80%;同一有限測試中,Claude Fable 5 為 65%,GPT 5.6 Sol 為 52%。但樣本太小,不能據此宣稱它登上完整基準測試榜首。
開發者 Ben Davis 讓 Ox Alpha 完成 DeepSWE 的 10 項任務,通過 8 題、約 80%;同一有限測試中,Claude Fable 5 為 65%,GPT 5.6 Sol 為 52%。但樣本太小,不能據此宣稱它登上完整基準測試榜首。 Ox Alpha 擁有 1,048,576 token 上下文視窗,支援文字、圖片與影片輸入,並提供約一週的免費預覽;分詞器與影片編碼等技術指紋,讓外界懷疑它源自智譜 AI 的 GLM 家族,但尚未獲官方證實。
OpenRouter 的模型頁面表示,底層供應商會保留提示詞與回覆、但不會用於訓練;OpenCode 則宣傳「零資料留存」,兩者可能分別描述請求鏈路中的不同環節。