Ox Alpha(stealth/ox alpha)于 2026 年 8 月 20 日出现在 OpenRouter,提供约一周的免费预览,支持 1,048,576 Token 上下文窗口以及文本、图像和视频输入。 一项针对 DeepSWE 10 个任务的独立测试显示,Ox Alpha 得分约为 80%,高于 Claude Fable 5 的 65% 和 GPT 5.6 Sol 的 52%;但样本很小,且未进入 DeepSWE 官方排行榜。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is the anonymous AI model “stealth/ox-alpha” that appeared on OpenRouter on August 20, 2026, and what is known about its free one-week. Article summary: Ox Alpha (`stealth/ox-alpha`) was an anonymously supplied “stealth” frontier model placed on OpenRouter on August 20, 2026, apparently for coding and long-running agentic work. Its developer explicitly remained unnamed d. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Ox Alpha(模型标识为 stealth/ox-alpha)是一款匿名推理模型,于 2026 年 8 月 20 日出现在 AI 模型路由平台 OpenRouter 上。OpenRouter 将其描述为面向高效编程、持续运行的智能体工作流以及生产环境的模型,但提供方只标注为“Stealth”。开发者在预览期间选择保持匿名;截至 2026 年 8 月 21 日的报道截止时间,也没有任何公司公开认领它。72141
免费使用、多模态输入和接近百万级的上下文窗口,很快让它成为开发者集中测试的对象。它在早期编程测试中表现抢眼,但现有证据仍然只是一个积极信号:Ox Alpha 更适合被视为值得验证的预览模型,而不是已经证明在所有任务上领先的通用模型。
Ox Alpha 在初始预览期间免费提供,预览期据称约为一周。其上下文窗口为 1,048,576 Token,最大输出长度为 131,072 Token,支持 文本、图像和视频输入,定位则集中在编程和长时间运行的智能体工作流上。2122
| 参数 | 已报道信息 |
|---|---|
| 模型标识 | stealth/ox-alpha |
| 提供方 | 匿名的“Stealth”提供方 |
| 上线时间 | 2026 年 8 月 20 日 |
| 预览价格 | 预览期间免费 |
| 上下文窗口 | 1,048,576 Token |
| 最大输出 | 131,072 Token |
| 输入类型 | 文本、图像、视频 |
| 目标用途 | 编程、持续运行的智能体任务、生产工作负载 |
百万级上下文窗口对代码仓库级别的开发任务、长篇技术文档和需要持续保留大量工作材料的智能体会话都很有吸引力。不过,能装下多少内容和能否可靠理解这些内容是两回事。上下文容量本身并不能证明模型能够在超长输入中始终保持稳定推理。
引发最大关注的是一项独立测试。测试者从 DeepSWE 中选取了 10 个任务,报告称 Ox Alpha 的成绩约为 80%,而 Claude Fable 5 为 65%,GPT-5.6 Sol 为 52%。611
DeepSWE 是面向软件工程能力的测试,涉及读取真实代码库、定位问题并生成有效补丁。上述结果说明,在这位测试者的设置下,Ox Alpha 在需要处理真实代码和修改补丁的任务中表现强劲。但它还不能直接变成一张“最终排名表”,原因包括:
相关报道明确指出,DeepSWE 官方排行榜当时还没有收录 Ox Alpha。12因此,更稳妥的结论是:它在一次早期测试中释放出了很强的信号,而不是已经确定在编程能力上全面超越所有对比模型。
Ox Alpha 也通过 OpenCode 提供。OpenCode 的预览信息宣传了“零数据保留”,并表示提供方不会使用客户数据训练模型。4549
但 OpenRouter 页面采用了不同措辞:提示词和回复会由提供方保留,但不会用于训练。4354这两种说法不能混为一谈。不用于训练不一定等于不保留数据;而“零数据保留”则是关于存储行为的更强表述。
对开发者而言,实际使用时应把“访问路径”视为隐私决策的一部分。OpenCode 宣传的政策,不能自动推定适用于通过 OpenRouter 或其他中间平台调用的同一个模型。在匿名运营方、数据保留期限和预览结束后的条款都尚不清晰之前,测试时不应提交敏感源代码、凭据、内部文档或密钥。3248
社区研究人员尝试通过模型的行为和技术“指纹”追踪其来源。相关分析提到了分词器行为、Token 计数、视频编码器表现、回复风格以及部分输入处理模式的相似之处,并将这些线索与智谱 AI(Zhipu AI,也称 Z.ai)及其 GLM 系列联系起来。部分推测进一步指向尚未发布的多模态 GLM-5.x 变体。1425
这是当时最主要的来源假设,但证据仍属于间接推断。另有报道指出,社区估算出的服务规模与这一推断并不能完全吻合;同时,智谱 AI 从未官方确认自己开发或运营 Ox Alpha。14
这里需要区分“技术指纹”和“官方认领”:指纹可能暗示模型使用了相同组件、属于相关模型家族,或采用了相似的服务配置,但它并不等同于厂商公告。对于某个具体 GLM 版本给出近乎确定的概率,也超出了当时公开报道能够独立证明的范围。
部分社区讨论将小米的 MiMo 系列列为另一种可能来源。这个猜测在方向上并非毫无依据,因为 MiMo 同样与多模态和编程模型研发有关。不过,现有材料并未建立足够证据证明 Ox Alpha 与 MiMo 存在联系。1
截至当时,最准确的说法是:智谱 AI/Z.ai 的 GLM 系列是领先假设,小米 MiMo 是替代理论,而真正的开发者仍然未知。
Ox Alpha 的发布方式,也让人想起此前与中国 AI 实验室相关的匿名模型测试。其中一个常被提到的例子是 Pony Alpha。此前的报道曾将 Pony Alpha 与智谱 GLM-5 的公开身份联系起来。1454
两者相似的地方主要在于发布策略:一个能力较强的模型先以临时名称或匿名身份出现,开发者可以大规模试用并收集真实反馈,之后再决定是否公布品牌和来源。
这种模式或许能解释 Ox Alpha 的发布策略,但不能证明它与 Pony Alpha 由同一家公司开发,也不能据此推断两者拥有相同架构或训练血缘。
如果只是进行受控测试,Ox Alpha 的参数组合确实颇具吸引力:免费预览、百万 Token 上下文、文本图像视频输入,以及面向编程和智能体任务的定位,都适合用来测试长代码仓库、复杂文档和多步骤工作流。
但在投入生产环境前,至少要留意三点:
Ox Alpha 是一次真实而且相当慷慨的公开预览:它约一周免费使用,提供 1,048,576 Token 上下文窗口、131,072 Token 最大输出,并支持文本、图像和视频输入。它在 DeepSWE 10 项独立测试中取得约 80% 的成绩,确实值得关注,但这不是官方排行榜分数,样本也过小,不能据此宣布它已经成为编程领域的绝对领先者。
关于来源,最有影响力的技术指纹理论指向智谱 AI/Z.ai 的未发布 GLM 系统,小米 MiMo 则是另一种未经证实的可能性。截至报道截止时间,没有任何公司公开认领 Ox Alpha。
因此,Ox Alpha 最适合被当作一个值得在安全、非敏感环境中测试的实验性模型,而不是已经通过全面验证、可以直接承担生产任务的标准答案。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Ox Alpha(stealth/ox alpha)于 2026 年 8 月 20 日出现在 OpenRouter,提供约一周的免费预览,支持 1,048,576 Token 上下文窗口以及文本、图像和视频输入。
Ox Alpha(stealth/ox alpha)于 2026 年 8 月 20 日出现在 OpenRouter,提供约一周的免费预览,支持 1,048,576 Token 上下文窗口以及文本、图像和视频输入。 一项针对 DeepSWE 10 个任务的独立测试显示,Ox Alpha 得分约为 80%,高于 Claude Fable 5 的 65% 和 GPT 5.6 Sol 的 52%;但样本很小,且未进入 DeepSWE 官方排行榜。
社区技术分析最常将其与智谱 AI(Zhipu AI/Z.ai)的 GLM 系列联系起来,小米 MiMo 则是另一种假设;截至 2026 年 8 月 21 日,没有任何公司公开认领该模型。