开发者Ben Davis在DeepSWE的10道任务测试中让Ox Alpha通过8道,成绩约为80%;Claude Fable 5为65%,GPT 5.6 Sol为52%,但样本太小,不能据此认定它登顶完整榜单。 Ox Alpha拥有1,048,576个Token的上下文窗口,支持文本、图像和视频输入,并提供为期约一周的免费预览;分词器和视频编码等技术指纹让智谱GLM系列成为目前最主要的归因猜测,但没有公司确认这一点。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is known about the anonymous AI model “stealth/ox-alpha,” which appeared on OpenRouter on August 20, 2026 with no disclosed creator, a. Article summary: Ox Alpha is an anonymous, short-preview “stealth” model, not a verified new frontier-model release. The evidence makes a Zhipu AI / Z.ai GLM-family origin plausible, but it was still unconfirmed as of August 21, so it sh. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Ox Alpha更准确的定位,是一个匿名公开预览模型,而不是已经确认身份的新一代前沿模型发布。它于2026年8月20日出现在OpenRouter,提供约一周的免费访问,主打编程、长周期智能体任务和多模态工作流。其技术特征确实让“来自智谱AI(Z.ai)GLM系列”的猜测具有一定可信度,但这仍是技术推断,并非官方公布的事实。
OpenRouter将stealth/ox-alpha列为由第三方开发和运营的模型。模型提供方在预览期间选择匿名,OpenRouter则负责请求路由,并明确表示自己不是该模型的开发者、所有者或提供方。
对于一个免费的限时预览来说,Ox Alpha公布的规格相当激进:
开源终端编程智能体OpenCode也通过其免费层提供了Ox Alpha。OpenCode的公告称,该模型拥有较宽松的使用限制,接近“无限使用”,并宣称每天可承载100万亿个Token的调用量。不过,这个数字是运营方的容量声明,并非经过独立审计的实际吞吐量测量。
开发者Ben Davis从软件工程基准DeepSWE中抽取了10道任务,对Ox Alpha进行了测试。据报告,它通过了其中8道,成绩约为80%。在同一组有限的对比测试中,Claude Fable 5为65%,GPT-5.6 Sol为52%。
这个结果足够吸引眼球,但不能被写成Ox Alpha正式赢下DeepSWE。DeepSWE v1.1包含113道原创、长周期软件工程任务,覆盖91个代码仓库,因此10道题只占完整基准的一小部分。
这组对比还有几项重要限制:
当时可见的公开排行榜快照显示,Claude Opus 5以73.6%位居第一,GPT-5.6 Sol为72.7%,Claude Fable 5为69.7%。因此,较为稳妥的结论是:Ox Alpha在Davis选取的10道题中表现非常强,但这并不能证明它是综合能力最强的通用编程模型。
目前最主要的归因理论,是将Ox Alpha与智谱AI(Z.ai)及其GLM模型家族联系起来。这个判断主要来自“模型指纹”分析,而不是任何公司的官方声明。
据报道,有研究者用25组提示词比较Ox Alpha与GLM-5.3的分词行为。扣除一个固定增加的75个Token包装后,两者的底层Token数量 reportedly 完全一致。另一些视频测试还发现,两者在视觉Token处理上存在相似之处,包括抽帧方式、时长缩放和分辨率处理策略。
其他被报告的相似点还包括输出风格、API行为,以及模型处理音频输入的方式。单独看,其中任何一个线索都可能由共用包装层、相同基础设施或模仿行为造成;但分析者认为,多项相对独立的特征同时吻合,形成了更强的证据链,与智谱统一多模态GLM路线相符。
智谱此前曾使用Pony Alpha等匿名或隐身式名称进行测试,这也提供了一些背景上的合理性。不过,这并不能证明Ox Alpha就是智谱开发的。
在相关报道所覆盖的时间段内,没有任何公司公开认领Ox Alpha,智谱也没有确认这一归因。社区中还出现过对具体GLM变体的猜测,但现有证据无法确定Ox Alpha究竟是尚未发布的新模型、生产版本、微调系统,还是使用相关基础设施的独立运营模型。
因此,最严谨的说法是:**Ox Alpha很可能与GLM家族存在技术渊源,也可能与智谱有关,但开发者和确切模型身份仍未得到验证。**个别分析者给出的置信度百分比,不应被当作官方身份鉴定结果。
对于开发者而言,Ox Alpha最值得注意的实际问题之一,是它的隐私和数据留存说明。
OpenRouter的Ox Alpha页面称,提示词和生成内容会由底层模型提供方保留,但不会用于训练。
这与OpenRouter的一般数据收集政策并不矛盾,但两者针对的是不同环节。OpenRouter表示,除非用户主动开启输入输出日志,否则平台本身不会保存提示词或回复;与此同时,平台会单独记录各模型提供方的数据处理政策,因此路由层与模型提供方可能采用不同的留存规则。
另一方面,OpenCode宣传Ox Alpha具备“零数据留存”。这可能描述的是OpenCode自身对请求的处理方式,但不会自动覆盖OpenRouter路由所披露的底层提供方留存政策。换句话说,“OpenCode不保留数据”和“底层模型提供方会保留提示词与生成内容”,可以分别描述同一次请求在不同环节的处理情况。
在相关提供方发布统一、明确且具有合同约束力的数据处理政策之前,更稳妥的假设是:模型提供方可能保留用户提交的内容。开发者不应因为服务免费,或因为页面写着“不用于训练”,就直接上传专有源代码、凭据、个人信息或受监管数据。
Ox Alpha之所以引发关注,主要有三个原因:限时免费预览、超过百万Token的超大上下文和多模态能力,以及早期编程测试中相当亮眼的成绩。但现有证据更支持谨慎解读,而不是“某个神秘实验室已经确定击败所有主流前沿模型”这样的结论。
所谓80%的DeepSWE成绩,来自10道题中通过8道,而不是完整的113道任务。公开排行榜当时仍由Claude Opus 5领跑,Ox Alpha也尚未完成官方评测流程。
它的分词器、视频编码和其他技术指纹,使“智谱/GLM系”成为目前最有说服力的解释,但没有公开确认能够证明其开发者身份。对于个人测试和研究,Ox Alpha无疑是一个值得观察的匿名模型;但对生产系统或敏感代码来说,匿名所有权、提供方的数据留存规则以及未解决的模型身份,都意味着使用时应当留有余地。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
开发者Ben Davis在DeepSWE的10道任务测试中让Ox Alpha通过8道,成绩约为80%;Claude Fable 5为65%,GPT 5.6 Sol为52%,但样本太小,不能据此认定它登顶完整榜单。
开发者Ben Davis在DeepSWE的10道任务测试中让Ox Alpha通过8道,成绩约为80%;Claude Fable 5为65%,GPT 5.6 Sol为52%,但样本太小,不能据此认定它登顶完整榜单。 Ox Alpha拥有1,048,576个Token的上下文窗口,支持文本、图像和视频输入,并提供为期约一周的免费预览;分词器和视频编码等技术指纹让智谱GLM系列成为目前最主要的归因猜测,但没有公司确认这一点。
OpenRouter称底层模型提供方会保留提示词和生成内容、但不会用于训练;OpenCode则宣传“零数据留存”。这两种说法可能针对请求链路中的不同环节,敏感数据仍应谨慎提交。