Ox Alpha的谜底已经揭开:它并不是某家尚未现身的新实验室打造的独立模型,而是智谱Z.ai在正式发布前以匿名方式测试的 GLM-5.3-Flash。这款模型于2026年8月20日以“Stealth”供应商身份出现在OpenRouter和OpenCode,随后凭借免费、超长上下文和面向智能体的能力迅速成为开发者圈的热门话题。Z.ai后来确认,GLM-5.3-Flash曾以ox-alpha这一匿名名称接受真实用户反馈。110
这次发布也提供了一个值得观察的案例:在传统模型卡和完整基准成绩公布之前,合适的分发渠道、极低的使用门槛和针对开发者工作流的产品设计,就足以让一款模型先“出圈”。
Ox Alpha当时提供了什么
匿名页面将Ox Alpha定位为面向编程、持续运行的智能体任务和生产工作负载的推理模型。它的预览规格在免费模型中相当激进:
- 模型ID:
stealth/ox-alpha
- 上下文窗口: 1,048,576 Token
- 最大输出: 131,072 Token
- 输入形式: 文本、图片和视频
- 能力: 推理、原生工具调用、结构化输出
- 预览价格: 输入和输出Token均为0美元
不同平台对免费期的描述并不完全一致。OpenRouter曾提示其路线的免费时间更短,OpenCode则表示从8月20日起大约开放一周。因此,8月24日至27日可以视为不同免费入口陆续结束的大致时间,而不是一个所有平台统一公布的截止时刻。2412
百万Token上下文并不意味着模型自动更聪明,但它确实改变了开发者能够尝试的工作方式。编程智能体可以在一次会话中保留更多代码仓库内容、工具输出、日志和视觉信息,减少反复总结或丢弃上下文的需要。视频输入则让它能够参与界面测试等超越纯文本代码生成的流程。343
为什么它能在几天内迅速走红
Ox Alpha最初吸引开发者的原因相当务实:用户可以零Token成本尝试一款拥有百万级上下文、支持多模态输入和工具调用的编程模型,而且可用额度相对宽松。对于正在测试代码修复、浏览器操作和长时间软件工程任务的智能体开发者来说,试错成本几乎降到了最低。
它的热度很快反映在平台数据和社区讨论中。Ox Alpha一度打断DeepSeek在OpenCode排行榜上的56天连冠,并被报道创造了异常高的单日需求。发布期间流传的超大容量和Token处理量并未全部经过独立审计,因此更适合作为“需求非常旺盛”的信号,而不应被当作精确的生产规模数据。114
这一点很重要:免费预览期的流行度,往往同时受到能力、新鲜感、价格和可用性的影响。它本身不能证明模型在所有任务上都是最强的。
DeepSWE成绩亮眼,但远未到“全面碾压”
早期传播最广的说法,是Ox Alpha在DeepSWE上取得 80%:10项任务中完成了8项。这个结果确实令人鼓舞,但10项任务的样本太小,无法支撑稳定的排行榜结论。随后有更大规模测试给出约 63% 的成绩,而Z.ai后来公布的GLM-5.3-Flash官方结果为 DeepSWE v1.1的63.4%。6734
还有完整运行评估给出了更低的 58.4%,覆盖113项任务。该测试称,部分失败与输出格式和实现问题有关,也说明智能体基准对测试框架、工具权限、时间限制和成功标准十分敏感。4142
因此,更稳妥的结论是:Ox Alpha展现出了很强的编程智能体能力,在部分测试中接近第一梯队闭源模型;但现有证据并不能证明它持续超过Claude Fable 5,或在所有场景下都优于其他前沿模型。
为什么它和Claude的比较看起来互相矛盾
不同测试使用了不同的任务子集、智能体框架和评估条件。早期10项任务的样本完全可能得到80%的结果,却不代表整个基准。扩大测试范围后,成绩接近63%;而58.4%的完整运行结果,则可能额外计入了格式错误或测试框架行为造成的扣分。
之后有报道称,DeepSWE团队更倾向于认为该模型的整体能力大致接近Claude Opus 4.8,而不是把它视为已经确定超越Claude Fable 5的证据。35所以,基准分数必须连同样本范围、测试设置和工具条件一起解读,不能把不同实验中的数字当成同一张排行榜上的可直接比较结果。
为什么一些知名开发者仍然称赞它
业内人士的积极反馈,与Ox Alpha的工作流特征是一致的。Stripe联合创始人兼CEO Patrick Collison在通过智能体框架使用后称其“非常令人印象深刻”;HermesAgent创始人也表示,模型表现超过了团队内部多项评估标准。3335
这类反馈对于判断模型在真实编程和智能体任务中的实用性很有价值,但它们不等于一项受控的跨基准结论。模型可能因为上下文长度、工具调用方式、速度、多模态支持或成本,在某个具体工作流中格外好用,即便它在综合排行榜上的位置仍然存在争议。
社区是如何追踪它的真实身份的
在官方揭晓之前,研究者曾将Ox Alpha与小米MiMo团队、Google DeepMind和智谱AI的GLM系列进行比对。
小米与MiMo:有先例,但能力对不上
小米之所以被认为有可能,是因为MiMo团队此前曾以匿名的“Hunter Alpha”进行测试。不过,社区观察到两者存在能力差异:MiMo模型与音频支持有关,而Ox Alpha支持文本、图片和视频,却不接受音频输入。小米因此是一个合理猜测,但并非有力归因。2229
Google DeepMind:线索仍停留在间接层面
与Google有关的暗示和社交平台信息曾进一步推高猜测,但现有线索无法证明DeepMind构建或运营了该接口。它们更多是环境性线索,而不是能够锁定开发者的证据。
最终指向GLM的“指纹”
正式揭晓前,最强的证据指向智谱的GLM系列。社区测试发现,Ox Alpha在多种提示词下的Token计数与GLM-5.3相符,只是每次请求似乎固定多出约75个Token,可能来自隐藏的系统提示词或路由包装。独立的视频测试还发现,其Token消耗方式与GLM视觉模型在多项编码特征上保持一致。1821
其他被报道的线索包括:
- 与GLM API响应相似的
reasoning_effort错误;
- 图片解析失败时出现中文提示词;
- 与智谱多模态模型一致的视频Token化行为;
- 名称与智谱此前使用过的“Pony Alpha”术语存在相似性。212629
单独来看,这些线索都可能由路由、接口包装、共享基础设施或仿制行为造成。它们合在一起,使GLM猜测越来越可信,但仍不能替代官方声明。最终的决定性证据,来自Z.ai确认Ox Alpha就是GLM-5.3-Flash,并发布了正式版本及相关文档。1043
身份揭晓后,真正的产品是什么样
官方确认让Ox Alpha从“匿名模型谜案”变成了GLM-5.3-Flash的公开预览版。Z.ai文档显示,正式模型采用混合架构,总参数量为 3200亿,每个Token激活 180亿 参数;它还具备原生视觉能力,可以观察界面、查看渲染结果和读取交互反馈,在代码、浏览器和图形界面之间形成闭环。43
正式发布还解决了匿名接口最明显的缺点:持续性不确定。相关报道显示,GLM-5.3-Flash以 MIT许可证发布权重,开发者可以获得更大的部署和控制空间。1950
不过,开放权重并不意味着部署天然安全或便宜。团队仍需评估硬件要求、推理速度、API条款、隐私处理、限流政策、工具调用稳定性和输出一致性是否适合自己的业务。
免费期结束后,它能否真正留下来
免费预览带来了注意力,但长期采用取决于更扎实的产品因素:
- 经济性: 付费API价格是否能与其他高能力编程模型竞争。
- 可靠性: 开发者需要稳定的服务、可预期的限流和一致的工具调用表现。
- 隐私: 团队必须明确提示词、代码和视觉输入如何保存或使用。
- 可复现性: 独立评测需要说明模型在完整基准和真实应用中的表现。
- 部署选择: MIT许可证权重可以降低对临时托管入口的依赖,但前提是团队具备满足运营要求的基础设施。
Ox Alpha最核心的启示,并不是“一个匿名模型短暂击败了某个知名竞争对手”。更重要的是,当模型拥有清晰的工作流价值,并且开发者可以低成本、大规模地试用时,它完全可能在正式产品发布前就迅速扩散。
它的基准成绩比最初的标题更复杂,但长上下文、多模态、工具调用、智能体编程和低成本访问的组合,确实足以解释这场热潮。如今身份已经确定为GLM-5.3-Flash,下一道考题是:当新鲜感和免费额度不再提供助力后,这套能力组合是否仍然值得开发者留下。