Ox Alpha 于 2026 年 8 月 20 日匿名出现在 OpenRouter 和 OpenCode,六天后由 Z.ai 确认其真实身份是 GLM 5.3 Flash。[2][5][9] GLM 5.3 Flash 采用总参数量 3200 亿、每个 token 激活 180 亿参数的混合专家架构,支持约 100 万 token 上下文,并以每百万输入 token 0.15 美元、输出 token 0.50 美元的标价提供 API。[6][7][20] 这次发布的看点不仅在于模型架构,也在于分发方式:一个免费且不标注开发者的公开预览,先吸引开发者进行大规模真实使用,再转化为正式产品。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3-Flash, and how did it resolve the week-long mystery surrounding the anonymously released “Ox Alpha” model—covering it. Article summary: GLM-5.3-Flash is Z.ai (Zhipu AI)’s open-weight, natively multimodal GLM-5 model—and the company confirmed on August 26 that it was the previously anonymous “Ox Alpha.” The reveal turned a six-day public stress test into . Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
六天里,开发者一直在使用一个能力不俗、却没有署名的模型:Ox Alpha。它于 2026 年 8 月 20 日出现在 OpenRouter 和 OpenCode,免费开放,支持约 100 万 token 的上下文窗口,以及文本、图片和视频输入。2
5
9
到了 8 月 26 日,谜底揭开。Z.ai——智谱 AI 面向国际市场使用的品牌——确认 Ox Alpha 就是 GLM-5.3-Flash,也是 GLM-5 系列首款原生多模态模型。2
5
9
这场“匿名公测”随即变成了一次产品发布:GLM-5.3-Flash 不仅开放了 MIT 许可证下的模型权重,还以较低的 API 价格面向开发者提供服务,并将重点放在长上下文编程、长期运行的智能体任务和多模态工作流上。6
7
9
Ox Alpha 最初以 stealth/ox-alpha 的形式出现在 OpenRouter,同时也被 OpenCode 用户用于编程代理、终端操作和长上下文任务。页面没有公开开发者名称,价格为零,最大上下文长度为 1,048,576 token,并接受文本、图像和视频等输入。4
5
8
开发者很快开始寻找线索。社区报告称,模型表现出类似 GLM 系列的分词器行为,API 返回的错误信息也透露出一些端倪,因此有人猜测背后可能是智谱 AI。8 月 26 日,Z.ai 最终自行确认了这一关联,并表示匿名部署的目的,是在正式发布前收集真实世界反馈。5
9
预览期间的使用量十分惊人。不过,不同报道采用了不同的统计口径和时间点:一份同期报道提到,模型在六天内处理了 42 万亿 token;另一份报道则提到约 44 万亿 token,以及 50.3 万名 OpenCode 用户。这些数字不应简单合并为一个经过独立验证的总量。8
11
16
GLM-5.3-Flash 是一款面向编程、长期智能体任务和多模态工作流的开放权重模型。Z.ai 将其称为 GLM-5 系列首款原生多模态模型。根据公开文档,它支持视觉输入,并提供 1,048,576 token 的上下文窗口,因此一次任务可以容纳大型代码仓库、长篇文档、截图及其他输入。7
20
它最受关注的技术指标,是总参数量 3200 亿、每个 token 激活 180 亿参数的混合专家架构。简单来说,模型拥有一个规模庞大的“专家池”,但处理每个 token 时只调用其中一部分,而不是让全部参数同时参与计算。
Z.ai 还表示,GLM-5.3-Flash 将稀疏注意力与线性注意力结合起来,以降低推理过程中的计算量和键值缓存(KV cache)需求。6
20 这也是“Flash”定位的由来:它并不是一个小模型,但希望通过更高效的推理设计,达到低于同等总参数量稠密模型的部署成本。
当然,架构优势不等于所有场景下都必然更快或更便宜。实际速度和成本仍会受到硬件、推理框架、批处理方式以及具体工作负载的影响。
Z.ai 报告称,GLM-5.3-Flash 在 DeepSWE v1.1 上取得 63.4 分,高于 GLM-5.2 的 46.2 分。公司还公布了一项内部对比:GLM-5.3-Flash 与 Claude Opus 4.8 的得分分别为 29.0 和 29.5。7
8
这些数字可以作为参考信号,但不能直接当作所有能力维度上的通用排名。DeepSWE 成绩属于厂商报告的基准测试结果,而与 Claude Opus 4.8 的对比则被描述为内部评估。提示词、工具配置、智能体脚手架、测试集污染情况和评分规则,都可能显著影响最终结果。
因此,在独立、可复现的测试出现之前,不能仅凭这组数字断言它已全面等同于某个闭源前沿模型。
对开发者来说,更实际的卖点是工作流适配:模型可以同时查看大型代码仓库、理解视觉信息,并在较长时间跨度内执行智能体任务,而不必频繁压缩或重建上下文。它能否用于生产环境,还要看工具调用稳定性、延迟、可靠性和错误恢复能力,而不仅仅是榜单分数。
Z.ai 公布的 API 标价为:每百万输入 token 0.15 美元,每百万输出 token 0.50 美元。其文档随后列出了限时五折优惠,促销期间价格分别降至 0.075 美元和 0.25 美元。2
模型权重已在 Hugging Face 以 MIT 许可证发布。与只能通过托管 API 使用的模型相比,这种许可证通常更有利于商业复用、修改和本地部署。不过,团队在实际落地前仍应仔细检查具体许可证文本、模型条款、依赖组件、硬件要求以及部署义务。2
9
Z.ai 的开发者文档还显示,GLM-5.3-Flash 已进入其开发者和编程套餐生态,并支持多模态聊天补全输入及工具调用能力。17
20
21
这次发布还有另一条受到关注的消息。Z.ai 表示,Ox Alpha 匿名预览期间的全部流量都运行在中国制造的 AI 加速器上,公司使用了定制的、基于 SGLang 的推理服务栈。Z.ai 的工程材料将这次部署描述为一次提升国产硬件推理效率的尝试。
部分二手报道还转述了“端到端性能提升三倍”的说法。但目前可见的资料并未对加速器集群规模、具体性能对比方法,以及部署在多大程度上摆脱了外国组件进行独立审计。10
这一区分非常重要。如果相关说法得到验证,它将对美国芯片出口限制背景下中国建设 AI 服务基础设施具有战略意义。但在现阶段,更稳妥的表述是:这是 Z.ai 发布的一项重要公司披露,而不是已经足以证明国产硬件全面填补基础设施差距的结论。
匿名发布让 Z.ai 获得了一种传统发布会难以提供的反馈:开发者并不知道模型背后的品牌,因此更可能因为它免费、好用而把它投入编程代理、终端操作和长上下文任务,而不是根据宣传材料做出选择。Z.ai 表示,匿名测试的目标就是在正式发布前收集真实用户反馈。5
9
这种做法也符合开放权重模型的分发策略。通过将宽松许可证、低 API 价格和广泛开发者访问结合起来,Z.ai 可以鼓励试用、快速获得反馈,并在传统闭源订阅模式之外建立模型使用量。
此前有关 Pony Alpha 匿名模型实验的报道,也说明 Ox Alpha 可能并非一次孤立尝试。不过,现有资料对 Pony Alpha 的具体细节有限,不能据此推断两次实验完全相同。
GLM-5.3-Flash 本身并不能证明 Z.ai 已经确立新的总体前沿优势。目前最有力的证据,是公开的模型规格、规模异常可观的公开预览,以及公司公布的基准和基础设施说法。它在编程、多模态推理、工具使用、延迟和可靠性方面的真实表现,仍需要独立评测和持续生产部署来检验。
但它释放出的竞争信号已经相当清晰:一个拥有约 100 万 token 上下文、原生多模态输入、开放权重,并且 API 价格按“每百万 token 几美分”计算的模型,会直接给高价闭源系统的经济模型带来压力。
这次发布也展示了匿名预览的新用途:它既可以是大规模真实压力测试,也可以同时成为产品分发渠道。模型先在用户手中接受检验,之后再揭晓品牌和正式定位。
Ox Alpha 的身份谜题已经解决:它就是 Z.ai 的 GLM-5.3-Flash。接下来的问题不再是“它是谁”,而是一个更实际的问题——当开发者从免费的病毒式预览转向可重复、可持续的生产级工作负载时,这款模型的低成本和超长上下文承诺,究竟能兑现多少。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Ox Alpha 于 2026 年 8 月 20 日匿名出现在 OpenRouter 和 OpenCode,六天后由 Z.ai 确认其真实身份是 GLM 5.3 Flash。[2][5][9]
Ox Alpha 于 2026 年 8 月 20 日匿名出现在 OpenRouter 和 OpenCode,六天后由 Z.ai 确认其真实身份是 GLM 5.3 Flash。[2][5][9] GLM 5.3 Flash 采用总参数量 3200 亿、每个 token 激活 180 亿参数的混合专家架构,支持约 100 万 token 上下文,并以每百万输入 token 0.15 美元、输出 token 0.50 美元的标价提供 API。[6][7][20]
这次发布的看点不仅在于模型架构,也在于分发方式:一个免费且不标注开发者的公开预览,先吸引开发者进行大规模真实使用,再转化为正式产品。