谜底在2026年8月26日揭晓:Z.ai确认,先前通过OpenRouter和OpenCode匿名提供的模型Ox Alpha,正是GLM-5.3-Flash。Z.ai将其定位为GLM-5系列首款原生多模态模型,拥有开放权重、约100万Token上下文窗口,并重点面向编程和长流程智能体任务。 1540
但这次发布值得关注的,并不只是“Ox Alpha到底是谁”。Z.ai先以匿名、免费预览的方式让开发者使用模型,随后再公布正式名称、价格和权重。这样的路径既制造了市场关注,也让模型在真实工作负载中接受了基础设施压力测试。
GLM-5.3-Flash到底发布了什么
GLM-5.3-Flash是一款混合专家模型(MoE),总参数量为3200亿,每个Token生成过程中激活约180亿参数。它原生支持文本、图片和视频输入,输出形式为文本。Z.ai文档将其上下文能力描述为约100万Token;不同平台显示的具体数值并不完全一致,例如OpenRouter列出的是1,310,720个Token。 12340
Z.ai以MIT许可证发布模型权重。这意味着,与只能通过封闭API调用的模型相比,开发者和企业拥有更大的部署与二次开发空间。匿名预览结束后,OpenRouter也以GLM-5.3-Flash的正式名称列出了该模型。 348
需要注意的是,GLM-5.3-Flash并不是8月早些时候发布的更大型GLM-5.3产品。现有报道将Flash描述为独立的320B-A18B型号,而不是更大规模GLM-5.3产品的同一SKU。 10
性能数据亮眼,但主要仍是厂商口径
Z.ai表示,GLM-5.3-Flash相比GLM-5.2提升了能力,同时降低了服务成本。在发布前后引用的测试结果中,它在DeepSWE v1.1上获得63.4分,高于GLM-5.2的46.2分;在Z.ai内部编程基准上,它获得29.0分,接近报道中Claude Opus 4.8的29.5分。 316
这些数字可以帮助理解Z.ai希望如何定位这款模型,但还不能独立证明它已经与Anthropic的模型完全相当。基准测试的定义、提示词、运行设置以及结果能否复现,都会影响最终结论。
更稳妥的说法是:Z.ai宣称GLM-5.3-Flash能以显著更低的成本提供强劲的编程和智能体能力,而不是已经被独立评测证实全面超越闭源前沿模型。
免费预览结束,价格成为核心卖点
Ox Alpha最引人注目的地方之一,是开发者在匿名预览期间无需付费即可试用。随着模型获得正式身份,这一免费阶段结束。Z.ai公布的标准API价格为:每百万输入Token 0.15美元,每百万输出Token 0.50美元。 13
发布期间,OpenRouter显示了更低的促销价格:每百万输入Token 0.075美元,每百万输出Token 0.25美元。因此需要区分三种不同情况:Ox Alpha的免费预览、Z.ai的标准价,以及平台自行提供的限时折扣。 2
对于编码智能体而言,价格差异尤其重要。这类应用往往会反复读取代码库、运行多轮工具调用并生成大量输出。相比排行榜上小幅的分数差距,更低的Token成本、可控的延迟和部署灵活性,可能直接影响开发者选择哪款模型。
中国芯片基础设施释放了什么信号
Z.ai表示,GLM-5.3-Flash完全运行在中国制造的AI加速器上。 15 关于其服务系统的报道提到,Z.ai构建了基于SGLang定制的推理栈,并结合量化、张量并行、混合缓存格式、层拆分,以及独立的编码—预填充—解码架构。相关方案旨在提升端到端服务效率,同时适应国产硬件的资源约束。 25
这延续了Z.ai此前围绕GLM系列形成的技术叙事:公司曾表示,GLM系列训练使用华为昇腾处理器,未依赖英伟达硬件。相关报道还指出,Z.ai被美国列入实体清单后,获取英伟达H100、H200和B200等加速器受到限制。 26
不过,“完全运行在中国芯片上”应首先被理解为Z.ai及相关行业报道中的公司声明,而不是经过全面审计的硬件性能对比。较为确定的战略信号是:Z.ai正试图证明,在不依赖英伟达领先数据中心GPU的情况下,也可以为大型多模态模型提供规模化推理服务。
为什么要把模型藏起来发布
Ox Alpha的发布方式很像一套经过设计的“隐身发布”流程:先不公布厂商身份,以免费方式接入热门编程渠道;观察开发者如何使用模型、收集真实反馈;待模型获得足够关注后,再揭晓品牌并发布正式权重。
Z.ai此前被认为曾通过“Pony Alpha”进行过类似测试。此次Ox Alpha出现后,社区研究者还尝试从Tokenizer特征、视频处理行为和API错误模式等线索推断其来源。 71113 这些分析让一次产品预览同时变成了技术侦探活动、压力测试和营销事件。
发布期间也有报道提到非常高的使用量和开发者热情,但现有材料无法独立核实所有统计数字或引述内容。因此,这些内容更适合作为发布期报道来看待,而不是经过审计的用户规模或采用率数据。 14
对AI竞争意味着什么
GLM-5.3-Flash并没有证明Z.ai已经在所有前沿能力上超越OpenAI或Anthropic。它真正展示的是一种更具冲击力的组合:原生多模态输入、超长上下文、MIT开放权重、面向编码智能体的优化,以及低廉的API价格。 1540
对开发者来说,这种组合可能降低更换模型供应商的成本,也让自托管和多供应商部署更具可行性。对闭源模型厂商来说,压力则不只来自单项基准分数,还来自价格和利润空间。
尤其是在编码智能体领域,Token消耗量、延迟、部署控制权和硬件可用性,往往与排行榜位置同样重要。Ox Alpha最终变成GLM-5.3-Flash,说明匿名预览不只是一次神秘营销:它也可以成为模型厂商验证基础设施、打磨产品,并在正式发布前争取开发者注意力的一种新方法。