成本演算原理: 公共 API 上的 GLM 5.2 每个 Token 的价格约为 GPT-5.5 或 Claude Opus 4.8 的 1/5 到 1/6 GD。仅看输出,GLM-5.2 每百万 Token 4.40 美元,对比 GPT-5.5 的 30 美元,成本约为其 1/6.8 OF。缓存输入则进一步降至每百万 Token 0.26 美元 GF。
这与业界常见的 NVIDIA H100/H200 部署形成了显著不同的硬件策略。Featherless 将此定位为一种避免 NVIDIA 供应限制的途径 I。
| 规格 | 详情 |
|---|---|
| 架构 | 总计 744B 参数,混合专家模型 (MoE),每个 Token 约激活 40B 参数 GS |
| 上下文窗口 | 公有云最高 256K Token;私有云部署最高 100 万 Token FI |
| 量化 | 默认为 FP8(权重约需 750 GB VRAM)FOR |
| 开源权重 | 是——Z.ai 以 MIT 许可发布了 GLM 5.2 的开源权重 IDA |
| 训练重点 | 编码优先;专为软件工程任务优化 GDS |
在 FP8 量化下,模型权重约需 750 GB VRAM,这可以轻松容纳在 4× MI325X GPU 提供的 1 TB 总 VRAM(4 × 256 GB)中,并为扩展上下文长度的 KV 缓存留有充裕空间 OR。
SWE-bench Pro(真实世界软件工程):
Terminal-Bench 2.1(智能体编码任务):
据 Featherless 称,GLM 5.2 在 Arena WebDev 编码排行榜上排名第二 F。
成本优势是 GLM 5.2 真正脱颖而出的地方。按 Z.ai 官方 API 费率计算:
| 模型 | 输入(每百万 Token) | 输出(每百万 Token) |
|---|---|---|
| GLM 5.2 | $1.40 | $4.40 |
| GPT-5.5 | ~$5.00 | ~$30.00 |
| Claude Opus 4.8 | ~$8.00 | ~$40.00 |
在 3:1 输出与输入的实际工作负载混合模式下,GLM-5.2 每百万 Token 成本接近 3.65 美元,而 GPT-5.5 约为 23.75 美元——成本比约为 1/6.5 O。独立追踪数据显示,提供此开源权重的各提供商中间价更低(输入约 0.55 美元,输出约 1.85 美元)DD。
Featherless 为 GLM 5.2 提供的私有云最适合:
Featherless 还提供更低价位的固定费率计划,从每月 25 美元起,用于对较小模型的无服务器访问。但每月 7,500 美元的专用节点明确面向需要完整 GLM 5.2 模型上进行持续高吞吐量推理的团队 F。
Featherless 的新服务提供每月 7,500 美元固定费率的 GLM 5.2 私有云,运行在 4× AMD MI325X GPU 上。对于高负载智能体使用场景,它声称相较专有 API 可节省 94% 的成本。这款 744B 的 MoE 模型在 SWE-bench Pro 上以大约六分之一的 Token 成本击败了 GPT-5.5,使其成为拥有繁重编码和智能体推理工作负载的组织的、一个引人注目的开源权重替代方案。尽管 Claude Opus 4.8 在某些基准测试上仍然领先,但 GLM 5.2 与 Featherless 组合的成本优势之大,足以使其成为那些注重预算且不愿在性能上妥协的团队的一个严肃选项。