コスト計算の内訳: GLM 5.2の公開API価格は、GPT-5.5やClaude Opus 4.8の5分の1から6分の1程度であるGD。出力トークンに限定すると、GLM 5.2の4.40ドルに対し、GPT-5.5は30ドルで、約6.8分の1のコストとなるOF。キャッシュヒット時の入力価格はさらに下がり、100万トークンあたり0.26ドルであるGF。
これは、業界で一般的なNVIDIA H100/H200を使ったデプロイとは一線を画すハードウェア戦略であり、FeatherlessはこれをNVIDIAの供給制約を回避する方法として位置づけているI。
| 仕様 | 詳細 |
|---|---|
| アーキテクチャ | 総パラメータ数744BのMixture-of-Experts(MoE)、1トークンあたり約40BのパラメータがアクティブGS |
| コンテキストウィンドウ | パブリッククラウドで最大256Kトークン、プライベートクラウドでは最大100万トークンFI |
| 量子化 | デフォルトでFP8(ウェイトに約750GBのVRAMを消費)FOR |
| ライセンス | Z.aiがMITライセンスで公開したオープンウェイトIDA |
| 学習の焦点 | コーディングファースト。ソフトウェアエンジニアリングタスクに特化GDS |
FP8量子化では、モデルのウェイトに約750GBのVRAMが必要となる。これは4基のMI325X GPU(4 × 256GB = 1TB)の合計VRAMに余裕をもって収まる。拡張コンテキスト長でのKVキャッシュも考慮した場合でも、十分なヘッドルームが確保できる計算だOR。
SWE-bench Pro(現実的なソフトウェアエンジニアリングタスク):
Terminal-Bench 2.1(エージェント型コーディングタスク):
Featherlessによると、GLM 5.2はArena WebDevコーディングリーダーボードで2位にランクインしているF。
GLM 5.2のコスト優位性は圧倒的だ。Z.aiの公式APIレートでの比較は以下の通り。
| モデル | 入力(100万トークンあたり) | 出力(100万トークンあたり) |
|---|---|---|
| GLM 5.2 | $1.40 | $4.40 |
| GPT-5.5 | 約$5.00 | 約$30.00 |
| Claude Opus 4.8 | 約$8.00 | 約$40.00 |
現実的な3:1の出力対入力ワークロードでは、GLM 5.2は100万トークンあたり約3.65ドルとなるのに対し、GPT-5.5は約23.75ドル。その比率は約6.5分の1であるO。なお、オープンウェイトを提供するさまざまなプロバイダー間では、より低い価格(入力約0.55ドル、出力約1.85ドル)も存在するDD。
FeatherlessのGLM 5.2プライベートクラウドは、以下のようなケースで最も効果を発揮する。
Featherlessは、より低価格な定額制プラン(サーバーレスアクセスで月額25ドルから)も提供しているが、月額7,500ドルの専用ノードは、フルスペックのGLM 5.2モデルで持続的かつ高頻度の推論を必要とするチーム向けであるF。
Featherlessの新サービスは、4基のAMD MI325X GPU上でGLM 5.2を月額7,500ドルの定額制で提供する。同社は、高頻度のエージェント使用において、プロプライエタリAPIと比較して94%のコスト削減を実現すると主張する。744BパラメータのMoEモデルはSWE-bench ProでGPT-5.5を上回り、トークン単価は約6分の1。コーディングやエージェント推論のワークロードが重い組織にとって、非常に魅力的なオープンウェイトの選択肢となる。Claude Opus 4.8が一部のベンチマークで依然リードしているとはいえ、GLM 5.2とFeatherlessの組み合わせによるコスト優位性は、性能を犠牲にせずに予算を重視するチームにとって、真剣に検討すべき選択肢であることに変わりはない。