GLM 5.3は1Mトークンのコンテキストを持つコーディング・エージェントモデルで、Z.aiは社内のZ.ai Code BenchでGLM 5.2比50%の性能向上を報告しています。公開ベンチマークの詳細な比較値は第三者による報告です。 Z.aiは改善の主因として、短いコード課題ではなく、複数日にわたる開発・研究作業を想定したポストトレーニングとタスク環境の拡大を挙げています。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3, how does it compare with GLM-5.2 in coding, long-horizon tasks, cybersecurity, and benchmarks such as Z.ai Code Benc. Article summary: GLM-5.3 is Z.ai’s flagship coding-and-agent model, aimed at complex software engineering and long-horizon tasks. It has a 1M-token context window and is available through Z.ai’s GLM Coding Plan; its API availability was . Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3は、Z.aiが複雑なソフトウェア開発や深いデバッグ、何段階もの作業を継続して進めるタスク向けに投入した、最新のコーディング・エージェントモデルです。Z.aiの資料では、コンテキストウィンドウは1Mトークン。前世代のGLM-5.2より、長期的かつ複雑なタスクに強いモデルとして位置付けられています。
今回のポイントは、一般的なコーディングテストの点数を少し伸ばしただけの新モデルではないことです。Z.aiは、社内評価のZ.ai Code BenchでGLM-5.2から50%向上したと説明しています。また、Terminal-Bench 3.0やAgents’ Last Exam(CLI)などの公開評価では、オープンソースモデルとして最高水準の性能に達したとしています。
Z.aiが公式に示している最も明確な比較は、Z.ai Code Benchでの50%向上です。一方、以下の公開ベンチマークの数値は、第三者の報告に基づく比較です。
| ベンチマーク | GLM-5.2 | GLM-5.3 | 読み取れること |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | 長いコマンドライン作業で大幅な改善 |
| DeepSWE v1.1 | 46.2% | 66.9% | ソフトウェアエンジニアリング課題で向上 |
| Agents’ Last Exam(CLI) | 23.8% | 28.5% | ツールを使うエージェント作業で改善 |
| CyberGym | 77.2% | 84.5% | 脆弱性の発見能力が向上 |
| ExploitBench | 24.4% | 54.4% | GLM-5.2の報告値の2倍以上 |
これらは確定済みの業界標準値ではなく、現時点で報告されている結果として読む必要があります。詳細な比較表は第三者によるX上の投稿に基づくもので、Z.aiの公式資料はコーディング、長期タスク、サイバーセキュリティ分野での改善という大枠を確認しているものの、ここに示したすべての数値を掲載しているわけではありません。
4.6%から28.3%への上昇は、今回の比較で最も目を引く変化です。Terminal-Bench 3.0は、コマンドライン環境でモデルが作業するベンチマークです。モデルは単発のコードを出力するだけでなく、ツールを操作し、環境の状態を確認し、ファイルや設定を変更しながら、複数の段階を進める必要があります。
そのため、この結果はGLM-5.3が長いCLIタスクで大きく改善したことを示唆します。ただし、特定のリポジトリや実際の開発環境でも、必ずGLM-5.2を上回ると証明するものではありません。
GLM-5.3が想定するのは、計画、実装、デバッグ、修正を、より大きなプロジェクト文脈の中で継続して行う開発作業です。Z.aiは1Mトークンのコンテキストウィンドウを掲げ、長期的で複雑なタスクに強いモデルとして紹介しています。
これは、短いコーディング指示への応答だけを改善したアップデートとは方向性が異なります。Z.aiによれば、GLM-5.3はTerminal-Bench 3.0とAgents’ Last Exam(CLI)で、オープンソースモデルとして最高水準の性能を達成しています。社内のZ.ai Code Benchでは、GLM-5.2から50%向上したとされています。
実際の開発者にとっては、より多くのプロジェクト情報を保持しながら、長い作業の流れを途中で見失わずに進めることが期待されます。ただし、ベンチマークの向上だけでは、実運用時の信頼性、料金、レイテンシ、ツール実行の品質までは判断できません。導入を検討するチームは、ベンチマーク値をそのまま本番環境に当てはめるのではなく、実際のリポジトリや開発ワークフローで検証する必要があります。
Z.aiは、GLM-5.3が脆弱性発見ベンチマークのCyberGymで、同社にとって過去最高の結果を達成したと説明しています。また、脆弱性の悪用に関する性能はGLM-5.2の2倍を超えたとしています。
第三者の比較表では、CyberGymが77.2%から84.5%へ、ExploitBenchが24.4%から54.4%へ上昇したと報告されています。ただし、これらの正確な数値は、今回提供されたZ.ai公式資料の抜粋からは独立して確認できません。現時点では、ローンチ時に報告された値として扱うのが適切です。
この結果が重要なのは、GLM-5.3のエージェント能力の向上が、アプリケーションコードの生成だけでなく、脆弱性の発見や分析にも及ぶ可能性を示すためです。
同時に、安全面での評価も欠かせません。脆弱性の発見や悪用に強いモデルは、防御目的のセキュリティ調査を支援できる一方、適切な制御なしに利用されれば悪用リスクを高める可能性もあります。Z.aiがウェイト公開前に追加の安全性評価を行うとしている背景には、こうした側面があります。
Z.aiは、GLM-5.3の改善を主に大規模化したポストトレーニングによるものだと説明しています。特に、短く完結したコーディング課題だけでなく、現実の複数日にわたる開発・研究ワークフローに近いタスク環境を拡充したとしています。
つまり、今回の説明では、単にコンテキストウィンドウを広げたことや、基盤アーキテクチャを新しくしたことが主役なのではありません。モデルが計画を立て、ツールを使い、途中の失敗から復帰し、長いタスクを継続できるよう、訓練と作業環境を拡張したという位置付けです。
この説明は、長期タスクやエージェント型の評価で大きな改善が報告されていることとも整合します。ただし、改善が異なるモデル、エージェント実行基盤、プロンプト、ソフトウェアプロジェクトにどこまで一般化するかは、今後の独立検証を待つ必要があります。
GLM-5.3は、Z.aiのGLM Coding Planで利用できます。Z.aiの案内では、Max、Pro、Liteを含む各プランが対応しています。また、ZCodeの開発環境でも利用可能です。
一方、提供された資料の範囲では、オープンウェイトはまだ公開されていません。第三者の報告によると、Z.aiは2026年8月14日のローンチからおよそ2週間後、追加の安全性評価を終えた段階でウェイトを公開する見込みです。時期に換算すると2026年8月下旬ですが、確定した公開日ではありません。
現時点で導入を考える開発者が注意すべきなのは、「利用できること」と「自分で再現できること」は別だという点です。GLM Coding PlanやZCodeを通じて試すことはできますが、提供された資料に基づく詳細なローンチ結果を、公開ウェイトを使ってローカル環境で完全に再現できる状態にはまだ至っていません。
GLM-5.3は、単なるバージョン番号の更新ではなく、コーディングエージェント向けに焦点を絞ったアップグレードです。Z.aiは、社内コーディングベンチマークで50%の向上、長期的なエージェント評価での強化、そしてGLM-5.2を上回るサイバーセキュリティ性能を報告しています。
ただし、評価結果には注意が必要です。改善の方向性はZ.aiの公式資料で確認できる一方、詳細な公開ベンチマークの比較値と、約2週間後とされるウェイト公開時期は第三者報告に依存しており、独立検証の対象です。
より広範なテストとウェイト公開が行われるまでは、GLM-5.3は「Z.aiの製品を通じて利用できる、有望なコーディング・エージェントの強化版」と見るのが妥当でしょう。オープンモデルとしての再現性や、本番環境での実力が確定した段階とはまだ言えません。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
GLM 5.3は1Mトークンのコンテキストを持つコーディング・エージェントモデルで、Z.aiは社内のZ.ai Code BenchでGLM 5.2比50%の性能向上を報告しています。公開ベンチマークの詳細な比較値は第三者による報告です。
GLM 5.3は1Mトークンのコンテキストを持つコーディング・エージェントモデルで、Z.aiは社内のZ.ai Code BenchでGLM 5.2比50%の性能向上を報告しています。公開ベンチマークの詳細な比較値は第三者による報告です。 Z.aiは改善の主因として、短いコード課題ではなく、複数日にわたる開発・研究作業を想定したポストトレーニングとタスク環境の拡大を挙げています。
現在はGLM Coding PlanとZCodeで利用可能です。モデルウェイトは追加の安全性評価後、2026年8月14日のローンチから約2週間後に公開される見込みと第三者が報じていますが、時期は確定していません。