「Ox Alpha」は、2026年8月20日から6日間にわたりOpenRouterとOpenCodeで匿名提供されたGLM 5.3 Flashだった。Z.aiが8月26日に正体を明かした。[2][5][9] GLM 5.3 Flashは総計3200億パラメーター、1トークンあたり180億パラメーターを稼働させるMixture of Expertsモデルで、100万トークンのコンテキストとネイティブなマルチモーダル入力に対応する。[6][7][20] 無料・無名の先行テストは大規模な開発者利用を集め、製品発表と実環境での負荷テスト、開発者コミュニティへの浸透を同時に実現した。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3-Flash, and how did it resolve the week-long mystery surrounding the anonymously released “Ox Alpha” model—covering it. Article summary: GLM-5.3-Flash is Z.ai (Zhipu AI)’s open-weight, natively multimodal GLM-5 model—and the company confirmed on August 26 that it was the previously anonymous “Ox Alpha.” The reveal turned a six-day public stress test into . Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
6日間にわたり、開発者たちが提供元を知らないまま使っていた高性能モデル「Ox Alpha」。2026年8月20日、OpenRouterとOpenCodeに無料・匿名で登場し、100万トークンのコンテキストウィンドウと、テキスト・画像・動画の入力に対応していました。8月26日、Z.ai(Zhipu AIの国際ブランド)が、Ox Alphaの正体はGLM-5.3-Flashだったと認めました。2
5
9
匿名の公開テストは、そのまま製品ローンチへと姿を変えました。GLM-5.3-FlashはMITライセンスで重みを公開し、比較的安価なAPI料金を設定。長大なコンテキストを扱うコーディングや、複数の手順を自律的に進めるエージェント処理を、より低コストで実行することを狙った設計です。6
7
9
Ox Alphaは、開発元を明かさないままOpenRouterとOpenCodeに掲載されました。料金はゼロ、コンテキスト上限は1,048,576トークンで、テキストに加えて画像と動画も入力できる仕様でした。開発者はコーディングエージェント、ターミナル操作、長文脈のタスクにモデルを投入し、実際の開発ワークフローで性能を試しました。4
5
8
やがてコミュニティは、モデルの正体を推測し始めます。GLM系モデルに似たトークナイザーの挙動や、APIエラーの特徴的なパターンなどが手がかりとされ、Zhipu AIが開発元ではないかという見方が広がりました。最終的には、8月26日にZ.ai自身が関係を認め、匿名提供は正式リリース前に実環境のフィードバックを集めるためだったと説明しました。5
9
先行テストの利用規模は異例でした。6日間で4200兆ではなく42兆トークンを処理したという報告がある一方、別の報告では約44兆トークン、OpenCodeの利用者は50万3000人とされています。これらは異なる報告元や計測時点に基づく数字であり、単一の独立検証済みの数値として合算すべきではありません。8
11
16
GLM-5.3-Flashは、コーディング、長期的なエージェントタスク、マルチモーダルな作業を主な用途とするオープンウェイトモデルです。Z.aiは、GLM-5シリーズで初めてネイティブなマルチモーダル機能を備えたモデルだと説明しています。大規模なコードベースや文書、スクリーンショットなどを一つのタスクに含められる、1,048,576トークンのコンテキストウィンドウも特徴です。7
20
構成は、総計3200億パラメーターのMixture of Experts(MoE)で、1トークンの処理時に実際に使うのは180億パラメーターです。巨大な知識容量を持ちながら、各トークンではその一部だけを選択して処理する仕組みです。さらにZ.aiは、推論時の計算量とKVキャッシュの必要量を抑えるため、スパースアテンションと線形アテンションを組み合わせたとしています。6
20
この設計が「Flash」という位置づけにつながっています。モデル自体は小型ではありませんが、総パラメーター数が同程度の密なモデルに比べ、提供時のコストを下げることを目指しています。もっとも、実際の速度や料金は、利用するハードウェア、サービングソフトウェア、バッチ処理、タスク内容によって変わります。
Z.aiは、GLM-5.3-FlashのDeepSWE v1.1スコアを63.4とし、GLM-5.2の46.2を上回ると報告しています。また、Claude Opus 4.8との社内比較では、29.0対29.5という結果を示しました。7
8
ただし、これらの数値をモデル性能の総合ランキングと受け取るのは早計です。DeepSWEの結果はベンダーが報告したベンチマークであり、Claudeとの比較は社内評価です。プロンプト、利用ツール、エージェントの構成、テストデータの重複、採点方法によって結果は大きく変わり得ます。クローズドな最先端モデルと広く同等だと判断するには、再現可能な第三者評価が必要です。
開発者にとってより実用的なのは、ワークフローとの相性です。大規模なリポジトリを読み込み、画面や画像の情報も参照しながら、長時間のエージェントタスクを進められるなら、タスク履歴を何度も要約して圧縮する必要が減ります。実運用で重要なのは、ベンチマークの点数だけでなく、回答の安定性、ツール利用、遅延、失敗時の復旧能力です。
Z.aiが発表したAPIの通常料金は、入力が100万トークンあたり0.15ドル、出力が同0.50ドルです。その後のドキュメントでは、期間限定の50%割引として、入力0.075ドル、出力0.25ドルの料金も案内されています。2
モデルの重みはHugging Face上でMITライセンスにより公開されました。ホスト型サービスだけで提供されるモデルと比べ、より自由度の高いリリースです。MITライセンスは一般に商用利用や改変を認めますが、実際に導入する際は、ライセンス本文、モデル固有の利用条件、依存ソフトウェア、必要なハードウェア、各種義務を確認する必要があります。2
9
Z.aiのドキュメントでは、GLM-5.3-Flashを開発者向けサービスやコーディングプランで利用できると案内しています。APIリファレンスは、テキスト・画像・音声・動画・ファイルを含むマルチモーダルなチャット入力と、ツール利用にも対応すると説明しています。17
20
21
今回のリリースには、モデル性能とは別の注目点もありました。Z.aiは、匿名だったOx Alphaのプレビューを中国製AIアクセラレーターだけで提供し、カスタマイズしたSGLangベースのサービング基盤を使ったと説明しています。同社の技術資料では、中国国内のハードウェア上で推論効率を高める取り組みとして紹介されています。
一部の二次報道は、カスタム基盤によってエンドツーエンド性能が3倍になったという主張も伝えています。しかし、アクセラレーターの構成、比較対象となった性能、外国製コンポーネントからどの程度独立していたかについては、ここで確認できる情報だけでは独立監査されていません。10
この点は慎重に見る必要があります。もし検証されれば、米国の半導体輸出規制下で、中国が高性能なAIサービスを国内ハードウェアで構築できるかという戦略的な論点に関わります。ただ現時点では、国内製ハードウェアがAIインフラ全体の差を埋めたことを示す決定的証拠ではなく、重要な企業発表として理解するのが妥当です。
Ox Alphaの方式には、通常の製品発表では得にくい利点がありました。開発者は、モデル名や仕様表に引かれてではなく、無料で、しかも実際に使えるモデルだったからこそ、コーディングエージェントや長文脈タスクに投入しました。Z.aiは、この匿名テストの目的を正式リリース前のフィードバック収集と説明しています。5
9
この戦略は、オープンウェイトを軸にした配布方針とも合っています。自由度の高い重み、低価格のAPI、幅広い開発者アクセスを組み合わせれば、試用を促しながらフィードバックを集め、従来型のクローズドモデルのサブスクリプションとは異なる形で利用基盤を広げられます。過去に報じられた匿名モデル実験「Pony Alpha」も、同様の発想が一度きりではなかった可能性を示します。ただし、前回のプロジェクトについて、確認できる情報は限られています。
GLM-5.3-Flashだけで、Z.aiがAIの総合的な最前線を制したと証明されたわけではありません。現時点で確認できるのは、公開された仕様、異例の規模に達した公開プレビュー、そして企業が報告したベンチマークおよびインフラに関する主張です。コーディング、マルチモーダル推論、ツール利用、遅延、信頼性でどう比較できるかは、第三者評価と継続的な実運用によって決まります。
それでも、競争上のシグナルは明確です。100万トークンのコンテキスト、ネイティブなマルチモーダル入力、オープンウェイト、そして100万トークン単位で数十セントのAPI価格を備えたモデルは、高価なクローズドAIのコスト構造に圧力をかけます。匿名プレビューが、実環境のストレステストであると同時に、利用者を集める配布手段にもなり得ることも示しました。
Ox Alphaの正体をめぐる謎は解決しました。あれはZ.aiのGLM-5.3-Flashでした。これから問われるのは、正体を当てることではありません。無料の話題性を離れ、開発者が反復可能で本番に耐えるワークロードへ移したとき、低コスト・長文脈という約束がどこまで実力を保てるかです。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
「Ox Alpha」は、2026年8月20日から6日間にわたりOpenRouterとOpenCodeで匿名提供されたGLM 5.3 Flashだった。Z.aiが8月26日に正体を明かした。[2][5][9]
「Ox Alpha」は、2026年8月20日から6日間にわたりOpenRouterとOpenCodeで匿名提供されたGLM 5.3 Flashだった。Z.aiが8月26日に正体を明かした。[2][5][9] GLM 5.3 Flashは総計3200億パラメーター、1トークンあたり180億パラメーターを稼働させるMixture of Expertsモデルで、100万トークンのコンテキストとネイティブなマルチモーダル入力に対応する。[6][7][20]
無料・無名の先行テストは大規模な開発者利用を集め、製品発表と実環境での負荷テスト、開発者コミュニティへの浸透を同時に実現した。