Ox Alphaは、2026年8月20日にOpenRouterとOpenCodeへ登場した、Z.ai(智譜AI)のGLM 5.3 Flashを匿名で試験する際の名称だった。Z.aiは8月26日に正体を認めた。[3][4] 1,048,576トークンのコンテキスト、テキスト・画像・動画入力、ツール呼び出しに対応し、無料かつほぼ無制限に近いプレビューが利用急増を後押しした。[11][13][21] DeepSWE全113タスクの独立評価は58.4%で、報告されたClaude Opus 4.8の59%に近い。初期の80%という小規模テスト結果だけで、Claude Fable 5を明確に上回ったとは言えない。[36][38][47]
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is the anonymous AI model Ox Alpha, when and where was it launched, how did its one-week free availability affect OpenCode and OpenRout. Article summary: Ox Alpha was the anonymous, free “stealth” preview name for Z.ai (Zhipu AI)’s GLM-5.3-Flash—a coding- and agent-oriented reasoning model. It appeared simultaneously on OpenRouter as `stealth/ox-alpha` and in OpenCode on . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
匿名のAIモデルとして突然現れた「Ox Alpha」は、永遠の謎に終わったわけではない。2026年8月26日、Z.ai(智譜AI)が同モデルをGLMシリーズの新モデル「GLM-5.3-Flash」だと認めた。3
4
注目すべきなのは、モデルの性能だけではない。無料アクセス、約100万トークンのコンテキスト、そして開発者が普段使うコーディングエージェントへの統合が同時に実現したことで、わずか数日で異例の利用急増を生んだ。OpenCodeではDeepSeekの56日連続首位が終わり、OpenRouterでも利用量ランキングのトップに立った。
ただし、利用量の急増は、そのままベンチマークでの優位性を意味しない。Ox Alphaをめぐる騒動は、AIモデルの実力だけでなく、価格と流通経路が採用をどれほど左右するかを示す事例でもある。
Ox Alphaは、Z.aiが開発したGLM-5.3-Flashのステルス・プレビュー用コードネームだった。発表前のOpenRouterでは、開発元の社名を明かさない第三者プロバイダーのモデルとして掲載され、コーディング、長時間にわたるエージェント作業、プロダクション用途向けと説明されていた。OpenRouterは、自社はリクエストを中継するだけで、開発者や所有者、プロバイダーではないと明記していた。5
29
OpenRouterではstealth/ox-alphaとして掲載され、OpenCodeにも同時期に組み込まれた。プレビュー期間中の料金は入力・出力ともに0ドルで、OpenCodeでは2026年8月20日からおよそ1週間、ほぼ無制限に近い利用がうたわれた。5
18
21
Ox Alphaが現れたのは2026年8月20日。マルチモデルのAPIルーターであるOpenRouterと、オープンソースのターミナル型コーディングエージェントOpenCodeに、ほぼ同時に登場した。5
13
29
当時公開されていた主な仕様は次の通りだ。
これだけのコンテキスト長があれば、大規模リポジトリ全体を参照した作業や、途中経過を長く保持するエージェント処理に向いている。画像や動画を入力できるため、画面上の不具合を確認しながらコードを修正する用途も想定できる。
もっとも、仕様表が示すのは「何ができると掲載されていたか」であり、実運用でどれほど安定して機能したかを直接証明するものではない。
Ox Alphaの急浮上を説明する最も明確な要因は、無料で大量に試せたことだ。開発者は通常ならトークン料金を気にするような長時間のコーディング作業を、既存のエージェント環境の中で試すことができた。
OpenCodeによると、Ox Alphaは6日間で約42兆トークンを処理した。これは、DeepSeek Flashが過去に56日間首位を維持して以来、同プラットフォームで最も利用されたモデルとなったことを意味する。7
16
単にランキングへ登場しただけではない。およそ2カ月にわたって首位だったDeepSeekを、無料公開からわずか数日で押しのけた点が大きい。OpenCodeは後に、この匿名モデルを正式名称のGLM-5.3-Flashとして扱った。16
OpenRouterでも、プレビュー中のOx Alphaは直近7日間の利用量ランキングで首位に立った。ある集計では、対象期間の処理量は約23.2兆トークンで、DeepSeek V4 Flashの約11.6兆トークンを上回った。11
OpenCodeの42兆トークンとOpenRouterの23.2兆トークンは、足し合わせるべき数字ではない。異なるプラットフォームと集計期間に基づくためだ。確実に言えるのは、無料公開が両サービスで異例のトラフィックを生み、OpenRouterでは単日のモデル利用記録を更新したと報じられたことだ。11
14
15
初期に最も広がったのは、ソフトウェア開発能力を測るDeepSWEで約80%を記録したという主張だった。しかし、この数字は少数タスクのサブセットに基づくもので、完全な独立評価が行われる前に広まったものだった。3
31
その後、DeepSWEの全113タスクを対象にしたエンドツーエンドの実行では、Ox Alphaのスコアは**58.4%と報告された。比較対象として挙げられたClaude Opus 4.8は59%**だった。47
この結果から慎重に言えるのは、「このテストではClaude Opus 4.8に近い水準のコーディング性能を示した」ということだ。Claude Fable 5を明確に上回った、と結論づける根拠にはならない。
Fable 5との比較が難しいのは、ベンチマーク自体が異なるためだ。Fable 5について公表されている数字には、SWE-bench Proで80.3%、**SWE-bench Verifiedで95.0%**がある。しかし、DeepSWEとはタスク構成、評価ハーネス、エージェント設定などが異なる可能性があり、単純に横並びにはできない。36
38
したがって現時点での妥当な評価は、Ox Alphaが最先端クラスに近い、実用的なコーディング性能を示したというものだ。初期の小規模テストや利用ランキングだけを根拠に、「Fable 5より上」と断定するのは早い。
Ox Alphaが急速に注目されたのは、次の3つが同時に提供されたからだ。
ランキングの変動は、謎の名前への一時的な関心だけでは説明しにくい。開発者が実際のワークフローへすぐ投入でき、通常の有料トライアルではためらう規模で使えたことが、利用量を押し上げたと考えられる。
一方で、匿名公開には懸念もあった。モデルの掲載ページにあるデータ保持に関する説明と、OpenRouter全体のステルスモデル向け規約の間に食い違いがあるのではないか、という指摘が出た。また、経路によってプライバシー条件が異なり、OpenCode Zenではゼロ保持を掲げる一方、OpenRouter経由ではプロンプトや生成結果の保持に関する説明があると報じられた。12
17
22
ソースコードを扱う開発者にとって、提供者が誰か分からないことや、データがどこに保存されるか不明確なことは重大な問題だ。無料であることは、機密リポジトリに安全に使えることを意味しない。
Z.aiが認めるまで、開発者やAIコミュニティでは複数の候補が取り沙汰された。
XiaomiのMiMoは、中国の大手テクノロジー企業が高性能なコーディングモデルを公開する可能性があるという文脈で浮上した説だった。しかし、MiMoという名称との結びつき、ホスティング情報、所有関係、特定の技術的指紋を裏づける確定的な証拠は示されていない。可能性のある仮説ではあったが、立証された説ではなかった。
「Alpha」という名称からGoogle DeepMindを連想する向きもあった。エージェント型コーディングに強そうな挙動が、憶測をさらに広げた。しかし、「Alpha」は一般的なブランディングであり、それだけでは出所を特定できない。公開情報にも、Googleの帰属を示すモデルカード、インフラ情報、技術資料はなかった。
最終的に正しかったのが、Z.ai説だ。8月26日、Z.aiはBloombergの取材に対し、Ox AlphaがGLMシリーズの新しいバージョンだと説明した。その後、正式名称をGLM-5.3-Flashと明らかにし、モデルの重みを公開すると表明した。3
4
8
重要なのは、推測と確認を区別することだ。モデルの回答傾向、トークナイザーの印象、拒否応答、コンテキスト長、コードネームなどは仮説を立てる手がかりにはなる。しかし、非公開のホステッドモデルを誰が運用しているかを、それだけで確実に証明することはできない。決定的だったのは、リバースエンジニアリングの推測ではなく、開発元自身による認定だった。
公開当初の掲載情報には、企業名、詳細なモデルカード、技術論文、通常の商用ブランドがなかった。OpenRouterの説明も、第三者プロバイダーがプレビュー期間中は匿名でいることを選んだ、という内容にとどまっていた。5
13
29
その結果、利用者が通常なら確認できる開発元の実績、プライバシーポリシー、サポート窓口、データの出所、正式な価格設定といった情報が不足していた。「開発元は未確認」という説明は8月20日からZ.aiの発表前までは正確だったが、8月26日以降は古い情報になった。3
4
無料期間は、開発者がこのモデルを使いたいことを示した。しかし、料金や制限、安定性、信頼性が判断材料になった後も使い続けるかどうかまでは証明していない。
初期報道では、プレビュー後の料金は明らかにされていなかった。3
5 長期的な採用には、料金が競争力を持つか、無料期間中に人気を集めた負荷を有料サービスでも支えられるかが重要になる。
話題になったモデルでも、実際のプロダクションコードに組み込むには、レイテンシー、稼働率、ツール利用の一貫性、エラーからの復旧、出力品質が問われる。ランキングの順位より、エージェントが予測可能な動作をするかの方が現場では重要だ。
今後必要なのは、評価対象の全タスク、使用したハーネス、エージェント設定を明示した再現可能なテストだ。実際のリポジトリを使った検証も含め、無料で大量に試せたことによる一時的な追い風と、モデル本来の能力を分けて見る必要がある。
匿名プレビューによってデータの行き先に不確実性が生じた後だけに、保持期間、モデルの出所、セキュリティ対策、企業向け管理機能の明確化が欠かせない。4
12
17
Z.aiが表明した重みの公開によって、GLM-5.3-Flashが特定のホステッド経路以外でも利用できるようになれば、ローカル実行やセルフホストへの道が開ける。OpenCode、OpenRouter、IDE向けエージェント、ツール呼び出し対応の開発基盤で継続的にサポートされるかも、ブームが恒久的なエコシステムへ変わるかを左右する。3
8
Ox Alphaは、開発元不明のまま残ったモデルではない。2026年8月20日に匿名名称で登場し、6日後にZ.aiのGLM-5.3-Flashだと判明したモデルだ。無料プレビューによってOpenCodeでは6日間で約42兆トークンが処理され、DeepSeekの56日連続首位が終わった。OpenRouterでも利用量ランキングの首位に立った。7
11
16
技術仕様と実際の利用急増は確かに印象的だが、ベンチマークについては慎重さが必要だ。DeepSWE全113タスクで報告された58.4%はClaude Opus 4.8の59%に近く、Fable 5との比較も、異なるベンチマークをまたぐため決着していない。36
38
47
GLM-5.3-Flashの本当の試験は、無料期間が終わってから始まる。バイラルな需要を有料利用へつなげられるか、企業が信頼して導入できるか、再現可能なコーディング性能を維持できるか。そして、公開される重みと開発者向け統合を軸に、短期間の話題を長く続くオープンモデルのエコシステムへ変えられるかが問われる。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Ox Alphaは、2026年8月20日にOpenRouterとOpenCodeへ登場した、Z.ai(智譜AI)のGLM 5.3 Flashを匿名で試験する際の名称だった。Z.aiは8月26日に正体を認めた。[3][4]
Ox Alphaは、2026年8月20日にOpenRouterとOpenCodeへ登場した、Z.ai(智譜AI)のGLM 5.3 Flashを匿名で試験する際の名称だった。Z.aiは8月26日に正体を認めた。[3][4] 1,048,576トークンのコンテキスト、テキスト・画像・動画入力、ツール呼び出しに対応し、無料かつほぼ無制限に近いプレビューが利用急増を後押しした。[11][13][21]
DeepSWE全113タスクの独立評価は58.4%で、報告されたClaude Opus 4.8の59%に近い。初期の80%という小規模テスト結果だけで、Claude Fable 5を明確に上回ったとは言えない。[36][38][47]