Ox Alphaは、2026年8月20日に匿名で公開されたZ.aiのGLM 5.3 Flashのプレビュー版だった。Z.aiが8月26日に正式に認めた。[1][10] 1,048,576トークンのコンテキスト、テキスト・画像・動画入力、ツール呼び出しを備え、無料で試せたことから開発者の利用が急拡大した。[2][4] DeepSWEでは初期の10タスク中8件成功という「80%」が拡散したが、より大規模な評価では約63%や58.4%も報告され、Claudeを明確に上回ったと断定できる状況ではない。[6][7][41][42]
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is the anonymous AI model “Ox Alpha” (or “Niu Lai”), launched quietly on OpenRouter and OpenCode on August 20, 2026 and offered free fo. Article summary: Ox Alpha was a short anonymous “stealth” preview, not a still-unidentified new lab model: Z.ai subsequently identified it as GLM-5.3-Flash, a GLM-family model. Its strong early agentic-coding showing and unusually genero. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
匿名AIモデルとして突然現れたOx Alphaは、正体不明の新興ラボ製モデルではなかった。Z.aiは2026年8月26日、Ox Alphaが自社のGLMシリーズに属するGLM-5.3-Flashを、正式公開前に匿名でテストしたものだと確認した。110
この出来事が注目された理由は、単にベンチマークの数字が高かったからではない。100万トークン級の長いコンテキスト、画像・動画を含むマルチモーダル入力、ネイティブなツール呼び出し、そして無料という組み合わせが、AIエージェントを開発する人々にとって極めて試しやすかったからだ。
Ox Alphaは2026年8月20日、OpenRouterとOpenCodeに、プロバイダー名「Stealth」の匿名モデルとして登場した。OpenRouter上のモデルIDはstealth/ox-alphaだった。12
主な仕様は次の通りだ。
無料期間の案内はサービスによって異なっていた。OpenRouterは自社ルートについて8月24日までと案内した一方、OpenCodeは8月20日から約1週間の無料提供を説明していた。そのため、無料ルートが終了する時期は一律ではなく、概ね8月24日から27日ごろと見るのが妥当だった。2412
100万トークンのコンテキストがあるからといって、モデルが自動的に賢くなるわけではない。ただし、AIエージェントが扱える作業の範囲は大きく変わる。コードベース、ツールの実行結果、ログ、画面情報などを、途中で何度も要約したり捨てたりせず、ひとつのセッションに保持しやすくなるためだ。動画入力にも対応していたことから、画面操作の検証やユーザーインターフェースのテストなど、テキストだけでは完結しない用途にも向いていた。343
Ox Alphaの魅力は、うわさよりも実用性にあった。開発者は、長いコンテキストとマルチモーダル入力、ツール連携を備えたコーディングモデルを、トークン料金なしで大規模に試せた。リポジトリーの修正、ブラウザー操作、長時間にわたるソフトウェア開発タスクなどを実験するハードルが、一気に下がったのである。
注目度は急速に高まった。OpenCodeでは、DeepSeekが56日間維持していたランキング首位を一時的に奪い、単日利用の急増も報じられた。114
ただし、公開時に広まった処理能力やトークン数の主張は、すべてが独立監査されたものではない。大規模な数字は、正確な本番規模の測定値というより、リリース直後にどれほど強い関心が集まったかを示す材料として読むべきだ。
無料期間中の人気は、モデルの能力だけで決まらない。無料であること、新しいこと、アクセスしやすいこと、そして実際の性能が混ざった結果だ。ランキングでの躍進だけで、総合的に最強のモデルだと判断することはできない。
Ox Alphaをめぐって最も広く拡散したのが、**DeepSWEで80%**という数字だった。これは10タスク中8タスクに成功した結果で、確かに有望なシグナルではある。しかし、10件だけのサンプルから安定したランキングを導くことはできない。
その後、より大きな評価では約**63%という結果が報告され、Z.aiが正式版GLM-5.3-Flashについて示したDeepSWE v1.1の数値は63.4%**だった。6734
一方、113タスクを対象にした別の評価では、成功率**58.4%**という結果も報告された。この評価では、出力形式や実装上の問題が失敗の一部に大きく影響したとされている。AIエージェント向けベンチマークは、使用する評価ハーネス、ツールへのアクセス、制限時間、成功条件によって結果が変わりやすい。4142
したがって、最も慎重で妥当な結論はこうだ。Ox Alphaはコーディングエージェントとして高い能力を示し、一部の評価では先端的なクローズドモデルに近い水準に達した。しかし、Claude Fable 5を一貫して上回った、あるいはあらゆるフロンティアモデルを超えたと証明するデータではない。
「80%」「約63%」「58.4%」という数字は、同じ条件で測った結果ではない。対象タスクの範囲、エージェントの構成、ツールの使い方、制限時間、出力形式の扱いが異なっていた。
10タスクの小規模サンプルなら、たまたま難易度の低い、あるいはモデルに有利なタスクが含まれるだけで80%に到達し得る。113タスクを対象にすれば、別の傾向が見えてくる。さらに、形式不備にペナルティーを課す評価では、モデルの推論能力とは別の要因でスコアが下がることもある。
DeepSWEチームは後に、モデル全体の能力はClaude Fable 5を明確に超えたというより、Claude Opus 4.8とおおむね同等と見る評価を示したと報じられた。35 ベンチマークの数字は、単一のランキング上の点数として並べるのではなく、タスク、設定、ツール、判定基準とセットで扱う必要がある。
著名な開発者からの好意的な反応は、Ox Alphaのワークフロー上の強みと整合していた。Stripeの共同創業者兼CEOであるPatrick Collisonは、エージェント用ハーネスを通じて利用した後、Ox Alphaを「非常に印象的」と評価した。HermesAgentの創業者も、チーム内の複数の評価基準を上回ったと述べた。3335
こうした声は、実際のコーディングやエージェント作業で役立ったという現場の報告として意味がある。一方で、管理された複数のベンチマークを横断し、Ox Alphaが普遍的に優れていると証明するものではない。
モデルの実用性は、総合スコアだけでは決まらない。コンテキストの長さ、ツール呼び出しの安定性、速度、画像・動画対応、料金などが、特定の開発環境では決定的な差になることがある。
正式発表前、コミュニティーはOx Alphaの挙動を、XiaomiのMiMoチーム、Google DeepMind、Zhipu AIのGLMファミリーなどと比較した。
Xiaomiが候補になった理由のひとつは、MiMoチームが過去に「Hunter Alpha」という匿名テストを行っていたことだった。しかし、MiMoのモデルは音声入力に対応するとされていたのに対し、Ox Alphaはテキスト・画像・動画を受け付ける一方、音声には対応していなかった。この能力差から、Xiaomi説は興味深い仮説ではあっても、強い帰属証拠とはみなされなかった。2229
Googleに関連する示唆やソーシャルメディア上の投稿も憶測を広げたが、公開された手がかりだけでは、DeepMindがモデルを開発・運用したと確認することはできなかった。こちらも状況証拠の域を出なかった。
最も説得力を増していったのは、Zhipu AIのGLMファミリーを示す技術的な特徴だった。コミュニティーの検証では、さまざまなプロンプトでOx Alphaのトークン数がGLM-5.3と一致した。毎回およそ75トークンの固定オフセットが見られたが、これはモデルそのものの違いというより、見えないシステムプロンプトやルーティング用ラッパーによるものと解釈された。1821
動画入力のテストでも、Ox Alphaのトークン消費は、Zhipu AIのマルチモーダルモデルであるGLM-5V-Turboと複数のエンコード特性で一致したと報告された。18
このほか、次のような手がかりも挙げられた。
reasoning_effort関連のエラー個々の手がかりは、ルーティング、ラッパー、共通インフラ、あるいは模倣によって説明できる可能性もある。だが、複数の特徴が重なったことでGLM説は次第に有力になった。最終的な決め手になったのは、Z.ai自身がOx AlphaをGLM-5.3-Flashと特定し、正式版を公開したことだった。1043
正体が判明したことで、Ox Alphaは「謎のエンドポイント」から、製品公開前の実地プレビューへと位置づけを変えた。Z.aiの文書によれば、GLM-5.3-Flashは、インターフェースを観察し、レンダリング結果や操作後のフィードバックを確認できるネイティブな視覚機能を備える。コード、ブラウザー、GUIをひとつのループで扱う設計だ。43
モデルは、総パラメーター数3,200億、1トークンごとに実際に有効化されるパラメーター数180億のハイブリッド構成と説明されている。大規模モデルでありながら、計算量やKVキャッシュの負担を抑えることを狙った設計だ。43
正式公開によって、匿名モデルの最大の弱点だった継続性への不安も小さくなった。GLM-5.3-FlashはMITライセンスで公開され、開発者が重みを取得して自分の環境で運用できる形になったと報じられている。1950
ただし、MITライセンスだからといって、どの環境でも安全かつ安価に動くわけではない。導入を検討するチームは、必要なハードウェア、推論速度、APIの利用条件、データの扱い、レート制限、ツール呼び出しの信頼性、出力の一貫性を自分たちの用途で確認する必要がある。
無料プレビューは大きな注目を集めた。しかし、長期的な採用を左右するのは、次のような継続運用の条件になる。
Ox Alphaの本当の教訓は、「匿名モデルが有名な競合を一時的に倒した」という単純な話ではない。開発者が大規模に試せる配布方法と、長いコンテキスト、マルチモーダル機能、ツール利用、エージェント向けコーディング、低コストという設計が組み合わさると、正式なモデルカードや大規模ベンチマークがなくてもモデルは一気に広がり得る。
ベンチマークの実態は、最初に広まった見出しほど決定的ではなかった。それでも、Ox Alphaが集めた関心には実用的な理由があった。正体がGLM-5.3-Flashだと判明した今、次に問われるのは、無料という新鮮さがなくなった後も、その組み合わせが開発者の仕事に価値を持ち続けるかどうかだ。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Ox Alphaは、2026年8月20日に匿名で公開されたZ.aiのGLM 5.3 Flashのプレビュー版だった。Z.aiが8月26日に正式に認めた。[1][10]
Ox Alphaは、2026年8月20日に匿名で公開されたZ.aiのGLM 5.3 Flashのプレビュー版だった。Z.aiが8月26日に正式に認めた。[1][10] 1,048,576トークンのコンテキスト、テキスト・画像・動画入力、ツール呼び出しを備え、無料で試せたことから開発者の利用が急拡大した。[2][4]
DeepSWEでは初期の10タスク中8件成功という「80%」が拡散したが、より大規模な評価では約63%や58.4%も報告され、Claudeを明確に上回ったと断定できる状況ではない。[6][7][41][42]