Xiaomi Robotics U0は、2026年7月15日に公開された380億パラメータの具身世界モデル。ロボット制御ポリシーそのものではなく、ロボット学習データの生成・拡張を主目的とする。 重み、推論コード、Gradioエントリーポイント、AR/FlashAR向けの実行環境がApache 2.0で公開され、9月には4B版・系列モデルの重みとFSDP学習コードも追加された。
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
質問にある日付は、複数の更新が混在している可能性があります。フルスケール版のXiaomi-Robotics-U0は2026年7月15日に公開されたと報じられ、9月にはリポジトリで4B版、系列(Sequence)モデルの重み、FSDP学習コードの追加が告知されました。7
9
Xiaomi-Robotics-U0を端的に言えば、ロボット向けの制御可能な合成学習データを量産するための生成システムです。ロボットの観測画像、物体操作の状況、カメラ視点、シーンの整合性を保ちながら、視覚シーンを生成・変換することを狙います。ロボットの観測から直接アクションを出す「制御ポリシー」そのものではありません。1
6
中心となるU0は、380億パラメータのマルチモーダル自己回帰型・世界基盤モデルとして説明されています。公開物には、モデル重み、ソース/推論コード、組み合わせ可能な設定、Gradioの起動口、自己回帰(AR)およびFlashAR/vLLM推論用パッチが含まれます。リポジトリのライセンスはApache-2.0です。2
4
9
さらに2026年9月には、Xiaomi-Robotics-U0-4B、Xiaomi-Robotics-U0-Sequence、Xiaomi-Robotics-U0-4B-Sequenceの3種類の重みと、FSDP学習コードが公開されました。つまりU0は、当初の大型チェックポイント単体ではなく、展開中のモデル群として捉えるのが適切です。9
Xiaomiが掲げるポイントは、次の機能を単一アーキテクチャにまとめたことです。
特に特徴的なのはデータ拡張です。既存のロボット軌跡や観測データを起点に、背景、照明、素材、物体などを変え、現場で毎回撮り直さずに学習例を増やす使い方が想定されています。3
7
一般的な画像生成AIが、単体で見栄えのよい画像を作ることを主な評価軸にしがちなのに対し、U0はロボットにとって重要な幾何情報や操作状況、視点の整合性を残したまま変化を与えることを価値として打ち出しています。3
7
U0は、視覚トークンを順番に生成する自己回帰型のモデルです。拡散モデルで一般的な、ノイズを反復的に除去する方式とは異なります。報道では、EMU3.5とQwen-3-32Bを組み合わせ、対応タスク間で離散的な視覚トークナイザーを共有する構成とされています。4
7
画像、ロボット観測、時系列をトークン列として一貫して扱いやすい一方、高解像度の視覚トークンを逐次的に生成する処理は計算負荷が重くなります。そこで小米は、専用の高速推論経路を組み合わせています。1
5
**FlashAR+**は、視覚トークンの復号を高速化する仕組みです。すべてを厳密に1トークンずつ出す代わりに、反対角線方向のトークン群を並列に生成します。これにvLLMを組み合わせ、条件付きプレフィックス、バッチ処理、ページドKVキャッシュを管理しつつ、FlashAR+の復号規則を維持します。1
9
Xiaomiは、FlashARとvLLMの組み合わせで、H20 GPU 1基あたり画像1枚を5.44秒で生成し、独自の「AR eager」実装比で82.86倍高速、FlashAR eager比で3.04倍高速だったと報告しています。7
ただし、この数字の比較対象は小米自身の自己回帰型eagerベースラインです。拡散型画像生成AI、他社のロボットデータ生成パイプライン、最先端の汎用動画生成AIすべてに対して83倍速いことを示すものではありません。実際のスループットは、ハードウェア、画像設定、バッチサイズ、利用するモデル経路、ワークロードで変わります。1
7
リポジトリはAR/FlashARの双方についてeager実行とvLLMバックエンドをサポートしますが、すべての機能が各エンジンで同じ対応範囲・性能になることを意味しません。動画や特殊なマルチモーダル時系列処理を使うチームは、対象チェックポイントと推論経路を個別に検証する必要があります。9
| システムの種類 | 主な目的 | U0の位置づけ |
|---|---|---|
| ロボット制御ポリシー | 観測をロボットの行動へ変換する | U0はその前段のデータ生成・拡張モデルであり、ポリシーの代替ではない。主張される下流効果は、分布変化に対するポリシー学習の改善である。 |
| ロボット中心の世界モデル/データモデル | ロボットのシーン、観測、軌跡、シミュレーション的データを作る | シーン合成、転送、画像編集、動画志向のロールアウトを1モデルで扱う点がU0の差別化要因とされる。 |
| 汎用画像生成AI | 幅広いテキスト/画像生成・編集 | U0もテキスト画像生成と画像変換に対応するが、小米が強調するのは具身タスクにおける整合性であり、総合的な画質首位を広く主張するものではない。 |
| 汎用動画生成AI | 映画的表現を含む、広範な動画の生成 | U0の動画機能はロボット用途志向であり、自由度の高い動画品質で主要な汎用動画モデルを上回る証拠とは扱えない。 |
Xiaomiは、報告された126モデル参加のWorldArenaでU0が首位だったとし、指示追従、インタラクション品質、マルチビュー整合性を強調しています。公式プロジェクトページでも、100超のモデルの中で1位としています。7
10
下流のロボティクス評価では、U0が生成した合成データを加えることで、未知の照明や背景といった分布外(OOD)条件下で、実機ロボットの成功率が**36.9%から63.2%**へ上がったと報告しています。6
7
これは、U0を合成データ拡張器として使う根拠としては有力です。ただし、これらはプロジェクト側の報告値です。WorldArenaでの順位だけで、あらゆるロボット、制御ポリシー、タスク、シミュレータ、汎用画像・動画ベンチマークでの優位性まで証明されるわけではありません。独立した再現には、正確なモデル版、プロンプト、サンプリング設定、評価手順、採点条件、比較対象の版が必要です。7
10
リポジトリ、重み、推論ツールがApache-2.0で提供されることは、十分な計算資源を持つ開発者にとって利用しやすい条件です。ただし、実装時にはチェックポイントごとのライセンスとモデル文書を確認し、元データおよび生成した学習データの来歴・利用許諾も検討すべきです。4
9
動画生成は統合機能として掲げられています。一方、提供資料だけでは、2026年7月の初回公開時点で、動画用チェックポイント、加速経路、学習データ、評価手順が画像・転送機能と同じ水準で揃い、再現可能だったとは確認できません。現時点では画像とシーン転送のワークフローがより明確に文書化された用途と見なし、動画を中核に採用する前には対象ワークフローを確認するのが安全です。4
6
Xiaomi-Robotics-U0の意義は、ロボット制御や汎用メディア生成AIを置き換えることよりも、制御可能でロボットに関連性の高い合成視覚データを作る大規模・統合型の自己回帰パイプラインを公開した点にあります。38Bの主力モデル、後続の小型・系列モデル、公開ツール群、FlashAR+/vLLMの推論経路は、研究者やロボティクス開発チームにとってデータ拡張の出発点になり得ます。7
9
一方で、82.86倍という内部比較、WorldArena首位、OOD成功率36.9%から63.2%への向上はいずれも期待できる結果ですが、対象ロボット、処理量、ハードウェア、評価プロトコルに照らして検証してから一般化するべきです。7
10
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Xiaomi Robotics U0は、2026年7月15日に公開された380億パラメータの具身世界モデル。ロボット制御ポリシーそのものではなく、ロボット学習データの生成・拡張を主目的とする。
Xiaomi Robotics U0は、2026年7月15日に公開された380億パラメータの具身世界モデル。ロボット制御ポリシーそのものではなく、ロボット学習データの生成・拡張を主目的とする。 重み、推論コード、Gradioエントリーポイント、AR/FlashAR向けの実行環境がApache 2.0で公開され、9月には4B版・系列モデルの重みとFSDP学習コードも追加された。
WorldArena首位や実機でのOOD成功率36.9%から63.2%への改善は有望だが、いずれもプロジェクト側が報告した結果であり、幅広い優位性を独立に証明するものではない。