小米在 2026 年 7 月 15 日發布並開源 Xiaomi Robotics U0:一個 380 億參數、面向具身 AI 的多模態自回歸世界模型;它用於生成及改造機械人訓練資料,唔係直接控制機械人嘅政策模型。 項目公開咗權重、推理工具、Gradio 入口同 AR/FlashAR 後端,採用 Apache 2.0 授權;到 9 月再加入 4B 與序列模型權重,以及 FSDP 訓練程式碼。
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
原問題將兩次更新混埋咗:380 億參數嘅 Xiaomi-Robotics-U0 完整發布,報道指係 2026 年 7 月 15 日;到 9 月,項目倉庫再宣布推出 4B、序列模型權重,以及 FSDP 訓練程式碼。7
9
簡單講,Xiaomi-Robotics-U0 係一部為機械人「生產」合成訓練資料嘅模型。它可以生成或修改以機械人為中心嘅視覺場景,同時盡量保留對訓練重要嘅元素,例如鏡頭視角、操作情境、機械人觀察內容同場景一致性。它本身唔係把相機觀察直接變成機械人動作指令嘅控制政策(policy)。1
6
旗艦版 U0 被描述為一個 380 億參數多模態自回歸世界基礎模型。公開內容包括模型權重、原始碼與推理程式、可組合設定、Gradio 操作入口,以及自回歸(AR)與 FlashAR/vLLM 推理補丁;GitHub 倉庫採用 Apache-2.0 授權。2
4
9
到 2026 年 9 月,倉庫列出另外三個版本:Xiaomi-Robotics-U0-4B、Xiaomi-Robotics-U0-Sequence 同 Xiaomi-Robotics-U0-4B-Sequence,並公開 FSDP 訓練程式碼。換句話講,U0 而家唔只係單一 38B checkpoint,而係逐步擴展緊嘅模型家族。9
小米嘅定位係將幾種原本可能要靠不同工具處理嘅工作,放入同一套架構:
最有工程意義嘅用法係資料擴增。例如已有一段真機軌跡或觀察資料,團隊可以改變背景、燈光、材質或物件,製造更多訓練情境,而唔使每次轉一個環境就重新安排實體機械人收集數據。3
7
所以,U0 同一般追求「單張相夠靚」嘅圖像生成器唔同。它更著重受控變化之下,仍然保留同機械人有關嘅幾何、視角與互動脈絡。3
7
U0 屬於自回歸視覺模型:它會逐步生成離散視覺 token,而唔係採用不少擴散式圖像系統常見嘅反覆去噪方式。報道指其基座結合 EMU3.5 與 Qwen-3-32B,並以共享嘅離散視覺 tokenizer 支援多項任務。4
7
呢種做法令圖片、機械人觀察資料同時間序列,都可以視為 token 流處理;但高解像度生成亦會變得昂貴,因為 token 原本要逐個依次產生。小米正正因此加入專門嘅加速推理方案。1
5
FlashAR+ 係小米為視覺 token 解碼設計嘅加速方法。它唔係嚴格逐個 token 生成,而係採用平行「反對角線」方式解碼。vLLM 則負責處理條件前綴、批次執行同 paged KV cache,同時保留 FlashAR+ 嘅解碼規則。1
9
小米報告指,在一張 H20 GPU 上,FlashAR 配合 vLLM 生成一張圖片需時 5.44 秒,較原本 AR eager 實作快 82.86 倍,亦較 FlashAR eager 快 3.04 倍。7
不過,呢個數字要睇清楚:它係對比小米自家自回歸 eager 基線、並且基於其公布設定嘅結果,唔代表 U0 比擴散式圖像生成器、所有機械人資料管線,或者頂尖通用影片模型快 83 倍。硬件、解像度、批次大小、模型路徑同工作負載都會影響實際吞吐量。1
7
倉庫支援 AR 與 FlashAR 嘅 eager 和 vLLM 後端,但唔等於每項能力喺每個推理引擎都有完全一樣嘅支援度或效能。要跑時間序列或較專門嘅多模態工作流程,團隊應先按自己計劃用嘅 checkpoint 同推理路線做驗證。9
| 系統類型 | 主要用途 | U0 嘅位置 |
|---|---|---|
| 機械人政策模型 | 將觀察資料轉化為機械人動作 | U0 係上游資料生成與擴增工具,唔係政策模型替代品;其聲稱嘅下游價值,在於幫政策模型更能應付資料分布轉變。 |
| 機械人世界/資料模型 | 產生機械人場景、觀察、軌跡或近似模擬資料 | U0 所聲稱嘅分別,係以單一模型涵蓋場景合成、遷移、圖像編輯與面向影片嘅 rollout。 |
| 通用圖像生成器 | 廣泛文字/圖片創作與編輯 | U0 支援文字生圖與圖生圖,但小米重點放喺具身一致性,並冇足夠獨立證據證明它在整體圖像質素上全面領先。 |
| 通用影片生成器 | 電影感或開放式影片創作 | U0 嘅影片能力偏向機械人觀察及任務情境,唔應被理解為已證明勝過頂尖通用影片模型嘅開放式影片質素。 |
小米表示,U0 在 WorldArena 評測中排名第一;所報結果有 126 個模型參與,並突出其指令遵循、互動質素與多視角一致性。小米官方項目頁亦稱,模型在超過 100 個模型中位居第一。7
10
至於下游機械人訓練,小米稱加入 U0 生成嘅合成資料後,真機在分布外(OOD)情況下嘅成功率,面對陌生光照及背景等改變時,由 36.9% 提升至 63.2%。6
7
呢類結果最有力支持 U0 作為合成資料擴增器嘅價值,但仍然係項目方報告嘅結果。單靠 WorldArena 排名,未能證明它對每一款機械人、政策模型、任務、模擬器,以至通用圖像/影片基準都更優勝。要獨立重現,需要知道確切模型版本、提示詞、採樣設定、評估流程、評分配置,以及對比模型版本。7
10
倉庫、權重與推理工具採 Apache-2.0 授權,令有足夠運算資源嘅開發者較容易取得及使用 U0。不過,實作者仍應逐一核對各 checkpoint 嘅授權與文件,亦要審視原始資料及生成訓練資料嘅來源與可使用範圍。4
9
影片生成確實被列為統一能力之一;但現有發布資料未能證明,早期 7 月推出時,影片 checkpoint、加速路徑、訓練資料與評估程序,已經同圖像及場景遷移流程一樣完整、成熟及可重現。若要落地,圖像與遷移工作流係目前較清楚有文件支持嘅方向;打算依賴影片功能前,應先驗證具體 workflow。4
6
Xiaomi-Robotics-U0 嘅意義,唔係取代機械人控制政策,亦唔係宣告自己全面擊敗通用媒體生成模型;它真正值得留意之處,係開放咗一條大型、統一嘅自回歸管線,用嚟生成可控制、同機械人任務相關嘅合成視覺資料。38B 旗艦版、後續細模型、公開工具,以及 FlashAR+/vLLM 推理路線,為研究人員同機械人團隊提供一個資料擴增起點。7
9
至於 82.86 倍內部推理比較、WorldArena 第一名,以及 OOD 成功率由 36.9% 升至 63.2% 呢幾個最矚目數字,都值得跟進,但正式採用前,仍應以目標機械人、實際工作負載、現場硬件同評估方法親自測試,唔好過度概括。7
10
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
小米在 2026 年 7 月 15 日發布並開源 Xiaomi Robotics U0:一個 380 億參數、面向具身 AI 的多模態自回歸世界模型;它用於生成及改造機械人訓練資料,唔係直接控制機械人嘅政策模型。
小米在 2026 年 7 月 15 日發布並開源 Xiaomi Robotics U0:一個 380 億參數、面向具身 AI 的多模態自回歸世界模型;它用於生成及改造機械人訓練資料,唔係直接控制機械人嘅政策模型。 項目公開咗權重、推理工具、Gradio 入口同 AR/FlashAR 後端,採用 Apache 2.0 授權;到 9 月再加入 4B 與序列模型權重,以及 FSDP 訓練程式碼。
小米所報嘅 WorldArena 第一名、以及真機 OOD 成功率由 36.9% 升至 63.2%,均值得留意;不過屬項目方公布結果,未足以證明對所有機械人、任務或生成系統都全面領先。