小米於 2026 年 7 月 15 日釋出 Xiaomi Robotics U0:一個 380 億參數的開源具身世界模型,目的在於生成及修改機器人訓練所需的合成視覺資料,而非直接控制機器人的策略模型。 專案以 Apache 2.0 提供權重、推論工具、Gradio 入口與 AR/FlashAR 後端;GitHub 在 9 月再列出 4B 與序列模型權重,以及 FSDP 訓練程式碼。
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
原問題的日期可能混合了兩次更新:小米完整釋出 Xiaomi-Robotics-U0 的時間為 2026 年 7 月 15 日;到了 9 月,專案儲存庫則公告新增 4B、序列模型權重與 FSDP 訓練程式碼。7
9
Xiaomi-Robotics-U0 的核心定位,是一座為機器人打造的「合成資料工廠」:它能生成或改造以機器人為中心的視覺場景,並盡量保留訓練重要的資訊,例如機器人觀測、操作情境、相機視角與場景一致性。它不是把觀測直接轉成機器人動作的控制策略。1
6
旗艦版 U0 被描述為一個 380 億參數、多模態、自回歸的世界基礎模型。開源內容包括模型權重、原始碼與推論程式、可組合設定、Gradio 操作入口,以及自回歸(AR)與 FlashAR/vLLM 推論的修補程式;儲存庫採用 Apache-2.0 授權。2
4
9
小米在 2026 年 9 月再列出三項新增釋出:Xiaomi-Robotics-U0-4B、Xiaomi-Robotics-U0-Sequence 與 Xiaomi-Robotics-U0-4B-Sequence,並開放 FSDP 訓練程式碼。換言之,U0 現在是持續擴充中的模型家族,而不只是最初的全尺寸 checkpoint。9
小米主打的是「統一化」:同一架構可支援下列工作:
實務上,最有辨識度的用途是資料擴增。開發者可從一段既有的機器人軌跡或觀測開始,改變背景、光照、材質或物件等因素,產出新的訓練範例,減少每次都必須重做實體資料蒐集的成本。3
7
這也使 U0 與一般追求單張圖片吸睛效果的圖像生成器不同:它的重點在於可控地變化場景,同時維持與機器人有關的幾何關係與互動脈絡。3
7
U0 是一個自回歸視覺模型。不同於常見擴散式影像系統以反覆去雜訊方式產生畫面,它會依序生成離散視覺 token。報導指出,其基礎結合 EMU3.5 與 Qwen-3-32B,並以共享的離散視覺 tokenizer 處理各項支援任務。4
7
把圖片、機器人觀測與時間序列都視為 token 串流,是自回歸方法的自然延伸;但高解析度內容若必須逐個 token 產生,運算成本也會很高。這正是小米為 U0 搭配專用加速推論路徑的原因。1
5
FlashAR+ 是小米用於加速視覺 token 解碼的方法。它採用平行的反對角線生成,而非讓每個視覺 token 都嚴格逐一產出;vLLM 則負責條件前綴、批次處理與 paged KV cache 管理,同時保留 FlashAR+ 的解碼規則。1
9
小米公布,在單張 H20 GPU 上,FlashAR 搭配 vLLM 生成一張圖片需 5.44 秒,並稱相較其原始 AR eager 實作快 82.86 倍、相較 FlashAR eager 快 3.04 倍。7
不過,這個限定非常重要:它是與小米自身自回歸 eager 基線、在其公布設定下的比較,不能解讀為 U0 比擴散式影像生成器、所有機器人資料管線,或頂尖通用影片模型快 83 倍。硬體、影像設定、批次大小、模型路徑與工作負載都會影響實際吞吐量。1
7
儲存庫雖支援 AR 與 FlashAR 的 eager、vLLM 後端,但不代表每項能力在每個引擎上都有相同支援程度或效能。若團隊要做時間序列或特定多模態工作流,仍應針對預計採用的 checkpoint 與推論路線實測驗證。9
| 系統類型 | 主要用途 | U0 的位置 |
|---|---|---|
| 機器人策略模型 | 將觀測轉換為機器人動作 | U0 位於上游,負責資料生成與擴增,並非策略模型替代品;其主張的下游價值是提升策略面對分布偏移時的訓練效果。 |
| 機器人導向世界/資料模型 | 產生機器人場景、觀測、軌跡或近似模擬資料 | U0 的差異化主張,是以單一模型整合場景合成、遷移、影像編輯與影片導向推演。 |
| 通用影像生成器 | 廣泛的文字/圖片創作與編輯 | U0 也支援文字生圖與圖生圖,但小米強調的是具身一致性,並未據此證明它在整體通用影像品質上全面領先。 |
| 通用影片生成器 | 電影感或廣泛題材的影片創作 | U0 的影片能力面向機器人情境;這不足以證明它在開放式影片品質上勝過領先的通用影片模型。 |
小米表示,U0 在 WorldArena 評測中排名第一;其公布的評估有 126 個模型參與,並特別強調指令遵循、互動品質與多視角一致性。小米官方專案頁面則稱模型在超過 100 個模型中居首。7
10
在下游機器人訓練方面,小米稱加入 U0 產生的合成資料後,面對陌生光照、背景等變化時,真機的分布外(OOD)成功率從 36.9% 提高至 63.2%。6
7
這些數字最有力地支持了 U0 作為合成資料擴增工具的潛力,但仍屬專案方公布成果。單憑 WorldArena 排名,不能推論它在每一種機器人、策略、任務、模擬器或通用影像/影片基準上都更強。若要獨立重現,還需要精確模型版本、提示詞、採樣設定、評估流程、計分配置與對照模型版本。7
10
儲存庫、權重與推論工具採 Apache-2.0 授權,讓具備足夠運算資源的開發者較容易使用。不過,實作者仍應逐一檢視 checkpoint 的授權與模型文件,並確認來源資料及產生訓練資料的來源、使用權限與合規條件。4
9
影片生成列在統一能力範圍內;但現有釋出材料並未證明,最初 7 月發布時,影片 checkpoint、加速路徑、訓練資料與評估程序在各功能間都同樣完整且可重現。就目前資訊而言,影像與場景遷移工作流是較明確的部署重點;若要以影片能力為核心建置系統,應先驗證所需的特定工作流。4
6
Xiaomi-Robotics-U0 的重要性,不在於取代機器人控制模型或通用媒體生成模型,而在於它開放了一條大型、統一的自回歸管線,用於生成可控、與機器人任務相關的合成視覺資料。380 億參數旗艦模型、後續較小權重、公開工具,以及 FlashAR+/vLLM 路徑,為研究者與機器人團隊提供了資料擴增的實作起點。7
9
至於 82.86 倍內部推論比較、WorldArena 領先,以及 OOD 成功率由 36.9% 升至 63.2% 等關鍵主張,確實值得關注;但在推廣到其他情境前,仍應以目標機器人、工作負載、硬體與評估協定進行測試。7
10
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
小米於 2026 年 7 月 15 日釋出 Xiaomi Robotics U0:一個 380 億參數的開源具身世界模型,目的在於生成及修改機器人訓練所需的合成視覺資料,而非直接控制機器人的策略模型。
小米於 2026 年 7 月 15 日釋出 Xiaomi Robotics U0:一個 380 億參數的開源具身世界模型,目的在於生成及修改機器人訓練所需的合成視覺資料,而非直接控制機器人的策略模型。 專案以 Apache 2.0 提供權重、推論工具、Gradio 入口與 AR/FlashAR 後端;GitHub 在 9 月再列出 4B 與序列模型權重,以及 FSDP 訓練程式碼。
小米宣稱其在 WorldArena 領先,並讓真機 OOD 成功率由 36.9% 提升至 63.2%;這些是專案方公布的結果,不能直接視為已獨立驗證、適用所有機器人與生成任務的結論。