小米于 2026 年 7 月 15 日发布并开源 Xiaomi Robotics U0。这是一款 380 亿参数的具身世界模型,面向机器人训练数据生成与编辑,并非直接输出机器人动作的控制策略。 项目发布了模型权重、推理代码、Gradio 入口以及 AR/FlashAR 推理工具;GitHub 仓库在 9 月又列出 4B 与序列模型权重,并开放 FSDP 训练代码。
发布者使用 GPT-5.6 Terra 编辑图片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
提问中的日期混合了两次更新:380 亿参数的 Xiaomi-Robotics-U0 完整版在 2026 年 7 月 15 日被报道发布;到 9 月,项目仓库又宣布新增 4B 和序列模型权重,以及 FSDP 训练代码。7
9
Xiaomi-Robotics-U0 的核心定位,不是让机器人“直接学会行动”,而是为具身智能批量制造可控的合成训练数据。它可以生成或改造以机器人为中心的视觉场景,并尽量维持对训练重要的内容,例如机器人观测、抓取或操作上下文、相机视角和场景一致性。换句话说,它位于机器人策略模型的上游:先扩充数据,再用于训练策略。1
6
旗舰版 U0 被描述为一款 380 亿参数的多模态自回归世界基础模型。开源内容包括模型权重、源码与推理代码、可组合配置、Gradio 交互入口,以及自回归(AR)和 FlashAR/vLLM 推理补丁。项目仓库采用 Apache-2.0 许可证。2
4
9
此后的 9 月更新又列出了三个权重:Xiaomi-Robotics-U0-4B、Xiaomi-Robotics-U0-Sequence 和 Xiaomi-Robotics-U0-4B-Sequence,同时开放 FSDP 训练代码。这意味着“U0”如今更像一个持续扩展的模型家族,而不只是最初的 38B 检查点。9
小米的主张是用统一架构整合多种能力,包括:
其中最有辨识度的应用是数据扩增。团队可从一段真实机器人轨迹或一次观测出发,改变背景、光照、材质或场景物体等变量,得到新的训练样本,而无需为每种变化重新进行一次实体采集。3
7
这也是 U0 与普通图像生成器的差别:后者通常追求单张图像是否好看、是否有创意;U0 更强调在变化场景时,保留机器人相关的几何关系、交互状态和视角上下文。3
7
U0 是视觉自回归模型:它按顺序生成离散视觉 token,而不是采用扩散模型常见的逐步去噪方式。报道显示,其基础组合涉及 EMU3.5 与 Qwen-3-32B,并以共享的离散视觉分词器支持多项任务。4
7
这种形式便于将图像、机器人观测和时间序列统一表示为 token 流;但代价也很明显——高分辨率图像中的 token 若要按序生成,推理成本会迅速上升。因此,小米为 U0 配套了专门的加速推理路径。1
5
FlashAR+ 是小米为视觉 token 解码设计的加速方法。它不再让所有 token 严格逐个生成,而是采用并行的反对角线解码。vLLM 则用于处理条件前缀、批处理和分页 KV 缓存,同时保留 FlashAR+ 的解码规则。1
9
小米报告称,在一张 H20 GPU 上,FlashAR 配合 vLLM 生成一张图像耗时 5.44 秒;相较其原始 AR eager 实现,速度提升 82.86 倍,相较 FlashAR eager 提升 3.04 倍。7
这个数字需要准确理解:它比较的是小米自家设定下的自回归 eager 基线,并不等于 U0 比扩散模型、其他机器人数据管线或主流视频模型快 83 倍。硬件、图像设置、批处理方式、模型路径和具体工作负载都会改变实际吞吐表现。1
7
仓库支持 AR 和 FlashAR 的 eager、vLLM 两类后端,但不代表每项能力在各个引擎上的支持程度和性能完全相同。涉及时序生成或特定多模态流程时,开发团队应针对计划使用的检查点与推理路径逐项测试。9
| 系统类别 | 主要用途 | U0 的位置 |
|---|---|---|
| 机器人策略模型 | 将传感器观测转换为机器人动作 | U0 是上游的数据生成与扩增模型,不能替代策略模型;其被报告的下游价值是提升策略面对分布变化时的训练效果。 |
| 机器人世界模型/数据模型 | 生成机器人场景、观测、轨迹或类似仿真的数据 | U0 主打的差异点是:一个模型覆盖场景合成、迁移、图像编辑与面向视频的推演。 |
| 通用图像生成模型 | 广泛的文生图、图像创作与编辑 | U0 同样支持文生图和图生图,但小米强调的是具身场景一致性,并未据此证明其在通用图像质量上全面领先。 |
| 通用视频生成模型 | 面向开放题材的影像与视频生成 | U0 的视频能力以机器人场景为导向,不能据此推断它在开放式视频质量上超过领先的通用视频模型。 |
小米称,U0 在 WorldArena 上排名第一,所报告的评测中有 126 个模型参与,并突出其指令遵循、交互质量和多视角一致性表现。小米官方项目页也称其在 100 多个模型中位列第一。7
10
在下游机器人训练中,小米报告称:加入 U0 生成的合成数据后,真机策略面对陌生光照、背景等分布外变化时,成功率从 36.9% 提升至 63.2%。6
7
这些结果最有力地支持了 U0 作为合成数据扩增器的价值,但仍属于项目方报告的成绩。仅凭 WorldArena 排名,并不能证明它在所有机器人、本体、策略、任务、仿真器或通用图像/视频评测中都更强。要独立复现,需要明确模型版本、提示词、采样配置、评测协议、评分设置和对比模型版本。7
10
Apache-2.0 许可证覆盖仓库、权重和推理工具,使得具备足够算力的开发者较容易获取并使用 U0。不过,实际落地前仍应逐个核对检查点的许可证与模型文档,并审查源数据和所生成训练数据的来源、使用许可及合规要求。4
9
视频生成被列为统一能力的一部分,但现有发布材料并不能证明:在最初的 7 月发布时,视频检查点、加速路径、训练数据和评测流程已经像图像与场景迁移工作流一样完整、可复现。因此,图像生成和迁移是目前文档中更清晰的部署重点;若要围绕视频能力建设产品或训练管线,应先验证对应流程。4
6
Xiaomi-Robotics-U0 的意义,不在于取代机器人控制策略或通用媒体生成模型,而在于开放了一条大型、统一的自回归管线,用于生成可控且与机器人任务相关的合成视觉数据。38B 旗舰模型、后续的小模型权重、公开工具链,以及 FlashAR+/vLLM 推理路径,为机器人团队开展数据扩增提供了一个实际起点。7
9
至于其最受关注的指标——82.86 倍内部推理对比、WorldArena 领先,以及 OOD 成功率从 36.9% 升至 63.2%——都很有吸引力,但在被推广为通用结论之前,仍应放到目标机器人、实际算力、具体工作负载和统一评测协议中验证。7
10
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
小米于 2026 年 7 月 15 日发布并开源 Xiaomi Robotics U0。这是一款 380 亿参数的具身世界模型,面向机器人训练数据生成与编辑,并非直接输出机器人动作的控制策略。
小米于 2026 年 7 月 15 日发布并开源 Xiaomi Robotics U0。这是一款 380 亿参数的具身世界模型,面向机器人训练数据生成与编辑,并非直接输出机器人动作的控制策略。 项目发布了模型权重、推理代码、Gradio 入口以及 AR/FlashAR 推理工具;GitHub 仓库在 9 月又列出 4B 与序列模型权重,并开放 FSDP 训练代码。
小米报告称,加入 U0 合成数据后,真机策略在陌生光照、背景等分布外场景中的成功率从 36.9% 提升至 63.2%。这与 WorldArena 排名一样,仍属于项目方公布结果,部署前应结合目标机器人和评测流程验证。