宇树科技称,其 UnifoLM-X2-1.0 系统已让人形机器人能够实时自主对练。在公司展示中,机器人会出拳、踢腿,并在动态交锋中作出反应;宇树称,整个过程没有人工遥操作,也不是事先编排好的一套固定动作。公司将其称为全球首个由实时世界模型驱动的全自主人人形机器人搏击能力。
这是一项颇具野心的主张,但现阶段更适合被理解为企业演示,而非人形机器人已能在不可预测环境中稳定、普遍工作的证据。公开材料尚未给出延迟、失败率、鲁棒性、安全控制,以及脱离展示场景后的表现等独立基准数据。
宇树称它究竟做到了什么
重点不只是机器人完成了某个高难度动作,而是宇树称系统能在快速变化的肢体接触中,把预测和行动连成闭环。
这里所说的“世界模型”,可以理解为机器人对自身和周边环境构建的一种内部预测表征。系统根据视觉观测及场景变化,推测短时间内可能发生的交互,例如对手身体或攻击动作接下来的走向、双方接触后局面会如何变化,并据此即时规划和执行回应。
若放在对练场景中,这意味着机器人需要持续完成四个相互衔接的步骤:
- 观察:识别当前场景,以及对方机器人的姿态和动作;
- 预测:估计接下来的状态与物理交互;
- 决策:选择后撤、格挡、闪避或主动攻击等应对方式;
- 执行:足够快地把决策转化为实际动作,使其在高动态交锋中仍有意义。
宇树的说法是,X2-1.0 在实时运行这一循环,而非简单回放一段搏击编排。
为什么实时预测是关键
预先脚本化的表演当然可以很震撼,但它默认环境会按预期发展。对练更难:时机、距离、身体位置、接触状态和重心都可能在瞬间改变。
宇树称,UnifoLM-X2-1.0 突破了世界—动作大模型在瞬时规划、决策和动态交互执行方面的瓶颈。换句话说,机器人被设计为基于对下一刻的预期调整行为,而非在事件发生之后再被动反应。
但仅凭发布和视频,仍无法证明该方法的泛化能力。一段精彩演示回答不了关键问题:机器人误判的频率有多高?遭遇意外接触时能否安全恢复?传感器出现误差时会如何表现?面对不同对象、环境和更长时间运行,效果是否仍然稳定?
与 UnifoLM-WMA-0 的关系
X2-1.0 的技术路线承接了宇树此前的 UnifoLM-WMA-0。后者是一套面向通用机器人学习的开源“世界模型—动作”架构;宇树于 2025 年 9 月发布了其训练、推理代码和模型权重。
按项目文档的说明,WMA-0 面向多种机器人本体,其核心是学习机器人与环境之间物理交互的世界模型,并有两类预期用途:
- 仿真:生成交互式环境反馈和合成数据,供机器人学习使用;
- 策略增强:将预测性世界模型与动作头连接,用对交互结果的预测来改进下一步动作选择。
X2-1.0 被描述为这一方向更即时、面向实际运行的应用:根据对物理交互未来状态的预测,驱动机器人当下的真实动作。现有公开信息仍不足以独立判断,X2-1.0 在架构上与 WMA-0 到底有多大差异,以及其表现分别有多少来自模型、硬件控制、训练数据或特定任务调校。
演示背后的商业化背景
此次演示出现之际,宇树已是中国最受关注的人形机器人厂商之一。公司由王兴兴于 2016 年在杭州创立,最初以相对低价的四足机器人闻名,随后扩展至 H1、G1 和 R1 等人形机器人产品。
17
宇树称,截至 2026 年 7 月,公司累计生产约 1.8 万台双足人形机器人。需要注意的是,这是企业披露的产量,并不等同于已被独立核实的终端用户部署量。
G1 曾以约 1.6 万美元的价格推出;后续报道也提到过 1.35 万美元的报价,反映出价格会随时间和具体配置而变化。
销售结构同样说明,炫目的演示不能与成熟落地画等号。据行业报道援引宇树招股书数据,2025 年前三季度,其人形机器人收入的 73.6% 来自高校和科研机构,约 9% 来自工业应用。 这意味着当前需求仍明显偏向科研、教育、开发和展示,而不是大规模、成熟的工厂应用。
资本市场很热,技术市场仍在早期
2026 年 8 月 19 日,宇树在上交所科创板上市,显示出投资者对人形机器人的高度热情。公司 IPO 募资约 61 亿元人民币,约合 9.04 亿美元;散户认购据报超过可供认购股份的 8,000 倍。
4
17
路透社报道,宇树股价盘中一度上涨约 629%,最终较发行价收涨 460%。
3
13 这些数字反映的是市场情绪,并不能直接说明自主型人形机器人已经能够以经济、安全的方式实现规模化运营。
王兴兴本人对时间表的表述更谨慎。他认为,在乐观情形下,具身智能可能在两到三年内迎来人形机器人的“ChatGPT 时刻”;若进展较慢,则可能需要五到十年。他对这一里程碑的定义是:机器人进入一个陌生家庭后,只凭文字或语音指令便能完成约 80% 的任务。
18
20
结论
UnifoLM-X2-1.0 值得关注之处,在于它把人形机器人能力的重点放在了可预测的闭环交互,而不只是单项运动能力或脚本化表演。宇树称,机器人能借助实时世界模型预测物理交互、决定下一步动作,并在对练中完成执行,且不需要远程操控。
更强的结论仍要等待演示之外的证据:可复现实验、更多技术披露、独立基准测试、安全数据,以及在多样真实任务中持续稳定运行的证明。目前,X2-1.0 更应被看作一项引人注目的企业主张,以及世界模型机器人技术发展方向的信号,而不是通用人形机器人自主能力已经得到验证的证据。