业内反复引用的数据显示,中国目前约有50万小时合规的真实物理交互数据,而商业化训练通用具身智能模型往往需要数千万小时,缺口超过99%;但这一数字属于行业估算,并非统一的科学门槛。 2026世界机器人大会释放出明确信号:行业关注点正从展示机器人跳舞、奔跑等“绝活”,转向建设遥操作、穿戴式动作捕捉、触觉感知和训练场等数据基础设施。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is the “data starvation” problem limiting China’s embodied-AI and humanoid-robot industry, how did the 2026 World Robot Conference reve. Article summary: China’s embodied-AI bottleneck is not mainly robot hardware but a shortage of lawful, high-quality recordings of robots physically acting in the world. The 2026 World Robot Conference (WRC) showed an industry pivot: alon. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
中国人形机器人产业面临的瓶颈,越来越像是“数据问题”,而不只是硬件问题。机器人可以行走、跳舞,也能在精心准备的环境中完成演示;但要实现可靠的自主行动,它们还需要大量记录:机器如何感知、移动、接触物体,如何失败,又如何在现实世界中修正和恢复。这样的数据必须足够多样、质量足够高,同时满足合规要求。5
14
2026世界机器人大会(WRC)清楚地呈现了这一转向。展馆里依然有吸睛的机器人展示,但参展商同样重点介绍了遥操作设备、穿戴式动作捕捉、触觉与力传感系统,以及用于采集机器人训练数据的基础设施。4
9
13
WRC期间被业内反复引用的一组数字显示,中国现有合规真实物理交互数据约为50万小时,而要训练具备商业价值的通用具身智能模型,往往需要数千万小时的数据。这意味着缺口超过99%。不过,这应被视为行业估算,而不是适用于所有机器人的统一科学阈值;实际需求会随任务类型、机器人平台、运行环境和安全标准而变化。3
5
7
问题在于,物理交互数据并不能用普通的互联网数据简单替代。视频可以记录一个人拿起杯子的过程,却通常不会告诉机器人:关节处于什么状态、抓握力有多大、何时发生接触、摩擦力如何变化、物体是否打滑,以及机器人怎样调整动作。
而这些细节,恰恰决定机器人能否在杯子更重、桌面潮湿或物体位置改变时,依然完成同一个动作。
一段经过编排的机器人表演,可能把最困难的部分隐藏起来。物体、灯光、行进路线和动作时序都可以被提前控制;当机器人遇到意外情况时,也可能由人类操作员即时介入。最终呈现出来的画面看似“自主”,却未必证明机器人学会了稳健的感知—行动策略。
真正的商业部署要求更高。机器人需要适应不同的物体形状、抓取位置、材质、杂乱环境以及周围的人,还要能够识别错误并自行恢复。
对于这类高度依赖接触的任务来说,有价值的数据不只是“最后有没有成功”。更重要的是完整记录动作过程中的观察结果、操作指令、物理状态和修正行为。因此,专门为物理人工智能设计的数据集,需要把多模态感知与动作及其后果连接起来。33
34
40
早期的机器人学习数据集,可以聚焦于短时、重复性高的演示。下一阶段则要处理更长的任务链,以及大量真实接触,例如抓取与分拣、装配、包装、清洁,以及家庭、商店、工厂和服务场景中的连续操作。
这会从三个方面增加数据负担:
扩大规模并不容易。真实机器人运行成本高,物理实验需要安全控制,而高质量数据还必须经过筛选、整理和标注,不能只是把数据越堆越多。一个庞大的视频资料库,并不天然等于有用的机器人训练集。
专业数据服务商正试图填补“人类行为”与“机器可用数据”之间的空白。他们的工作可能包括招募和培训操作员、遥操作机器人、捕捉人体动作、为任务配置传感器、同步多路数据、剔除低质量轨迹,并按照模型开发者的需求进行格式化处理。
遥操作的价值在于,它记录的是人在真实机器人上的操作,而不是仅仅拍摄一个人完成类似动作。虚拟现实(VR)及其他通用控制器可以将人的指令转换为机器人动作;穿戴式设备和动作捕捉系统则能记录更丰富的人体运动,再将其映射到机器人的动作空间。1
这催生了具身智能的新型供应层:企业不再只是制造机器人身体或开发模型,也开始生产连接二者的演示数据和传感器记录。WRC参展商明确把数据采集视为具身智能技术栈的一部分,包括记录人在日常活动中头部和手部运动的系统。4
9
训练场提供了一种介于实验室和真实社会之间的环境。它们可以模拟工厂、仓库、家庭、商业空间和公共服务场所,让机器人在相对可控、但不完全脱离现实的条件下训练、测试和比较。
据对中国信息通信研究院《具身智能训练场研究报告(2026年)》的报道,截至2026年6月底,中国全国已建成并投入运行超过70家具身智能训练场,另有46家处于在建或规划阶段。这些场地已覆盖过半省级行政区域;在已报告的应用中,工业制造最常见,出现于86%的训练场。18
22
但训练场建起来只是第一步,关键在于能否真正运转起来。它们不应只是机器人展示场馆,而应成为数据资源基地和实景测试平台。理想的闭环是:真实场景产生数据,数据改进模型,模型支持更广泛的部署,而部署又带来更多运行数据。14
22
2026年,中国工业和信息化部与国务院国有资产监督管理委员会联合启动人形机器人与具身智能实景实训专项行动,重点面向工业、服务和特种领域,包括制造、物流、医疗、公共服务和应急工作等场景。24
25
相关政府通知提出,到2026年底推动商业化部署1万台人形机器人,并形成超过100个高价值应用场景。26其政策逻辑是把部署本身纳入训练基础设施:鼓励地方政府和国有企业提供真实工作环境,用于测试、验证和迭代相关系统。
24
这并不意味着这些目标一定能够完成,也不意味着机器人会因此立即具备广泛自主能力。但它说明政策重点正在从单纯扩大硬件产能,转向建立支撑商业可靠性的“数据—部署”循环。
视频、语言和仿真数据都很有价值。它们可以帮助模型理解物体是什么、指令意味着什么,以及人类动作大致如何完成;仿真则能够扩大数据规模,覆盖一些成本高昂或存在风险的场景。有关具身智能数据标准的研究也在推动真实数据、仿真数据和多种感知模态的结合,而不是依赖单一数据来源。2
32
但这些数据无法完整描述机器人控制物理世界时面对的问题。以操作物体为例,机器人可能需要估计:
因此,不同采集方式需要相互补充:
自动驾驶数据可以帮助机器人提升感知和导航能力,但灵巧操作拥有不同的动作空间。驾驶主要围绕车辆自身运动展开,通常避免与大多数物体持续接触;抓取、插入和装配则高度依赖接触力、柔顺性以及失败后的恢复动作。
2026世界机器人大会传递的信号,并不是中国不再重视机器人硬件,而是硬件本身无法填补自主能力的差距。未来的竞争优势,可能越来越属于那些能够大规模采集、标准化处理并合法使用多模态物理交互数据的组织。
中国人形机器人产业要走出舞台演示和远程操控机器人的阶段,需要真实部署、专业操作员、配备传感器的环境、共享的数据标准,以及一轮又一轮的测试。相关数据管线正在形成,但从数十万小时迈向商业化常被讨论的数千万小时,仍是行业面前最核心的约束。3
13
14
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
业内反复引用的数据显示,中国目前约有50万小时合规的真实物理交互数据,而商业化训练通用具身智能模型往往需要数千万小时,缺口超过99%;但这一数字属于行业估算,并非统一的科学门槛。
业内反复引用的数据显示,中国目前约有50万小时合规的真实物理交互数据,而商业化训练通用具身智能模型往往需要数千万小时,缺口超过99%;但这一数字属于行业估算,并非统一的科学门槛。 2026世界机器人大会释放出明确信号:行业关注点正从展示机器人跳舞、奔跑等“绝活”,转向建设遥操作、穿戴式动作捕捉、触觉感知和训练场等数据基础设施。
截至2026年6月底,中国已建成并投入运行超过70家具身智能训练场,另有46家在建或规划中;政策正推动机器人进入制造、物流、医疗、公共服务和应急等真实场景。