業界反覆引用的估算顯示,中國目前約有50萬小時合規的真實世界實體互動資料,但商業化一般型具身模型可能需要數千萬小時;這代表逾99%的缺口,但並非已確立的科學門檻。 2026 世界機器人大會的焦點,已不只是展示機器人跳舞、奔跑或完成編排動作,也包括遙操作設備、穿戴式動作捕捉、觸覺感測與訓練資料收集系統。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is the “data starvation” problem limiting China’s embodied-AI and humanoid-robot industry, how did the 2026 World Robot Conference reve. Article summary: China’s embodied-AI bottleneck is not mainly robot hardware but a shortage of lawful, high-quality recordings of robots physically acting in the world. The 2026 World Robot Conference (WRC) showed an industry pivot: alon. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
中國人形機器人的關鍵瓶頸,正逐漸從「造不出硬體」轉向「沒有足夠資料」。機器人或許已能走路、跳舞,甚至在精心準備的環境中完成一連串示範;但要在真實世界可靠地自主工作,還需要更難取得的資料:機器如何感知、移動、接觸物體、犯錯,以及在失敗後修正和復原。這些資料必須具備合法使用條件、足夠多樣性和高品質,不能只是大量影片的堆積。5
14
2026 世界機器人大會(WRC)清楚呈現了這種轉向。展場除了吸睛的機器人示範,也出現遙操作設備、穿戴式動作捕捉、觸覺與力覺感測系統,以及專門收集機器人學習資料的基礎設施。換句話說,產業開始把「如何餵養機器人的大腦」視為與打造機器人身體同等重要的工程。4
9
13
WRC期間業界反覆引用的數字顯示,中國目前可取得、符合規範的真實世界實體互動資料約為 50萬小時;而要訓練具備商業實用性的通用型具身模型,往往會談到 數千萬小時 的需求。兩者相較,短缺幅度超過99%。3
5
7
不過,這應被視為產業估算,而不是放諸四海皆準的科學門檻。實際需要多少資料,會取決於任務類型、機器人平台、運作環境與安全標準。簡單的固定動作,與要在家庭、工廠或公共場所處理大量變化的通用模型,所需規模自然不同。
問題在於,實體互動資料不能用一般網路資料取代。影片可以拍到人拿起一個杯子,卻通常沒有記錄機器人的關節狀態、握力、接觸時間、摩擦力、打滑情況或中途修正。偏偏正是這些細節,決定機器人能否在杯子更重、桌面濕滑,或物件位置改變時,仍然成功完成動作。
一套經過排演的流程,可能把機器人最棘手的問題藏在幕後。物件、燈光、行走路線和動作時間都可以預先控制;一旦出現意外,也可能由人類操作員即時介入。最後呈現出的畫面看似自主,卻未必證明機器人已經學會穩健的「感知到行動」策略。
商業部署要求更高。機器人必須應付不同的物件形狀、抓取位置、材質、雜亂環境和周遭人員,還要能辨認錯誤並自行恢復。對於需要頻繁接觸物體的任務,重要的並不只是最後有沒有達成目標,而是整個過程中的觀察、動作、物理狀態和修正方式。為此,專門設計的實體人工智慧資料集,會把多模態觀察與動作及其後果連結起來。33
34
40
早期的機器人學習資料集,可以集中在短小、重複性高的示範。下一階段則是更長、步驟更多,且充滿實體接觸的工作,例如抓取與分類、組裝、包裝、清潔,以及家庭、商店、工廠和服務場所中的各種任務。
這會從三方面增加資料負擔:
擴大規模並不容易。真實機器人的操作成本高,實體實驗需要安全控制,而高品質資料也必須經過篩選與整理,不能只是「收得越多越好」。一個龐大的影片庫,並不會自動變成好用的機器人訓練資料集。
專業訓練資料供應商正逐步填補「人類行為」與「機器可用資料」之間的空隙。它們可能負責招募和訓練操作員、遙控機器人、捕捉人類動作、為任務加裝感測器、同步感測串流、剔除品質不佳的軌跡,再將資料整理成模型開發者可使用的格式。
遙操作的價值,在於它記錄的是人類如何操作一台真實機器人,而不只是拍攝人類做出類似動作。VR或其他通用控制器可以將人類輸入轉換為機器人指令;穿戴式裝置和動作捕捉系統,則能收集更高維度的人體、手臂與手部運動,再將其映射到機器人身上。1
這使具身人工智慧出現一個新的供應層:企業不只製造機器人和訓練模型,也開始生產連接兩者的示範資料與感測記錄。WRC參展商已把資料收集明確放在具身智慧技術堆疊之中,包括利用頭部和手部感測器,記錄人們在日常活動中的動作。4
9
訓練場提供受控、但比實驗室更貼近現實的環境,讓機器人能夠訓練、測試和比較。這些場地可以重現工廠、倉庫、住宅、商業空間和公共服務場所,讓開發者取得可重複的真實情境,同時避免把問題簡化成單純的實驗室流程。
根據中國信息通信研究院2026年報告相關報導,截至6月底,中國全國已有逾 70個 具身人工智慧訓練場投入運作,另有 46個 在建或規劃中。這些場地已覆蓋超過半數省級行政區;在已報告的訓練場中,工業製造是最常見的應用,出現比例為86%。18
22
但訓練場建成只是第一步,更重要的是實際使用。它們的目的應是成為資料資源基地和實景測試平台,而不只是另一批展示場館。理想運作循環是:真實世界訓練產生資料,資料改善模型,模型支援更廣泛部署,而部署又帶來更多運作資料。14
22
中國工業和信息化部與國務院國有資產監督管理委員會在2026年推出人形機器人與具身人工智慧實景實訓專項行動,涵蓋工業、服務和特種場景,包括製造、物流、醫療、公共服務與應急工作。24
25
政府公告提出的目標包括在2026年底前推動 1萬台人形機器人 商業化落地,以及形成超過 100個高價值應用場景。26 這套政策的思路,是把部署本身變成訓練基礎設施的一部分:鼓勵地方政府和國有企業提供實際工作環境,讓系統在運作條件下接受測試、驗證和改進。
24
這些目標並不保證機器人一定能按期達標,也不代表它們會因此立即具備廣泛自主能力。但政策重點確實已超越硬體生產,轉向商業可靠性所需的「資料—部署」閉環。
影片與語言資料仍然有用。它們可以幫助模型理解物件是什麼、指令代表什麼,以及人類動作大致如何進行。模擬則能以較低成本擴大資料量,並涵蓋一些不宜或難以在現實中重現的情境。相關研究也指出,具身資料標準應結合真實世界資料、模擬資料和多種感測模態,而不是依賴單一來源。2
32
然而,這些資料無法完整描述機器人的控制問題。以操作物件為例,機器人可能需要估算:
因此,多種收集方式各有作用:
自動駕駛資料可以協助感知和導航,但靈巧操作涉及不同的動作空間。駕駛主要以車輛為中心,且通常避免與大多數物件持續接觸;抓取、插入和組裝等任務,則高度依賴接觸力、柔順性與失敗復原能力。
WRC 2026帶來的訊息,不是中國不再重視機器人硬體,而是硬體單獨無法填補自主化差距。未來競爭優勢,可能越來越屬於那些能夠大規模收集、標準化,並在合法前提下使用多模態實體互動資料的組織。
對中國人形機器人產業而言,從舞台示範和遙控機器走向可靠自主,必須同時具備真實部署、受訓操作員、裝備感測器的環境、共享資料標準,以及持續反覆測試的能力。這條供應鏈正在形成;但從數十萬小時走向商業化常被提及的數千萬小時,仍是產業眼前最核心的限制。3
13
14
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
業界反覆引用的估算顯示,中國目前約有50萬小時合規的真實世界實體互動資料,但商業化一般型具身模型可能需要數千萬小時;這代表逾99%的缺口,但並非已確立的科學門檻。
業界反覆引用的估算顯示,中國目前約有50萬小時合規的真實世界實體互動資料,但商業化一般型具身模型可能需要數千萬小時;這代表逾99%的缺口,但並非已確立的科學門檻。 2026 世界機器人大會的焦點,已不只是展示機器人跳舞、奔跑或完成編排動作,也包括遙操作設備、穿戴式動作捕捉、觸覺感測與訓練資料收集系統。
截至2026年6月底,中國已有逾70個具身人工智慧訓練場投入運作,另有46個在建或規劃中;政策則試圖透過真實場景部署,建立「實景訓練—資料沉澱—模型改進—擴大部署」的循環。