業界反覆引用的估算顯示,現時合規的真實世界實體互動數據約50萬小時;要支援商業化的通用具身智能模型,往往需要數以千萬小時計,缺口超過99%。不過,實際需求會因任務、機械人平台、環境及安全標準而異。[3][5][7] 2026世界機械人大会的焦點,已由展示機械人跳舞、跑步等「表演」逐步轉向遙操作設備、穿戴式動作捕捉、觸覺與力度感測,以及收集訓練資料的基礎設施。[4][9][13] 截至2026年6月底,中國全國已有超過70個具身智能訓練場投入運作,另有46個在建或規劃中;政策亦正推動機械人進入製造、物流、醫療及公共服務等真實場景。[18][22][24][26]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is the “data starvation” problem limiting China’s embodied-AI and humanoid-robot industry, how did the 2026 World Robot Conference reve. Article summary: China’s embodied-AI bottleneck is not mainly robot hardware but a shortage of lawful, high-quality recordings of robots physically acting in the world. The 2026 World Robot Conference (WRC) showed an industry pivot: alon. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
中國人形機械人的樽頸,愈來愈似係數據問題,而唔單止係硬件問題。機械人可以行路、跳舞,甚至完成安排得井井有條的示範,但要做到可靠自主運作,還需要一種難得多的資料:機械人在真實世界感知、郁動、接觸物件、出錯,以及自行修正的完整紀錄。5
14
2026世界機械人大会(WRC)就將呢個轉變攤喺枱面。展館內除了有外形亮眼的機械人示範,參展商亦集中展示遙操作設備、穿戴式動作捕捉、觸覺及力度感測系統,以及專門收集機械人學習資料的訓練基礎設施。4
9
13
業界在WRC期間多次引用一個估算:中國目前可合法合規使用的真實世界實體互動數據,約有50萬小時;但要訓練具備商業實用性的通用具身智能模型,通常會講到需要數以千萬小時。換句話講,缺口超過99%。不過,呢個應該視為業界估算,而唔係放諸四海皆準的科學門檻;真正需要幾多數據,會視乎任務、機械人形態、運作環境及安全要求而定。3
5
7
關鍵在於,實體互動數據唔可以由普通互聯網數據完全取代。影片可以拍到一個人拎起杯,但通常唔會記錄機械人的關節狀態、抓握力度、接觸時間、摩擦力、打滑情況,或者中途點樣修正動作。
偏偏正正係呢啲細節,決定機械人能否在杯較重、枱面濕滑,或者物件位置稍有不同時,仍然成功重複動作。
一套預先編排的流程,可以將機械人最難處理的部分遮住。物件、光線、路線和時間可能全部受控;一遇到突發情況,亦可能有操作員即時介入。於是,畫面睇落似乎好自主,但其實未必證明機械人已經學識一套穩健的「由感知到行動」策略。
真正商業落地,要求高得多。機械人要面對不同形狀的物件、不同抓取位置、各種表面、雜亂環境,以及周圍活動中的人。佢仲要知道自己做錯,並且有能力補救。
對於大量涉及接觸的任務,最有價值的資料唔只係「最後成功定失敗」,而係整個過程:睇到乜、做過乜、物理狀態點變、點解失手,以及之後點樣修正。專門為物理人工智能設計的數據集,因此會將多模態觀察、行動和行動後果連繫起來。33
34
40
早期的機械人學習數據,可以集中於短時間、重複性高的示範。下一階段,目標會轉向更長、更複雜,而且經常涉及實體接觸的任務,例如搬運、分類、組裝、包裝、清潔,以及家居、商店、工廠和服務場所內的多步驟工作。
數據收集的負擔主要增加在三方面:
要擴大規模並唔容易。真實機械人的操作成本高,實體測試要有安全控制,而高質素數據亦要經過篩選、整理和標註,唔係錄得愈多影片就自然愈有用。
專門提供訓練服務的公司,正逐步填補人類行為與機械人可用數據之間的空位。佢哋的工作可以包括招聘及訓練操作員、遙距控制機械人、捕捉人類動作、為任務加入感測設備、同步不同感測器訊號、剔除低質素動作軌跡,以及按照模型開發者需要整理數據。
遙操作之所以重要,在於它記錄的是人對真實機械人的操作,而唔係只拍攝一個人做類似動作。VR或其他通用控制器可以將人的指令轉換成機械人動作;穿戴式系統及動作捕捉設備,則可以記錄更立體、更複雜的人體運動,再重新對應到機械人身上。1
換句話講,具身智能正在形成一個新的供應層:企業不只製造機械人身體和人工智能模型,亦開始生產將兩者連接起來的示範及感測數據。WRC參展商更直接將數據收集列為具身智能技術堆疊的一部分,包括記錄人們日常活動時頭部和雙手動作的系統。4
9
訓練場提供一個受控、但又唔至於脫離現實的環境,讓機械人可以接受訓練、測試和比較。場地可以模擬工廠、倉庫、家居、商業場所和公共服務環境,既有可重複的情境,又唔會將問題簡化成只在實驗室內完成的固定套路。
根據中國信息通信研究院2026年報告相關報道,截至6月底,全國已有超過70個具身智能訓練場建成並投入運作,另有46個在建或規劃中。相關場地已覆蓋超過一半省級行政區;工業製造是最常見的應用,出現在86%的受訪訓練場。18
22
但訓練場起好只係第一步,真正重要的是要用得着、運轉得起,成為數據資源基地和實景實訓平台,而唔係另一批只供參觀的示範場地。14
22
理想中的循環是:真實場景訓練產生數據,數據改善模型;模型進步後,機械人可以擴大部署;部署之後,再產生更多操作數據。
中國工業和信息化部,以及國務院國有資產監督管理委員會,在2026年推出人形機械人與具身智能實景實訓專項行動。計劃涵蓋工業、服務和特種場景,包括製造、物流、醫療、公共服務及應急工作。24
25
政府通知提出,到2026年底推動商業化應用1萬部人形機械人,以及超過100個高價值應用場景。26政策思路係將部署本身變成訓練基礎設施:鼓勵地方政府和國有企業提供實際工作環境,讓系統接受測試、驗證,再按運作結果持續改良。
24
呢啲目標當然唔代表機械人一定能夠如期達標,亦唔代表佢哋會即時具備廣泛自主能力。但至少反映出,政策焦點正由單純生產硬件,轉向商業可靠性所需的「數據—部署」閉環。
影片、語言和模擬數據仍然有用。它們可以教模型辨認物件、理解指令,以及理解人類動作大概點樣進行;模擬亦可以提供大量情境,減少部分昂貴或危險的實體測試。具身智能數據標準的研究,同樣傾向將真實世界數據、模擬數據和多種感測模態結合,而唔係只依賴單一來源。2
32
但對機械人操作物件而言,以上資料未必完整描述控制問題。機械人可能需要估算:
因此,以下幾類數據各有作用:
自動駕駛數據可以幫助機械人改善感知和導航,但靈巧操作涉及完全不同的動作空間。駕駛主要以車輛為中心,而且一般避免與大部分物件持續接觸;抓取、插入和組裝等工作,則高度依賴接觸力度、柔順性和失敗後的恢復動作。
WRC 2026帶出的訊息,唔係中國已經唔重視機械人硬件,而係單靠硬件無法填補自主能力的差距。
未來的優勢,可能屬於那些能夠大規模收集、標準化,並在合法合規前提下使用多模態實體互動數據的機構。對中國人形機械人產業而言,要由舞台示範和遙控機械人再行一步,必須同時建立真實部署場景、受訓操作員、配備感測器的環境、共通數據標準,以及反覆測試的流程。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
業界反覆引用的估算顯示,現時合規的真實世界實體互動數據約50萬小時;要支援商業化的通用具身智能模型,往往需要數以千萬小時計,缺口超過99%。不過,實際需求會因任務、機械人平台、環境及安全標準而異。[3][5][7]
業界反覆引用的估算顯示,現時合規的真實世界實體互動數據約50萬小時;要支援商業化的通用具身智能模型,往往需要數以千萬小時計,缺口超過99%。不過,實際需求會因任務、機械人平台、環境及安全標準而異。[3][5][7] 2026世界機械人大会的焦點,已由展示機械人跳舞、跑步等「表演」逐步轉向遙操作設備、穿戴式動作捕捉、觸覺與力度感測,以及收集訓練資料的基礎設施。[4][9][13]
截至2026年6月底,中國全國已有超過70個具身智能訓練場投入運作,另有46個在建或規劃中;政策亦正推動機械人進入製造、物流、醫療及公共服務等真實場景。[18][22][24][26]