具身 AI(embodied AI)要真正由實驗室走入工廠、倉庫甚至家庭,關鍵未必只係模型夠唔夠大,而係機械人有冇足夠高質量嘅「做事」數據。對機械人嚟講,單睇人類影片並唔代表知道點樣施力、接觸物件、修正動作,或者喺出錯之後點樣補救。
WUWENAI 嘅創辦人兼行政總裁劉勝祥,曾經負責百度自動駕駛嘅數據及測試工作。佢提出嘅方向,係將真實數據收集、生成式世界模型、虛擬訓練同現實驗證,整合成一個 Real-to-Sim-to-Real(由真實到模擬、再返到真實) 閉環,而唔係將幾種方法當成互相排斥嘅選項。
8
三層架構:由真實世界打底,再喺虛擬世界放大
1. Data Factory:先捉到真實嘅物理因果
Data Factory 會透過多模態設備,收集機械人同物件互動時同步發生嘅資訊,包括影像狀態、運動、接觸情況、動作同任務結果。重點唔只係畫面睇落似真,而係保留「做咗某個動作之後,物件點樣反應」呢種對控制機械人真正有用嘅物理關係。
相比普通網上影片或者純人工生成場景,呢類數據可以提供校準過嘅幾何資訊、機械人動作,以及接觸同結果之間嘅對應。WUWENAI 亦曾公布旗下 Wuyin 物理 AI 數據平台,聲稱擁有超過 1,000 TB 數據,並開放 10,000 小時高質量數據集。
12
2. Generative World Model:將一小撮經驗變成大量可能性
世界模型可以理解為一個學習「環境點樣隨時間變化」嘅神經網絡。佢唔係純粹生成一段好睇嘅影片,而係嘗試根據場景狀態同機械人採取嘅動作,推算之後可能發生咩事。呢類模型會將場景及其時間演化,壓縮成較精簡但有用嘅內部表示。
5
當模型有真實互動數據做根基,就可以生成不同任務變體、運動軌跡、干擾、物件排列,以及原本未必容易喺現實環境撞到嘅失敗情況。換句話講,機械人唔需要每一次都親身試過,先至可以喺訓練階段接觸到某啲可能性。
3. World Simulator:訓練、評估,再揀要返現實世界補捉嘅數據
有咗受真實數據約束嘅世界模型,WUWENAI 再將佢變成可以互動嘅 World Simulator。機械人策略可以喺入面以比實體硬件快得多、成本低得多嘅方式反覆運行;系統亦可以評分結果、找出弱點,再挑選最值得喺現實世界重新收集嘅案例。
近期互動式、受動作條件控制嘅模擬器研究顯示,模擬器內嘅策略評估結果可以同真實世界表現存在相關性。不過,呢個領域仍然係研究中,未可以當成已經完全解決嘅能力。
3
「幾百萬小時」唔代表全部都要由真機械人親身做
劉勝祥所講嘅重點,並唔係 WUWENAI 要喺現實世界錄低幾百萬個機械人小時數。真正嘅設想係:先用相對稀缺、但有物理根據嘅真實互動,建立一個可靠種子數據集;之後由世界模型生成大量可控制、可重播、可測試嘅訓練軌跡。
虛擬迴圈負責提供規模,物理迴圈則不斷用新觀察修正模擬器,減少模型同現實之間越走越遠嘅漂移。呢種真實數據與合成數據互相回饋嘅方式,亦同近年出現嘅閉環真機械人強化學習研究方向一致。
4
點解唔係淨係靠遙控、第一身影片或者純模擬?
傳統方法各有用途,但單獨使用時都有明顯限制:
- 遙控操作(teleoperation):可以直接產生帶動作標籤嘅示範數據,但成本高、速度慢,而且受操作員影響,通常集中喺成功動作,難以有效覆蓋罕見失敗同「如果當時咁做」嘅反事實情境。
- 人類第一身影片:數量可以好大,但一般缺少機械人實際採取嘅動作、經校準嘅幾何資料、力度及接觸訊號,亦未必同目標機械人嘅身體結構直接對應,所以對精細操作控制嚟講,監督能力有限。
- 純模擬:便宜而且可以生成大量場景,但可能錯估幾何、接觸動力學、感測噪音、物件行為或者真實人類環境,形成所謂 sim-to-real gap。將數碼孿生持續同真實觀察對齊,正正係希望縮窄呢道差距。
2
由「照住做」行向「自己試」:模仿學習轉強化學習
示範數據最適合用嚟啟動模仿學習:機械人先學識「示範者點做,我就點做」。但如果有一個足夠可靠、可以按動作推演結果嘅模擬器,策略就可以試唔同選擇,按任務獎勵調整,學習較長時間嘅行為規劃,亦可以練習失敗後點樣復原。呢一步就由模仿學習推向強化學習。
近期研究已展示用世界模型,為視覺-語言-動作(VLA)策略進行強化學習微調嘅可行性;但獎勵是否可靠,以及世界模型能否準確反映物理世界,仍然係決定成敗嘅兩大因素。
1
WUWENAI 面對嘅對手,未必係單純「功能競賽」
WUWENAI 嘅方向,並唔係市場上唯一一套 Real-to-Sim-to-Real 思路。World Labs 嘅 SceniX 同樣描述一個 R2S2R 引擎,將一項真實任務轉化成大量可控制、可重用嘅模擬世界,用於策略訓練及測試。
7 Google DeepMind 多年來亦一直研究點樣用學到嘅環境動力學模型,支援更具規模嘅強化學習。
3
Tesla Optimus 就有硬件迭代、製造能力,以及更廣泛數據和計算資源生態方面嘅優勢。不過,按目前公開資料,未足以證明 WUWENAI 技術上已經領先 Tesla 或 DeepMind。比較合理嘅理解係,各方正逐步靠近一個相似嘅基礎設施架構:真實數據打底、世界模型生成經驗、模擬器做訓練及評估,再將結果帶返現實世界。
點解中國市場可能成為重要試驗場?
中國擁有全球最大嘅工業機械人裝機基礎,亦正積極發展人形機械人,同時推進部分機械人供應鏈本土化。
6 官方評論亦形容,具身 AI 正由小批量試驗逐步走向更廣泛部署。
9
對數據基礎設施公司嚟講,呢個環境意味住可能有較大嘅工廠、機械人、任務同部署場景網絡,可以用嚟收集真實 grounding data,亦可以向唔同機械人製造商提供共用工具。當然,實際能否形成商業規模,仍取決於數據質素、跨機械人兼容性,以及客戶願唔願意將關鍵訓練流程交畀第三方平台。
最終要睇嘅,係模擬器可唔可以預測真實失敗
WUWENAI 所講嘅「世界級」地位,以及聲稱比其他團隊早幾個月,現階段主要屬於公司或媒體說法,未有獨立驗證基準支持。真正關鍵嘅測試係:喺充滿接觸、需要長時間規劃嘅任務入面,模擬器能否準確預測結果;而喺模擬器內訓練出嚟嘅策略,能否穩定轉移到唔同機械人、物件同現實環境。
如果做得到,WUWENAI 可能唔只係另一間做機械人模型嘅初創,而係爭取成為支撐整個具身 AI 行業嘅數據及訓練基礎設施公司。做唔到嘅話,虛擬世界生成再多,亦可能只係將錯誤經驗以更快速度放大。