Skild AI推出的S1,核心概念很簡單:先畀機械人睇一段人類示範影片,再叫佢照住完成工作。Skild表示,S1能處理預訓練時未見過、最長達10分鐘的任務,而且毋須為每項工作重新微調模型,亦毋須改動模型權重。
1
5
如果這項能力經得起獨立測試,機械人學習新技能的方式可能會由「每項任務逐一重新訓練」,轉向「睇示範、即場理解」。不過,這並不等於通用機械人已經可以無限制地處理家務或工廠工作。現時最亮眼的結果主要來自Skild自己的示範及內部測試,外界仍需要更多可重複、標準化的驗證。
S1到底特別在哪裏?
傳統機械人學習系統,往往針對某一項任務、某一款機械人,或者某一組固定環境訓練。S1則將示範影片當成一個可以執行的「提示」:模型需要由影片推斷目標、動作次序、物件之間的關係,以及完成工作時所需的力度和調整。
1
3
例如,單靠一句「沖咖啡」只能講出目標;一段影片卻可以展示應該先後做甚麼、如何握住物件、工具放在哪裏,以及整個流程怎樣一步步完成。Skild的主張是,這種更豐富的提示,能幫助S1處理預訓練資料中未曾出現的長流程任務。
1
5
公司將這種方法形容為機械人版本的語言模型提示(prompting):模型本身的能力不變,示範影片就提供今次任務所需的具體情境。
沖咖啡、種植物、煎薄餅:S1示範過甚麼?
Skild公開展示過的操作包括:
部分示範長達10分鐘,涉及數十個連續步驟。
1
3
5
Skild亦表示,S1在一些定性測試中不只是機械式重播動作。當場景出現變化時,模型據報能作出調整;出錯後會嘗試重做;示範中的澆水壺不可用時,會改用杯子;示範者處理雞蛋的方式不太理想時,模型亦據報會作出修正,而不是原樣照抄。
5
這些表現顯示出一定的靈活性,但要留意:幾段影片示範,並不足以證明系統在廣泛環境下都可靠。實際工業應用還要考驗它面對不同物件、光線、工具、障礙、機械人故障及安全風險時的表現。
同語言提示的VLA模型比較,結果如何?
Skild提供的其中一項最具體比較,是針對模型未見過的任務進行內部評估。在使用10萬小時訓練數據的條件下,公司報告稱,影片提示的情境內政策平均每一步成功率為66%,相對之下,配對的語言提示視覺—語言—動作模型(vision-language-action,簡稱VLA)基線只有9%。
1
4
Skild又表示,當部署環境出現較大變化,例如物件與示範不同,或者執行計劃要求改用另一隻手臂時,語言提示VLA的表現跌幅最多是S1的三倍。
1
另一項公司報告的估算則指,一段影片提示帶來的表現,大致相當於在一個預訓練政策上進行約380次特定任務的後訓練回合。
1
這些數字解釋了影片提示為何可能重要:影片不只說明「要得到甚麼結果」,亦傳達動作次序、時間節奏、物件擺放、工具使用方式及身體操作策略。
但以上仍然是Skild的內部證據,而不是已由外部研究團隊重現的公平對比。現有資料沒有提供公開論文、模型權重,亦沒有標準化的第三方評估。
4
15
機械人要睇完片幾耐才開始做?
Skild形容S1可以在觀看示範後以即時方式運作;發布消息亦指,機械人可以在看完影片後立即執行任務。
2
5
不過,現有來源不足以支持一個普遍適用的精確時間,例如「幾秒內」或「11分鐘內」。影片結束至機械人正式開始動作之間的具體時間,目前未有獲充分驗證的數字。
這個分別在工業環境尤其重要,因為實際部署不只看任務成功率,還要計算設定時間、推理延遲、安全檢查,以及出錯後能否自行恢復。Skild公開的說法是可即時執行,但不應將此解讀成所有情況下都能無縫、即看即做。
Skild靠甚麼數據訓練?
Skild表示,其通用機械人模型依靠多元數據管線,包括大規模模擬、人類在互聯網上的動作影片、機械人數據、遙距操作,以及真實部署時收集的資料。公司在Series C資料中亦描述了一個「數據飛輪」:機械人部署得越多,累積的實際經驗越多,模型便有機會在更多機械人及環境上改進。
37
在SMARTCLOUD SHOW上,聯合創辦人Abhinav Gupta據報表示,Skild採用「所有種類」的機械人數據收集方法,數據量達競爭對手的100至1,000倍。不過,這個倍數是公司的說法,並非公開審核過的業界比較。
6
不同數據來源各自補足不同部分:人類影片提供物件和動作的例子;模擬環境擴大機械人身體及場景的變化範圍;真實機械人數據則把這些抽象理解連接到實際的物理控制。
「全身型」機械人大腦是甚麼意思?
S1屬於Skild更大規模的「omni-bodied」策略,即一個可以跨越不同機械人形態的機械人大腦。這個詞並不是指雙足、四足、輪式機械人及機械臂會做出完全相同的動作。它們的關節、感測器、四肢、輪子,以及實際可做到的動作都不同。
45
Skild想做的是,讓同一個模型先學習跨平台共通的物理規律,再按照某一部機械人的感測器、驅動器及身體結構,將理解轉化成可行動作。換句話說,同一個「大腦」可以共享知識,但輸出會配合不同機械人的能力。
45
這種設計旨在減少為每種硬件配置各自建立及維護完整模型的需要。Skild亦曾表示,訓練過程包括大量不同的模擬機械人,希望模型學到更一般化的物理行為。
42
45
已經在哪些地方部署?
Skild已宣布與ABB Robotics及Universal Robots合作,將軟件整合到工業系統。路透社亦報道,Skild與Nvidia正把機械人大腦部署到與Nvidia Blackwell系統相關的裝配線上。
34
44
這些消息顯示S1及Skild Brain正進入商業測試和整合階段,但並未構成一份完整的公開表現報告。現有證據沒有提供工廠產量、運行時間、錯誤率、安全事故或投資回報的獨立審核數字。
換句話說,「已部署」代表技術正在測試或整合,並不等於已經大規模取代傳統自動化系統。
超過140億美元估值代表甚麼?
投資者對Skild的興趣相當高。彭博報道,SoftBank牽頭的14億美元Series C融資,令公司估值達到超過140億美元,約七個月內增逾三倍。
17
其他報道估算Skild累計融資超過18億美元,但不同來源的數字並不完全一致,因此不應當成已經審核的確定總額。
18
21
22
這個估值反映投資者相信:機械人軟件有機會成為跨硬件平台的基礎層,而不只是依附於某一款人形機械人。不過,「機械人的ChatGPT時刻」目前仍然只是一個比喻,而非已經定案的結論。
S1確實提出了一種可能的轉變——機械人不再需要為每項新工作逐一重新訓練,而是可以透過示範影片學習。投資者Ravi Mhatre形容這是長流程人類勞動任務的「GPT-3時刻」,但這屬於投資者判斷,並非獨立科研驗證。
10
總結:重要的是「用示範組合技能」,不是單純模仿
S1最值得留意的地方,不只是機械人可以模仿一段影片,而是基礎模型可能利用一次示範,組合原有技能、理解場景變化,再完成一連串長流程動作,而且毋須為今次任務更新模型權重。
Skild報告的**66%對9%**內部基準結果,以及長達10分鐘的示範,令這項技術主張具備一定技術意義。
1
4但另一半同樣重要:現時公開證據仍主要來自公司資料、精選示範及早期部署消息。
在外部研究人員以標準化條件重現結果之前,以及工業客戶公開可靠性和安全數據之前,S1較適合被視為物理AI的一條有潛力發展方向,而不是「通用機械人大腦已經正式到來」的確證。