如果要教傳統機械人做一項新工作,通常要準備專門數據、遙控操作、工程設定,甚至重新訓練模型。Skild AI推出的S1,想將這個流程變成「做一次畀你睇」:人類示範一段影片,機械人再嘗試理解目標、排列步驟,並在自己的環境中完成任務。
Skild表示,S1可以處理此前未出現在預訓練資料中的多步驟操作,任務時間最長可達10分鐘,而且不需要為每項新任務進行微調或觀察後訓練。
1
S1究竟點樣由一段片學識做事?
S1採用的是視覺情境學習(visual in-context learning)。簡單講,人類示範影片不是用來更新模型權重的「新訓練資料」,而是在模型開始執行任務時,充當一個視覺提示或指令。S1會觀察示範內容,推斷目標、物件關係及動作次序,再將預先學到的能力轉化成當前環境中的機械人動作。
1
因此,S1並不是逐格背誦影片,亦不是照搬示範者每一個手部移動。它需要把已經學過的抓取、搬移、放置及操控物件等技能,重新組合成一個較長的流程。Skild公開展示的例子包括手沖咖啡、為植物換盆、組裝套件,以及反轉班戟。
1
35
真正困難之處在於長時間、長步驟任務。一個簡單動作可能只涉及一次抓取,但10分鐘的工作就可能包含幾十個決定:物件位置會改變,機械人可能抓偏,亦要因應現場情況調整下一步。S1的目標,是在整個流程中維持對任務目標的理解,而不是單純重播示範者的路徑。
同語言提示的機械人模型相比,表現如何?
Skild在一項由公司公布的陌生任務評估中,比較了影片提示與語言提示的效果。在聲稱達到10萬小時訓練規模的測試中,影片提示策略的每一步平均成功率為66%,相同架構、以語言作提示的視覺—語言—動作(VLA)策略則為9%。
32
這個結果反映,示範影片可以直接交代不少文字難以清楚描述的實體細節,例如應該抓哪一件物件、物件要轉向哪邊、動作應按甚麼次序進行,以及示範者如何應對環境變化。
不過,66%必須小心解讀。這是Skild公布的內部評估,並非本文所見的獨立、可重複行業基準測試;而「每一步成功率」亦不等於機械人有66%機會由頭到尾完成整項10分鐘任務。長流程中,只要其中幾個關鍵步驟出錯,整體完成結果便可能大幅不同。
S1示範過甚麼工作?
公開例子包括:
這些工作不是單一、孤立的機械動作,而是同時考驗視覺理解、物件操作、動作排序及持續控制。Skild形容,相關任務在預訓練階段並未出現。
1
33
但示範片段可以證明的範圍仍然有限。它們展示了「人類示範一次,機械人嘗試泛化」這種操作介面,卻未能證明S1可以可靠處理任意家務、完全毋須人類監督,或應付生產環境中所有硬件及物理變化。現時亦沒有足夠公開資料,提供這些示範的獨立實際完成率。
睇完片之後,幾快可以開始做?
S1主打的優勢,是機械人觀察示範後可以直接在推理階段開始執行,不需要另行進行一次任務專屬訓練。Skild及相關報道將這種能力描述為即時情境執行。
1
30
不過,目前公開來源沒有提供可靠而精確的延遲數據,例如影片播完後需要幾多秒才作出第一個動作。「毋須微調」的意思,是模型不需要進行一次新的任務專屬權重更新;這不代表每段影片都會瞬間處理完成,也不代表機械人不需要設定、校準或安全檢查。
Skild Brain背後的數據策略
S1是Skild更大型的Skild Brain策略一部分。公司的方向,是以多種任務、不同機械人形態、模擬環境及人類視覺資料,訓練一個較通用的模型,而不是為每部機械人及每項工作各自建立一套政策。
Skild表示,曾建立包含10萬種機械人變體的模擬宇宙,並測試模型對訓練資料以外機械人身體的泛化能力。
6公司亦形容,Skild Brain的目標是涵蓋人形機械人、四足機械人、桌面機械手臂及流動操作機械人等不同形態。
3
10
市場上流傳Skild擁有比競爭對手多100至1,000倍數據,但這個說法需要保留。現有來源沒有提供一個標準化、由獨立機構審核的比較,去確認各公司的數據量、質素及實際有效機械人經驗。
較穩妥的說法是,Skild正透過跨身體形態訓練及大規模模擬來擴大資料來源,而非只靠一部硬件、幾項工作的專門示範資料。
「全身體」機械人腦袋是甚麼意思?
「Omni-bodied」是Skild用來形容模型跨越不同機械人身體形態的術語。理論上,共用模型可以將較高層次的任務概念,與某一部機械人的具體幾何結構分開學習,從而適應不同的手臂、輪組、機械手及驅動器配置。Skild表示,其模擬測試包括訓練資料中沒有出現、並以零樣本方式控制的機械人形態。
6
但這不代表硬件變得無關痛癢。不同機械人仍然有不同感應器、夾具、關節活動範圍、控制介面、延遲、負載能力及安全限制。所謂跨身體形態泛化,較準確的理解是:有機會減少每部機械人的適配工作,但實際部署仍要配合硬件整合、系統設定及目標環境驗證。
已經部署到甚麼地方?有幾成功?
公開報道指,Skild的軟件正運行於數百部機械人,應用場景包括工廠、數據中心及物流環境。報道提到的例子包括NVIDIA位於休斯頓的工廠、拉瓜迪亞機場試驗,以及與電線及建造公司合作。Skild亦公布與ABB Robotics、Universal Robots及NVIDIA等方面的合作關係。
17
4
另外,一份報道指Skild計劃與電子製造商鴻海合作,將模型部署到休斯頓製造NVIDIA Blackwell GPU伺服器系統的裝配線上。
43這代表測試或部署工作,並不等於已經證明工廠可以大規模自主運作。
目前公開資料不足以計算這些部署的生產完成率、正常運行時間、成本節省或投資回報。實驗室或受控環境的測試結果,亦不應直接當成生產線指標。
估值逾140億美元,距離「實體AI的ChatGPT時刻」有幾遠?
Skild的融資規模,令這家公司成為實體AI領域備受注目的企業。彭博報道,Skild於2026年1月完成由軟銀牽頭、約14億美元的C輪融資,估值超過140億美元。
13公司較早前在2024年7月公布的A輪融資額為3億美元,當時估值約15億美元。
9
「機械人的ChatGPT時刻」這個比喻,講的是使用方式可能出現轉變:工人不必為每項新工作重新編程或訓練機械人,只要示範想要的行為,通用模型便負責將示範轉化成實際動作。S1正是朝這種介面邁出的一步。
但它仍未證明通用機械人已經正式到來。現時最重要的公開結果主要由公司自行報告,測試任務種類有限,而獨立核實的工業部署指標仍未公開。較為審慎的結論是:S1展示了一種有潛力降低專門機械人訓練成本的方法——將影片當成指令,依靠大規模預訓練提供可重用技能,再測試模型能否把這些技能組合成全新的長流程任務。