Skild AI 的 S1 是一款以情境內學習(in-context learning)為核心的機器人基礎模型。它的構想很直觀:人類示範一次,機器人觀看影片後,便把這段影片當成任務規格,直接嘗試完成工作,而不是每換一項任務就重新訓練模型。
Skild AI 表示,S1 能處理過去預訓練階段未曾見過、最長約 10 分鐘的任務,而且不必針對任務微調,也不需要修改模型權重。
1
5
這代表實體人工智慧可能正朝更具適應性的方向發展。不過,這並不等於通用型機器人已經準備好在家庭或工廠裡不受限制地工作。目前最亮眼的成果主要來自 Skild AI 自行發布的示範與基準測試,是否能在獨立、標準化的測試中重現,仍是關鍵問題。
S1 的特別之處:把影片當成可執行提示
許多機器人學習系統都是圍繞特定任務、特定機器人身形,或固定的操作環境訓練。S1 則把一段示範影片視為可執行的提示,必須自行推斷目標、動作順序、物件之間的關係,以及完成任務時所需的身體與力量調整。
1
3
這與單純對機器人說「煮咖啡」或「搬動盆栽」並不相同。語言可以指出目標,但影片還能呈現操作次序、抓取方式、工具如何使用、物件如何擺放,以及一連串動作如何延續。Skild AI 的核心主張是,這種資訊更豐富的提示,能讓 S1 泛化到預訓練資料中不存在的長流程任務。
1
5
公司將這種方法形容為機器人版本的語言模型提示:模型本身的能力維持不變,示範影片則提供當下任務所需的情境與細節。
從手沖咖啡到煎鬆餅:S1 展示了哪些任務?
Skild AI 公開展示過多種需要精細操作的流程,包括:
部分示範持續時間達 10 分鐘,包含數十個連續步驟。
1
3
5
Skild AI 也提供了一些定性測試,試圖說明 S1 並非只是重播記憶中的動作。公司稱,在不同測試中,模型能因應場景變化、在部分失誤後重試;當示範中的澆水壺無法使用時,改用杯子;面對示範者不太理想的拿蛋方式時,也會修正做法,而不是完全照搬。
5
這些結果確實顯示出一定程度的行為彈性,但單靠影片示範,還不足以證明模型能在廣泛環境中穩定可靠地工作。機器人必須面對摩擦、重量、光線、物件材質與位置等現實世界變數,而這些因素往往不會在精心挑選的展示影片中完整呈現。
與語言提示 VLA 模型相比,差距有多大?
VLA 是「視覺—語言—動作」(vision-language-action)模型,通常結合影像與文字指令,將理解結果轉換成機器人的動作。Skild AI 提供的最具體比較,來自公司針對陌生任務所做的內部評估。
在使用 10 萬小時訓練資料的設定下,Skild AI 報告稱,影片提示的情境內策略平均每一步成功率為 66%;相較之下,條件相近、但以語言提示的 VLA 基準模型為 9%。
1
4
Skild AI 另外表示,當部署條件出現較大變化,例如物件與示範不同,或執行計畫要求改用另一側手臂時,語言提示 VLA 的表現跌幅最高可達 S1 的三倍。
1
公司也估算,一段影片提示所帶來的表現,約等同於在既有策略上進行 380 次任務專用的後訓練操作。
1
這些數字說明影片提示為何可能具有價值:它不只告訴機器人「最後要得到什麼」,也提供了順序、時機、物件配置、工具使用方式與身體操作策略。不過,讀者需要留意,這些是 Skild AI 的內部證據,不是已由外部研究團隊重現的正面對決基準。現有資料並未提供公開論文、模型權重或統一的外部評測。
4
15
看完影片後,S1 多快能開始工作?
Skild AI 將 S1 描述為觀看示範後即可即時運作;發布相關報導也稱,機器人能在觀看影片後立即執行任務。
2
5
但以目前提供的來源,還無法為一般情況確認「幾秒內」或「11 分鐘內」這類具體數字。從影片結束到機器人正式開始動作之間的標準化時間,尚未獲得充分證明。
這個區別在工業場景尤其重要。實際導入時,準備時間、推論延遲、安全檢查,以及失敗後如何復原,可能與模型單次任務的成功率同樣關鍵。
Skild AI 如何累積機器人資料?
Skild AI 將其通用型機器人模型的能力,歸功於一套廣泛的資料管線。公司曾表示,資料來源包括大規模模擬、人類行動的網路影片、機器人資料、遠端操作,以及真實部署所產生的資訊。其 Series C 資料也描述了一種「資料飛輪」:機器人部署越多,累積的經驗越多,模型便有機會在不同機器人與環境中持續改善。
37
在 SMARTCLOUD SHOW 活動上,Skild AI 共同創辦人 Abhinav Gupta 據報表示,公司採用「各種」機器人資料收集方式,累積的資料量是競爭對手的 100 至 1,000 倍。這個倍數是公司自行提出的說法,並非經公開稽核的產業比較。
6
這套策略的邏輯是讓不同資料來源各司其職:人類影片提供物件與動作的範例,模擬環境擴大機器人身體與場景的變化範圍,而真實機器人資料則把抽象知識連接到實際的物理控制。
「全身形態」機器人大腦是什麼意思?
S1 是 Skild AI 更大範圍「全身形態」(omni-bodied)機器人大腦策略的一部分。這並不是說雙足、四足、輪式機器人與機械手臂會用完全相同的方式移動。它們的關節、感測器、肢體、輪子,以及物理上能完成的動作都各不相同。
45
這個概念真正要表達的是:模型先學習能跨平台轉移的物理規律,再把這些預期映射到特定機器人具備的能力上。換句話說,同一套模型可以在不同機器人身上共享知識,同時根據各自可用的致動器與感測器調整輸出。
45
Skild AI 希望藉此降低為每種機器人配置各自打造、維護完整模型的必要性。公司也曾表示,會在大量不同的模擬機器人身體上進行訓練,以學習更一般化的物理行為。
42
45
目前部署到哪些工業場景?
Skild AI 已宣布與 ABB Robotics 及 Universal Robots 合作,將其軟體整合到工業系統中。路透社也報導,Skild AI 與 Nvidia 正把機器人大腦部署到與 Nvidia Blackwell 系統相關的組裝線。
34
44
這些合作顯示技術已開始走向商業測試與整合,但並不代表公開資料已具備完整的生產表現紀錄。目前提供的證據,尚未證明其在工廠中的產量、稼動率、錯誤率、安全事故或投資報酬率等數字,已經過獨立稽核。
換句話說,「已部署」代表技術正在測試或整合,並不等同於已在大規模生產中取代傳統自動化設備。
超過 140 億美元估值,代表什麼?
投資人對 Skild AI 的興趣相當高。彭博報導,由 SoftBank 領投的 14 億美元 Series C 融資,讓公司估值超過 140 億美元;相較約 7 個月前,估值增加超過三倍。
17
這輪融資反映投資人相信,機器人軟體有可能成為橫跨多種硬體的可擴展平台層。其他報導則把 Skild AI 累計募資額估在 18 億美元以上,但不同來源的數字有所差異,不宜視為經審計確認的最終總額。
18
21
22
至於「機器人的 ChatGPT 時刻」,目前更適合視為一種比喻,而不是已經定論的結論。S1 指向一種可能的轉變:機器人學習新技能的方式,或許能從逐項任務重新訓練,轉向觀看示範後直接學習。投資人 Ravi Mhatre 將這次發布形容為長流程人類勞動任務的「GPT-3 時刻」,但那是投資人的判斷,不是獨立的科學驗證。
10
結論:重要的不是模仿影片,而是理解任務
S1 最值得關注的地方,不只是機器人能不能模仿一段影片,而是基礎模型是否能利用一次示範來組合既有技能、適應變動中的場景,並在不為特定任務更新權重的情況下,完成一長串連續操作。
Skild AI 報告的 66% 對 9% 基準結果,以及最長 10 分鐘的長流程示範,確實讓這項主張具備技術上的重要性。
1
4 但同樣重要的限制是:目前公開證據仍主要來自公司資料、精選示範與早期部署公告。
在外部研究者以標準化條件重現結果之前,並且有工業客戶公開可靠性與安全數據之前,S1 更適合被視為實體人工智慧的一條有前景路線,而不是「通用型機器人大腦已經到來」的 definitive proof。