Skild AI表示,S1觀看一段人類示範影片後,毋須微調或進行觀察後訓練,就能執行最長10分鐘、此前未見過的多步驟任務;公司報告在陌生任務測試中,每一步平均成功率為66%,高於語言提示模型的9%。[1][32] S1採用「視覺情境學習」:影片在推理階段充當任務指令,模型把預先學到的抓取、移動、放置等能力組合起來,轉化為當前環境所需的機械人動作。 Skild Brain的整體策略,是透過不同機械人身體、模擬環境及人類視覺資料訓練通用模型;但現有公開資料仍不足以證實其工業部署的實際完成率、運行時間、成本節省或投資回報。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
如果要教傳統機械人做一項新工作,通常要準備專門數據、遙控操作、工程設定,甚至重新訓練模型。Skild AI推出的S1,想將這個流程變成「做一次畀你睇」:人類示範一段影片,機械人再嘗試理解目標、排列步驟,並在自己的環境中完成任務。
Skild表示,S1可以處理此前未出現在預訓練資料中的多步驟操作,任務時間最長可達10分鐘,而且不需要為每項新任務進行微調或觀察後訓練。1
S1採用的是視覺情境學習(visual in-context learning)。簡單講,人類示範影片不是用來更新模型權重的「新訓練資料」,而是在模型開始執行任務時,充當一個視覺提示或指令。S1會觀察示範內容,推斷目標、物件關係及動作次序,再將預先學到的能力轉化成當前環境中的機械人動作。1
因此,S1並不是逐格背誦影片,亦不是照搬示範者每一個手部移動。它需要把已經學過的抓取、搬移、放置及操控物件等技能,重新組合成一個較長的流程。Skild公開展示的例子包括手沖咖啡、為植物換盆、組裝套件,以及反轉班戟。135
真正困難之處在於長時間、長步驟任務。一個簡單動作可能只涉及一次抓取,但10分鐘的工作就可能包含幾十個決定:物件位置會改變,機械人可能抓偏,亦要因應現場情況調整下一步。S1的目標,是在整個流程中維持對任務目標的理解,而不是單純重播示範者的路徑。
Skild在一項由公司公布的陌生任務評估中,比較了影片提示與語言提示的效果。在聲稱達到10萬小時訓練規模的測試中,影片提示策略的每一步平均成功率為66%,相同架構、以語言作提示的視覺—語言—動作(VLA)策略則為9%。32
這個結果反映,示範影片可以直接交代不少文字難以清楚描述的實體細節,例如應該抓哪一件物件、物件要轉向哪邊、動作應按甚麼次序進行,以及示範者如何應對環境變化。
不過,66%必須小心解讀。這是Skild公布的內部評估,並非本文所見的獨立、可重複行業基準測試;而「每一步成功率」亦不等於機械人有66%機會由頭到尾完成整項10分鐘任務。長流程中,只要其中幾個關鍵步驟出錯,整體完成結果便可能大幅不同。
公開例子包括:
這些工作不是單一、孤立的機械動作,而是同時考驗視覺理解、物件操作、動作排序及持續控制。Skild形容,相關任務在預訓練階段並未出現。133
但示範片段可以證明的範圍仍然有限。它們展示了「人類示範一次,機械人嘗試泛化」這種操作介面,卻未能證明S1可以可靠處理任意家務、完全毋須人類監督,或應付生產環境中所有硬件及物理變化。現時亦沒有足夠公開資料,提供這些示範的獨立實際完成率。
S1主打的優勢,是機械人觀察示範後可以直接在推理階段開始執行,不需要另行進行一次任務專屬訓練。Skild及相關報道將這種能力描述為即時情境執行。130
不過,目前公開來源沒有提供可靠而精確的延遲數據,例如影片播完後需要幾多秒才作出第一個動作。「毋須微調」的意思,是模型不需要進行一次新的任務專屬權重更新;這不代表每段影片都會瞬間處理完成,也不代表機械人不需要設定、校準或安全檢查。
S1是Skild更大型的Skild Brain策略一部分。公司的方向,是以多種任務、不同機械人形態、模擬環境及人類視覺資料,訓練一個較通用的模型,而不是為每部機械人及每項工作各自建立一套政策。
Skild表示,曾建立包含10萬種機械人變體的模擬宇宙,並測試模型對訓練資料以外機械人身體的泛化能力。6公司亦形容,Skild Brain的目標是涵蓋人形機械人、四足機械人、桌面機械手臂及流動操作機械人等不同形態。310
市場上流傳Skild擁有比競爭對手多100至1,000倍數據,但這個說法需要保留。現有來源沒有提供一個標準化、由獨立機構審核的比較,去確認各公司的數據量、質素及實際有效機械人經驗。
較穩妥的說法是,Skild正透過跨身體形態訓練及大規模模擬來擴大資料來源,而非只靠一部硬件、幾項工作的專門示範資料。
「Omni-bodied」是Skild用來形容模型跨越不同機械人身體形態的術語。理論上,共用模型可以將較高層次的任務概念,與某一部機械人的具體幾何結構分開學習,從而適應不同的手臂、輪組、機械手及驅動器配置。Skild表示,其模擬測試包括訓練資料中沒有出現、並以零樣本方式控制的機械人形態。6
但這不代表硬件變得無關痛癢。不同機械人仍然有不同感應器、夾具、關節活動範圍、控制介面、延遲、負載能力及安全限制。所謂跨身體形態泛化,較準確的理解是:有機會減少每部機械人的適配工作,但實際部署仍要配合硬件整合、系統設定及目標環境驗證。
公開報道指,Skild的軟件正運行於數百部機械人,應用場景包括工廠、數據中心及物流環境。報道提到的例子包括NVIDIA位於休斯頓的工廠、拉瓜迪亞機場試驗,以及與電線及建造公司合作。Skild亦公布與ABB Robotics、Universal Robots及NVIDIA等方面的合作關係。174
另外,一份報道指Skild計劃與電子製造商鴻海合作,將模型部署到休斯頓製造NVIDIA Blackwell GPU伺服器系統的裝配線上。43這代表測試或部署工作,並不等於已經證明工廠可以大規模自主運作。
目前公開資料不足以計算這些部署的生產完成率、正常運行時間、成本節省或投資回報。實驗室或受控環境的測試結果,亦不應直接當成生產線指標。
Skild的融資規模,令這家公司成為實體AI領域備受注目的企業。彭博報道,Skild於2026年1月完成由軟銀牽頭、約14億美元的C輪融資,估值超過140億美元。13公司較早前在2024年7月公布的A輪融資額為3億美元,當時估值約15億美元。9
「機械人的ChatGPT時刻」這個比喻,講的是使用方式可能出現轉變:工人不必為每項新工作重新編程或訓練機械人,只要示範想要的行為,通用模型便負責將示範轉化成實際動作。S1正是朝這種介面邁出的一步。
但它仍未證明通用機械人已經正式到來。現時最重要的公開結果主要由公司自行報告,測試任務種類有限,而獨立核實的工業部署指標仍未公開。較為審慎的結論是:S1展示了一種有潛力降低專門機械人訓練成本的方法——將影片當成指令,依靠大規模預訓練提供可重用技能,再測試模型能否把這些技能組合成全新的長流程任務。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Skild AI表示,S1觀看一段人類示範影片後,毋須微調或進行觀察後訓練,就能執行最長10分鐘、此前未見過的多步驟任務;公司報告在陌生任務測試中,每一步平均成功率為66%,高於語言提示模型的9%。[1][32]
Skild AI表示,S1觀看一段人類示範影片後,毋須微調或進行觀察後訓練,就能執行最長10分鐘、此前未見過的多步驟任務;公司報告在陌生任務測試中,每一步平均成功率為66%,高於語言提示模型的9%。[1][32] S1採用「視覺情境學習」:影片在推理階段充當任務指令,模型把預先學到的抓取、移動、放置等能力組合起來,轉化為當前環境所需的機械人動作。
Skild Brain的整體策略,是透過不同機械人身體、模擬環境及人類視覺資料訓練通用模型;但現有公開資料仍不足以證實其工業部署的實際完成率、運行時間、成本節省或投資回報。