Skild AI 表示,S1 看過一段人類示範影片後,就能執行最長達 10 分鐘、預訓練時未曾見過的多步驟任務,且不需要針對新任務微調模型。 S1 將影片視為推論時的任務提示,結合預訓練中已學會的抓取、移動與操作等技能,轉換成適應當前環境的機器人動作。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
如果教機器人做事,不再需要逐項寫程式、遙控示範,再等待模型重新訓練,而只要「做一次給它看」即可,這會是機器人產業的一大轉變。Skild AI 最新推出的 S1,正是朝這種互動方式前進的機器人基礎模型。
Skild 表示,S1 能透過一段人類示範影片,執行訓練時未曾見過的多步驟操作,任務長度最長可達 10 分鐘,而且不需要針對每個新任務進行微調或額外的觀察後訓練。 1
但這項技術的重點,不是機器人逐格「背誦」影片,而是從示範中理解目標,再把過去預訓練得到的技能組合成新的行動順序。
S1 採用的是視覺情境學習(visual in-context learning)。在人類示範影片中,示範本身就扮演了任務提示的角色。模型在推論階段觀察影片,推測目標、步驟與物件之間的關係,接著將這些資訊轉換成機器人在當前環境中的動作。依照 Skild 的說法,模型不會因為每段新示範而更新權重。 1
這種方式更像是「示範給 AI 看」,而不是傳統意義上的重新訓練。S1 必須把畫面中的資訊,連結到預訓練時已學會的基礎能力,例如抓取、搬移、放置與物件操作,再將這些能力串成較長的工作流程。
Skild 公開展示的任務包括:
這些工作並非單一、孤立的動作,而是包含辨識物件、安排順序、持續控制,以及因應現場變化等要求。 135
真正棘手的地方在於「長時程」操作。短暫的抓取或移動,或許可以單獨腳本化;但一項長達 10 分鐘的工作,可能包含數十個決策、持續變動的物件位置,以及多個可能出錯的環節。S1 的目標,是在整段流程中維持任務目標,同時根據現場情況調整,而不是單純重播示範者的每個動作。
Skild 在一項「訓練時未曾見過的任務」測試中,比較了影片提示與語言提示的模型表現。在訓練規模標示為 100,000 小時的條件下,影片提示策略達到平均每步 66% 的成功率,相較之下,架構可比的語言提示視覺—語言—動作(VLA)策略為 9%。 32
影片能直接提供許多文字難以完整說明的實體細節,例如:
不過,這組數字需要審慎解讀。它來自 Skild 公布的測試與相關報導,並不是本文可確認的獨立、標準化產業基準。此外,每步成功率 66% 不等於一項 10 分鐘任務從頭到尾有 66% 的完整完成保證。長任務只要其中一個關鍵步驟失敗,最終結果就可能受到影響。
目前公開示範涵蓋手沖咖啡、植物換盆、套件組裝與翻煎餅。這些案例展現了 S1 想處理的問題:如何把視覺理解、物件操控、動作排序與持續控制整合起來,而不只是完成單一機械動作。 133
Skild 稱,這些任務在預訓練期間並未出現。不過,現階段可取得的證據主要來自公司自身材料,以及整理公司說法的報導。 133
因此,這些展示可以說明 S1 的使用介面——人類先做一次,機器人再嘗試泛化整套流程——但還不能證明它能可靠處理任意家務、完全不需人員監督,或應付量產現場所有可能的物理變化。
S1 宣稱的優勢,是機器人在觀察示範後,可以直接進入推論與執行階段,不必先進行另一輪任務專屬訓練。Skild 及相關報導將這描述為即時的情境內執行。 130
但目前公開資料沒有提供可靠、精確的延遲數據,例如影片結束後幾秒機器人會做出第一個動作。因此,「不需要微調」的意思,是模型不必針對新任務進行新的權重更新週期;這不代表影片必然能被瞬間處理,也不代表部署時不需要設定、校準或安全檢查。
S1 是 Skild 更大規模 Skild Brain 策略的一部分。公司的方向,是讓單一通用模型在不同任務、機器人形態、模擬環境及人類視覺資料上訓練,而不是為每一項工作和每一款硬體各自打造政策模型。
Skild 表示,其模擬宇宙包含 100,000 種機器人變體,並測試模型對訓練資料中未出現的機器人身體形態進行泛化。 6 公司資料所描述的目標涵蓋人形機器人、四足機器人、桌上型機械手臂與移動式機械手臂等。 310
外界常見「Skild 擁有比競爭對手多 100 至 1,000 倍資料」的說法,但現有來源沒有提供可標準化、可獨立稽核的資料量、資料品質或有效機器人經驗比較。因此,更穩妥的說法是:Skild 正透過跨機器人形態的訓練與大規模模擬,擴張可用的訓練經驗,而不是只依賴單一硬體平台的客製示範資料。
Skild 所說的 omni-bodied,可理解為「跨不同機器人身體形態運作」。理論上,共享模型能將較高層次的任務概念,與某一台機器人的具體幾何結構分開學習,因而有機會適應不同的手臂、輪子、機械手與致動器配置。Skild 表示,其模擬測試也包含訓練時排除、再以零樣本方式測試的機器人形態。 6
但這不表示硬體變得無關緊要。不同機器人仍有不同的感測器、夾爪、關節限制、控制介面、延遲、負載能力與安全規範。跨形態模型或許能減少適配工作,實際部署仍需要相容硬體、系統整合,以及在目標環境中進行驗證。
公開報導稱,Skild 的軟體已在工廠、資料中心與物流場域的數百台機器人上運作;案例包括 NVIDIA 休士頓工廠、拉瓜迪亞機場試驗,以及與電線和建築公司合作的專案。Skild 也宣布與 ABB Robotics、Universal Robots 及 NVIDIA 建立合作關係。 174
這些消息顯示市場對其技術有興趣,也代表模型正在接受真實環境測試。然而,現有公開證據不足以計算量產完成率、正常運轉時間、成本節省或投資報酬率。實驗室或受控測試的結果,不能直接當作工廠生產指標。
另有報導指出,Skild 計畫與鴻海合作,將模型部署到組裝 NVIDIA Blackwell GPU 伺服器系統的生產線。這可視為測試或部署工作的證據,但不能據此推論 Skild 已能在各類工廠廣泛自主運作。 43
Skild 的資金規模,讓它成為實體 AI 領域備受關注的公司之一。彭博報導,Skild 在 2026 年 1 月完成由 SoftBank 領投、約 14 億美元的 C 輪融資,公司估值超過 140 億美元。 13 此前,公司在 2024 年 7 月公布的 A 輪融資為 3 億美元,當時估值約 15 億美元。 9
「機器人的 ChatGPT 時刻」這個比喻,指向的是使用體驗的改變:使用者不必為每項工作重新程式設計或訓練機器人,而是示範一次,讓通用模型負責把意圖轉譯成具體動作。S1 無疑是朝這種介面邁進的重要展示。
但它還不是通用機器人已經到來的證明。現階段最強的公開成果仍主要由公司自行公布,展示任務種類有限,而且缺乏可獨立驗證的工業營運指標。
較為審慎的結論是:S1 展示了一條可能降低機器人任務專屬訓練成本的路徑——把影片當成指令,依靠廣泛預訓練提供可重用技能,再測試模型能否將這些技能組合成全新的長時程任務。這距離「看一次就能穩定完成任何工作」仍有距離,但也說明實體 AI 的競爭焦點,正從單一機器人的專用控制,轉向能否建立跨任務、跨硬體的通用能力。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Skild AI 表示,S1 看過一段人類示範影片後,就能執行最長達 10 分鐘、預訓練時未曾見過的多步驟任務,且不需要針對新任務微調模型。
Skild AI 表示,S1 看過一段人類示範影片後,就能執行最長達 10 分鐘、預訓練時未曾見過的多步驟任務,且不需要針對新任務微調模型。 S1 將影片視為推論時的任務提示,結合預訓練中已學會的抓取、移動與操作等技能,轉換成適應當前環境的機器人動作。
在 Skild 公布的內部測試中,影片提示模型的平均每步成功率為 66%,高於語言提示視覺—語言—動作模型的 9%;但這並非獨立驗證的產業基準。