Skild AI का कहना है कि S1 एक वीडियो देखकर 10 मिनट तक चलने वाले अनदेखे काम कर सकता है—बिना मॉडल के वेट बदले या उस काम के लिए अलग डेटा जुटाए। S1 ने कॉफी बनाना, पौधा लगाना, किट असेंबल करना और पैनकेक पलटना जैसे कामों के प्रदर्शन दिखाए हैं; कंपनी के अनुसार यह बदले हुए ऑब्जेक्ट और कुछ गलतियों के बाद भी अनुकूलन कर सकता है।...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, unveiled by co-founder Abhinav Gupta at SMARTCLOUD SHOW 2026 in Seoul on August 25, 2026, a. Article summary: S1 is Skild AI’s flagship robotics foundation model for in-context learning: a robot watches one video demonstration—including an unseen task lasting up to 10 minutes—and then executes it without collecting task-specific. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Skild AI का S1 एक रोबोटिक्स फाउंडेशन मॉडल है, जिसे कंपनी ने in-context learning के लिए बनाया है। आसान भाषा में कहें तो हर नए काम के लिए रोबोट को दोबारा प्रशिक्षित करने के बजाय S1 को उस काम का वीडियो दिखाया जाता है। मॉडल उस वीडियो को काम के निर्देश की तरह पढ़कर रोबोट को उसे करने की कोशिश कराता है। Skild के अनुसार, S1 ऐसे अनदेखे काम भी कर सकता है जो 10 मिनट तक चलें—बिना task-specific fine-tuning और मॉडल के weights बदले। 1
5
यह physical AI को अधिक अनुकूलनीय बनाने की दिशा में दिलचस्प कदम है। लेकिन इसका मतलब यह नहीं है कि सामान्य उपयोग वाले रोबोट अब किसी भी घर या कारखाने में भरोसेमंद ढंग से काम करने के लिए तैयार हैं। फिलहाल सबसे मजबूत दावे Skild के अपने डेमो और बेंचमार्क पर आधारित हैं; स्वतंत्र परीक्षण अभी महत्वपूर्ण हैं।
कई robot-learning सिस्टम किसी खास काम, robot body या तय operating conditions के लिए प्रशिक्षित होते हैं। S1 इसके बजाय प्रदर्शन वाले वीडियो को एक तरह के executable prompt की तरह लेता है। उसे लक्ष्य, कदमों का क्रम, वस्तुओं के बीच संबंध और काम के दौरान जरूरी भौतिक बदलावों को समझना होता है। 1
3
यह केवल रोबोट से “कॉफी बनाओ” या “पौधा हिलाओ” कहने से अलग है। भाषा लक्ष्य बता सकती है, लेकिन वीडियो यह भी दिखाता है कि काम किस क्रम में करना है, वस्तु को कैसे पकड़ना है, औजारों का इस्तेमाल कैसे करना है और कई चरणों वाला पूरा काम कैसे आगे बढ़ता है। Skild का मुख्य दावा है कि ऐसा समृद्ध prompt S1 को उन लंबे कामों में generalize करने देता है, जो उसके pretraining में मौजूद नहीं थे। 1
5
कंपनी इस तरीके को language model को prompt करने के robotics संस्करण के रूप में पेश करती है: मॉडल की मूल क्षमताएं स्थिर रहती हैं, जबकि वीडियो प्रदर्शन उस खास काम का संदर्भ देता है।
Skild ने S1 को कई manipulation workflows करते हुए दिखाया है, जिनमें शामिल हैं:
कुछ प्रदर्शन 10 मिनट तक चलते हैं और इनमें दर्जनों लगातार किए जाने वाले कदम शामिल होते हैं। 1
3
5
कंपनी ने ऐसे qualitative tests भी बताए हैं जिनका उद्देश्य यह दिखाना है कि S1 केवल याद की हुई robot motion को दोहरा नहीं रहा। इन परीक्षणों में मॉडल ने कथित तौर पर बदले हुए scene के अनुसार प्रतिक्रिया दी, कुछ गलतियों के बाद फिर कोशिश की, उपलब्ध watering can न होने पर कप का इस्तेमाल किया और demonstrator द्वारा अंडा पकड़ने के अटपटे तरीके की हूबहू नकल करने के बजाय उसे सुधारा।
ये संकेत व्यवहारिक लचीलेपन की ओर इशारा करते हैं, लेकिन केवल वीडियो डेमो से अलग-अलग वातावरणों में व्यापक reliability साबित नहीं होती। 5
Skild द्वारा दिया गया सबसे स्पष्ट comparison unseen tasks के आंतरिक मूल्यांकन से आता है। कंपनी के अनुसार, 100,000 घंटे के training data पर उसके video-prompted in-context policy ने औसतन 66% per-step success rate हासिल किया, जबकि समान language-prompted vision-language-action यानी VLA baseline का आंकड़ा 9% था। 1
4
Skild का यह भी कहना है कि deployment conditions में बड़ा बदलाव होने पर language-prompted VLA का प्रदर्शन S1 की तुलना में तीन गुना तक अधिक गिरा। उदाहरण के लिए, demonstration में दिखाए गए objects बदल दिए गए हों या काम को दूसरे हाथ से करना पड़े। 1
एक अन्य कंपनी-रिपोर्टेड तुलना में अनुमान लगाया गया कि एक video prompt ने pretrained policy पर लगभग 380 task-specific post-training episodes जितना प्रदर्शन दिया। 1
इन आंकड़ों से वीडियो prompting की संभावित उपयोगिता समझ आती है। वीडियो केवल अंतिम नतीजा नहीं दिखाता, बल्कि sequence, timing, वस्तुओं की स्थिति, tool use और physical strategy भी बताता है। फिर भी इन परिणामों को Skild के आंतरिक प्रमाण के रूप में पढ़ना चाहिए, स्वतंत्र रूप से दोहराए गए head-to-head benchmark के रूप में नहीं। उपलब्ध सामग्री में public research paper, model weights या standardized external evaluation शामिल नहीं है। 4
15
Skild S1 को demonstration देखने के बाद real time में काम करने वाला मॉडल बताती है। लॉन्च के आसपास की रिपोर्टों में भी कहा गया कि वीडियो देखने के तुरंत बाद robot task execute कर सकता है। 2
5
हालांकि, सामान्य सिस्टम के लिए “कुछ सेकंड में” या “11 मिनट के भीतर” जैसी verified timing बताने के लिए पर्याप्त प्रमाण उपलब्ध नहीं हैं। वीडियो खत्म होने और execution शुरू होने के बीच का सटीक समय supplied sources से स्थापित नहीं होता।
औद्योगिक उपयोग में यह अंतर महत्वपूर्ण है, क्योंकि setup time, inference latency, safety checks और गलती के बाद recovery behavior, raw task success जितने ही अहम हो सकते हैं।
Skild अपने general-purpose robotics model के निर्माण में एक व्यापक data pipeline को महत्वपूर्ण बताती है। कंपनी ने large-scale simulation, मानव गतिविधियों के internet videos, robot data, teleoperation और वास्तविक deployments से मिलने वाली जानकारी का इस्तेमाल बताया है। उसकी Series C सामग्री में एक data flywheel का भी वर्णन है: deployment से नया अनुभव मिलता है, जो अलग-अलग robots और environments में मॉडल की क्षमताओं को बेहतर कर सकता है। 37
SMARTCLOUD SHOW में Skild के co-founder Abhinav Gupta ने कथित तौर पर कहा कि कंपनी robot-data collection के “हर तरह” के तरीकों का इस्तेमाल करती है और उसके पास competitors की तुलना में 100 से 1,000 गुना अधिक data है। यह multiplier कंपनी का दावा है, सार्वजनिक रूप से audited industry comparison नहीं। 6
व्यावहारिक रूप से, अलग-अलग data sources समस्या के अलग हिस्से सिखाते हैं: मानव वीडियो objects और actions के उदाहरण देते हैं, simulation robot bodies और environments की संभावित विविधता बढ़ाता है, जबकि real-robot data इन abstractions को physical control से जोड़ता है।
S1, Skild की व्यापक “omni-bodied” robot brain strategy का हिस्सा है। इसका अर्थ यह नहीं है कि bipedal, quadrupedal, wheeled robot और robotic arm एक जैसे चलते हैं। इनके joints, sensors, limbs, wheels और संभव actions अलग होते हैं। 45
इस architecture का लक्ष्य ऐसे physical patterns सीखना है जो अलग-अलग platforms पर काम आ सकें। इसके बाद मॉडल उन अपेक्षाओं को किसी खास robot के available actuators और sensors के अनुसार actions में बदलता है। इस तरह एक ही मॉडल अलग-अलग embodiments के बीच knowledge साझा करने की कोशिश करता है, जबकि हर robot की अपनी सीमाओं के अनुसार output देता है। 45
इस approach का उद्देश्य हर robot configuration के लिए पूरी तरह अलग model बनाने और maintain करने की जरूरत घटाना है। Skild ने अधिक सामान्य physical behavior सीखने के लिए बड़ी संख्या में simulated robot bodies पर training की बात भी कही है। 42
45
Skild ने ABB Robotics और Universal Robots के साथ अपने software को industrial systems में integrate करने के लिए collaborations की घोषणा की है। Reuters ने यह भी रिपोर्ट किया कि Skild और Nvidia, Nvidia Blackwell systems से जुड़ी assembly lines पर robot brain deploy कर रहे थे। 34
44
ये घोषणाएं commercial testing और integration की दिशा दिखाती हैं, लेकिन पूरी public performance record उपलब्ध नहीं करातीं। supplied evidence से factory throughput, uptime, error rates, safety incidents या return on investment के स्वतंत्र रूप से audited आंकड़े स्थापित नहीं होते।
किसी technology का deployment में जाना यह दिखाता है कि उसका परीक्षण या integration हो रहा है—यह साबित नहीं करता कि उसने बड़े पैमाने पर conventional automation को पहले ही बदल दिया है।
Skild में निवेशकों की दिलचस्पी काफी बड़ी रही है। Bloomberg के अनुसार, SoftBank के नेतृत्व में हुई $1.4 अरब की Series C ने कंपनी का valuation $14 अरब से अधिक कर दिया—लगभग सात महीनों में तीन गुने से भी ज्यादा वृद्धि। 17
यह financing इस भरोसे को दर्शाती है कि robotics software कई तरह के hardware के ऊपर एक scalable platform layer बन सकता है। अन्य रिपोर्टों में Skild की cumulative funding $1.8 अरब से अधिक बताई गई है, लेकिन उपलब्ध आंकड़े स्रोत के अनुसार अलग-अलग हैं; इन्हें definitive audited total नहीं माना जाना चाहिए। 18
21
22
रोबोटिक्स के लिए “ChatGPT moment” वाली तुलना को फिलहाल analogy की तरह समझना बेहतर है, तय निष्कर्ष की तरह नहीं। S1 इस संभावित बदलाव की ओर संकेत करता है कि robots को हर task के लिए अलग-अलग retrain करने के बजाय demonstrations से नए skills सिखाए जा सकते हैं। Investor Ravi Mhatre ने इस लॉन्च को long-horizon human labor tasks के लिए “GPT-3 moment” कहा, लेकिन यह investor judgment है, independent scientific validation नहीं। 10
S1 का सबसे महत्वपूर्ण विचार सिर्फ यह नहीं है कि robot किसी वीडियो की नकल कर सकता है। असली दावा यह है कि foundation model एक demonstration से skills को जोड़ सकता है, बदले हुए scene के अनुसार खुद को ढाल सकता है और किसी खास task के लिए अपने weights update किए बिना लंबे sequence को पूरा कर सकता है।
Skild का reported 66% बनाम 9% benchmark और 10 मिनट तक चलने वाले long-horizon demonstrations तकनीकी रूप से महत्वपूर्ण हैं। 1
4 लेकिन सावधानी भी उतनी ही जरूरी है: सार्वजनिक प्रमाण अभी मुख्य रूप से कंपनी की सामग्री, चुनिंदा demonstrations और शुरुआती deployment घोषणाओं पर निर्भर हैं।
जब तक बाहरी शोधकर्ता standardized conditions में इन परिणामों को दोहरा नहीं लेते और industrial customers reliability तथा safety data प्रकाशित नहीं करते, S1 को physical AI की एक promising दिशा के रूप में देखना चाहिए—इस प्रमाण के रूप में नहीं कि general-purpose robot brain पूरी तरह आ चुका है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Skild AI का कहना है कि S1 एक वीडियो देखकर 10 मिनट तक चलने वाले अनदेखे काम कर सकता है—बिना मॉडल के वेट बदले या उस काम के लिए अलग डेटा जुटाए।
Skild AI का कहना है कि S1 एक वीडियो देखकर 10 मिनट तक चलने वाले अनदेखे काम कर सकता है—बिना मॉडल के वेट बदले या उस काम के लिए अलग डेटा जुटाए। S1 ने कॉफी बनाना, पौधा लगाना, किट असेंबल करना और पैनकेक पलटना जैसे कामों के प्रदर्शन दिखाए हैं; कंपनी के अनुसार यह बदले हुए ऑब्जेक्ट और कुछ गलतियों के बाद भी अनुकूलन कर सकता है।
मॉडल को औद्योगिक रोबोटों के लिए पेश किया जा रहा है, लेकिन सार्वजनिक जानकारी से अभी अपटाइम, उत्पादन क्षमता, त्रुटि दर या निवेश पर रिटर्न जैसे स्वतंत्र रूप से सत्यापित आंकड़े सामने नहीं आते।