Skild AI के अनुसार, S1 एक मानव वीडियो देखने के बाद बिना फाइन ट्यूनिंग के पहले से अनदेखे, कई चरणों वाले 10 मिनट तक के काम कर सकता है। अनदेखे कार्यों के एक आंतरिक परीक्षण में इसकी औसत प्रति चरण सफलता दर 66% रही, जबकि भा... S1 वीडियो को इनपुट निर्देश की तरह इस्तेमाल करता है और प्री ट्रेनिंग के दौरान सीखी गई क्षमताओं—जै...
प्रकाशितकर्ताGPT-5.6 Luna से संपादितGPT Image 1.5 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI का S1 रोबोट प्रोग्रामिंग को “कोड लिखने” के बजाय “उदाहरण दिखाकर सिखाने” जैसा बनाने की कोशिश करता है। व्यक्ति किसी काम का वीडियो बनाता है और S1 उस वीडियो को एक दृश्य निर्देश की तरह देखकर रोबोट को मौजूदा वातावरण में वही लक्ष्य हासिल करने के लिए कार्रवाई करने को कहता है। कंपनी के अनुसार, यह मॉडल पहले से न देखे गए, कई चरणों वाले कामों को 10 मिनट तक की अवधि में कर सकता है—वह भी हर नए काम के लिए फाइन-ट्यूनिंग या अलग पोस्ट-ऑब्जर्वेशन ट्रेनिंग के बिना। 1
यह दावा इसलिए अहम है क्योंकि पारंपरिक रोबोटिक्स में नया काम सिखाने के लिए अक्सर टेलीऑपरेशन, बड़ी मात्रा में कार्य-विशिष्ट डेटा, इंजीनियरिंग और दोबारा प्रशिक्षण की जरूरत पड़ती है। S1 का विचार यह नहीं है कि रोबोट वीडियो को फ्रेम-दर-फ्रेम याद करके उसी गति की नकल करे। इसके बजाय, मॉडल वीडियो से लक्ष्य और क्रियाओं का क्रम समझने की कोशिश करता है और पहले से सीखी गई क्षमताओं को जोड़कर नया कार्य पूरा करता है।
S1 की मुख्य तकनीक को विजुअल इन-कॉन्टेक्स्ट लर्निंग कहा जाता है। आसान शब्दों में, मानव का प्रदर्शन वीडियो मॉडल के लिए नया प्रशिक्षण डेटासेट नहीं, बल्कि उसी समय दिया गया एक कार्य-प्रॉम्प्ट है। S1 वीडियो देखकर यह अनुमान लगाता है कि कौन-सी वस्तु उठानी है, उसे किस दिशा में रखना है, कौन-से कदम पहले या बाद में करने हैं और मौजूदा दृश्य के अनुसार गतिविधियों में कैसे बदलाव करना है। Skild के विवरण के अनुसार, हर नए वीडियो के बाद मॉडल के वेट्स में बदलाव नहीं किया जाता। 1
इस प्रक्रिया में S1 प्री-ट्रेनिंग से मिली बुनियादी क्षमताओं—जैसे वस्तु पकड़ना, ले जाना, रखना और हेरफेर करना—को एक लंबे क्रम में संयोजित करता है। कंपनी के सार्वजनिक उदाहरणों में पोर-ओवर कॉफी बनाना, पौधा गमले में लगाना, किट असेंबल करना और पैनकेक पलटना शामिल हैं। 1
35
सबसे बड़ी चुनौती यहां लॉन्ग-होराइजन नियंत्रण की है। एक छोटी गतिविधि को स्क्रिप्ट करना अपेक्षाकृत आसान हो सकता है, लेकिन 10 मिनट के काम में दर्जनों निर्णय, बदलती वस्तु-स्थितियां और गलती की कई संभावनाएं होती हैं। S1 का लक्ष्य प्रदर्शन करने वाले व्यक्ति की हर गतिविधि की हूबहू नकल करना नहीं, बल्कि पूरे काम के उद्देश्य को बनाए रखते हुए वर्तमान वातावरण के अनुसार कार्रवाई बदलना है।
Skild ने पहले से अनदेखे कार्यों के अपने मूल्यांकन में वीडियो-प्रॉम्प्ट वाले मॉडल की तुलना भाषा-प्रॉम्प्ट वाले विजन-लैंग्वेज-एक्शन मॉडल से की। कंपनी के अनुसार, 100,000 घंटे के बताए गए प्रशिक्षण पैमाने पर वीडियो-प्रॉम्प्ट नीति ने औसतन 66% प्रति-चरण सफलता दर हासिल की, जबकि तुलनीय भाषा-प्रॉम्प्ट नीति 9% पर रही। 32
इससे संकेत मिलता है कि किसी काम का दृश्य प्रदर्शन केवल शब्दों की तुलना में अधिक भौतिक जानकारी दे सकता है। वीडियो में यह दिखाई देता है कि किस वस्तु को पकड़ना है, उसकी दिशा क्या होनी चाहिए, कौन-सा कदम पहले करना है और प्रदर्शन करने वाला व्यक्ति वातावरण में बदलाव पर कैसे प्रतिक्रिया देता है।
फिर भी इस आंकड़े को सावधानी से पढ़ना चाहिए। यह Skild द्वारा बताया गया आंतरिक मूल्यांकन है, स्वतंत्र रूप से दोहराया गया उद्योग-मानक बेंचमार्क नहीं। साथ ही, 66% प्रति-चरण सफलता दर का अर्थ यह नहीं है कि रोबोट हर 10 मिनट का पूरा काम 66% संभावना से शुरू से अंत तक सफलतापूर्वक कर लेगा। लंबे काम में कई चरण होने के कारण कुल कार्य-सफलता इससे काफी अलग हो सकती है।
सार्वजनिक प्रदर्शनों में ये कार्य शामिल हैं:
इन उदाहरणों में केवल एक अलग गतिविधि नहीं, बल्कि वस्तु पहचान, पकड़ने और रखने, सही क्रम बनाए रखने तथा लंबे समय तक नियंत्रण जैसी कई क्षमताएं एक साथ काम करती हैं। Skild का कहना है कि ये कार्य प्री-ट्रेनिंग में पहले से मौजूद नहीं थे। उपलब्ध प्रमाण मुख्य रूप से कंपनी के अपने दावों और उन्हें संक्षेप में पेश करने वाली रिपोर्टों पर आधारित हैं। 1
33
इन प्रदर्शनों से यह समझ आता है कि प्रस्तावित इंटरफेस कैसा है: व्यक्ति एक बार काम दिखाता है और रोबोट उस प्रक्रिया को नए संदर्भ में सामान्यीकृत करने की कोशिश करता है। लेकिन इससे यह सिद्ध नहीं होता कि S1 मनमाने घरेलू काम कर सकता है, हर स्थिति में बिना निगरानी चल सकता है या उत्पादन-स्थल पर मिलने वाले सभी भौतिक बदलावों को संभाल सकता है।
S1 का विज्ञापित लाभ यह है कि प्रदर्शन देखने के बाद अलग पोस्ट-ट्रेनिंग चरण की जरूरत नहीं होती। Skild और लॉन्च कवरेज इसे रियल-टाइम इन-कॉन्टेक्स्ट एक्जीक्यूशन के रूप में बताते हैं। 1
30
हालांकि, उपलब्ध स्रोत वीडियो समाप्त होने और रोबोट की पहली गतिविधि शुरू होने के बीच सटीक समय—मसलन, कितने सेकंड लगते हैं—नहीं बताते। “नो फाइन-ट्यूनिंग” का मतलब यह है कि हर नए कार्य के लिए मॉडल के वेट्स को दोबारा अपडेट नहीं किया जाता। इसका यह अर्थ जरूरी नहीं कि हर वीडियो तुरंत प्रोसेस हो जाए या रोबोट को सेटअप, कैलिब्रेशन और सुरक्षा जांच की जरूरत न हो।
S1, Skild की व्यापक Skild Brain रणनीति का हिस्सा है। कंपनी एक ही सामान्य-उद्देश्य मॉडल को अलग-अलग कार्यों, रोबोट संरचनाओं, सिमुलेशन और मानव वीडियो डेटा पर प्रशिक्षित करना चाहती है, ताकि हर रोबोट और हर काम के लिए अलग नीति न बनानी पड़े। Skild का कहना है कि उसने 100,000 अलग-अलग रोबोट वैरिएंट वाला एक सिमुलेटेड ब्रह्मांड बनाया और ऐसे रोबोट शरीरों पर सामान्यीकरण का परीक्षण किया जिन्हें प्रशिक्षण डेटा से बाहर रखा गया था। 6
इस तरह का क्रॉस-एम्बॉडिमेंट प्रशिक्षण मॉडल को किसी एक मशीन के आकार या मोटर व्यवस्था से आगे सामान्य नियंत्रण सिद्धांत सीखने में मदद कर सकता है। Skild के अनुसार, उसका मॉडल ह्यूमनॉइड, चौपाए रोबोट, टेबलटॉप आर्म और मोबाइल मैनिपुलेटर जैसे अलग-अलग प्रकार के हार्डवेयर के साथ काम करने के लिए बनाया गया है। 3
10
Skild के पास प्रतिस्पर्धियों से 100 से 1,000 गुना अधिक डेटा होने का दावा अक्सर दोहराया जाता है, लेकिन इसे सावधानी से देखना चाहिए। उपलब्ध स्रोत डेटासेट के आकार, गुणवत्ता या उपयोगी रोबोट अनुभव की कंपनियों के बीच कोई मानकीकृत और स्वतंत्र रूप से ऑडिट की गई तुलना नहीं देते। अधिक ठोस निष्कर्ष यह है कि Skild एक ही हार्डवेयर के लिए अलग-अलग प्रदर्शन जुटाने के बजाय सिमुलेशन और कई रोबोट शरीरों पर प्रशिक्षण के जरिए पैमाना बढ़ाने की कोशिश कर रहा है।
ओम्नी-बॉडीड Skild का अपना शब्द है। इसका आशय ऐसे मॉडल से है जो अलग-अलग रोबोट शरीरों में अपनी क्षमताएं स्थानांतरित कर सके। सिद्धांत रूप में, साझा मॉडल किसी एक मशीन की सटीक बनावट से अलग उच्च-स्तरीय कार्य-समझ सीख सकता है और फिर अलग-अलग हाथों, पहियों, पैरों, ग्रिपर और मोटर लेआउट के अनुसार अनुकूलित हो सकता है। Skild का कहना है कि उसके सिमुलेशन परीक्षणों में प्रशिक्षण से बाहर रखे गए रोबोट रूपों को भी जीरो-शॉट तरीके से नियंत्रित किया गया। 6
लेकिन इसका मतलब यह नहीं कि हार्डवेयर अप्रासंगिक हो जाता है। वास्तविक रोबोटों में सेंसर, ग्रिपर, जॉइंट लिमिट, पेलोड, प्रतिक्रिया की देरी, कंट्रोल इंटरफेस और सुरक्षा सीमाएं अलग होती हैं। ओम्नी-बॉडीड मॉडल का दावा यह है कि वह हर रोबोट के लिए शून्य से नई प्रणाली बनाने की जरूरत कम कर सकता है—न कि यह कि तैनाती के लिए किसी एकीकरण या सत्यापन की जरूरत ही नहीं होगी।
सार्वजनिक रिपोर्टों के अनुसार, Skild का सॉफ्टवेयर फैक्ट्रियों, डेटा सेंटर और लॉजिस्टिक्स वातावरण में सैकड़ों रोबोटों पर चल रहा है। बताए गए उदाहरणों में NVIDIA की ह्यूस्टन फैक्ट्री, LaGuardia का परीक्षण और वायरिंग तथा निर्माण कंपनियों के साथ काम शामिल हैं। कंपनी ने ABB Robotics, Universal Robots और NVIDIA के साथ भी साझेदारियों की घोषणा की है। 17
4
इन गतिविधियों से व्यावसायिक रुचि और वास्तविक दुनिया में परीक्षण का संकेत मिलता है, लेकिन इनके आधार पर उत्पादन-स्तर की पूर्णता दर, अपटाइम, लागत बचत या निवेश पर रिटर्न की स्वतंत्र गणना नहीं की जा सकती। किसी नियंत्रित प्रयोगशाला परीक्षण के परिणाम को उत्पादन का आंकड़ा मानना सही नहीं होगा। एक रिपोर्ट में Foxconn के साथ NVIDIA Blackwell GPU सर्वर सिस्टम से जुड़ी असेंबली लाइनों पर नियोजित तैनाती का भी उल्लेख है; यह परीक्षण या तैनाती का प्रमाण है, व्यापक रूप से स्वायत्त फैक्ट्री संचालन का नहीं। 43
Skild को मिली बड़ी फंडिंग ने इसे फिजिकल AI के सबसे अधिक चर्चित प्रयासों में शामिल कर दिया है। Bloomberg के अनुसार, कंपनी ने जनवरी 2026 में SoftBank के नेतृत्व में लगभग 1.4 अरब डॉलर की Series C फंडिंग जुटाई, जिससे उसका मूल्यांकन 14 अरब डॉलर से अधिक हो गया। 13 इससे पहले जुलाई 2024 में घोषित Series A में Skild ने 30 करोड़ डॉलर जुटाए थे और कंपनी का मूल्यांकन 1.5 अरब डॉलर बताया गया था।
9
“रोबोटिक्स का ChatGPT मोमेंट” वाली उपमा उस संभावित बदलाव को दर्शाती है जिसमें किसी कर्मचारी को हर नए काम के लिए रोबोट प्रोग्राम या री-ट्रेन करने के बजाय केवल वांछित व्यवहार दिखाना पड़े। S1 इसी तरह के इंटरफेस की दिशा में एक महत्वपूर्ण कदम दिखता है।
लेकिन यह अभी सामान्य-उद्देश्य रोबोटों के पूरी तरह तैयार हो जाने का प्रमाण नहीं है। अब तक के सबसे मजबूत सार्वजनिक परिणाम कंपनी द्वारा बताए गए हैं, प्रदर्शित कार्यों की संख्या सीमित है और स्वतंत्र रूप से सत्यापित औद्योगिक मेट्रिक्स उपलब्ध नहीं हैं। संतुलित निष्कर्ष यह है कि S1 रोबोटों की कार्य-विशिष्ट ट्रेनिंग कम करने का एक संभावित रास्ता दिखाता है: वीडियो को निर्देश की तरह इस्तेमाल करना, प्री-ट्रेनिंग से मिली क्षमताओं को दोबारा जोड़ना और देखना कि रोबोट उन्हें लंबे, नए कार्यों में कितनी विश्वसनीयता से लागू कर पाता है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Skild AI के अनुसार, S1 एक मानव वीडियो देखने के बाद बिना फाइन ट्यूनिंग के पहले से अनदेखे, कई चरणों वाले 10 मिनट तक के काम कर सकता है। अनदेखे कार्यों के एक आंतरिक परीक्षण में इसकी औसत प्रति चरण सफलता दर 66% रही, जबकि भा...
Skild AI के अनुसार, S1 एक मानव वीडियो देखने के बाद बिना फाइन ट्यूनिंग के पहले से अनदेखे, कई चरणों वाले 10 मिनट तक के काम कर सकता है। अनदेखे कार्यों के एक आंतरिक परीक्षण में इसकी औसत प्रति चरण सफलता दर 66% रही, जबकि भा... S1 वीडियो को इनपुट निर्देश की तरह इस्तेमाल करता है और प्री ट्रेनिंग के दौरान सीखी गई क्षमताओं—जैसे पकड़ना, उठाना, रखना और वस्तुओं को संभालना—को नए क्रम में जोड़कर रोबोट की गतिविधियां तैयार करता है।
Skild का व्यापक Skild Brain अलग अलग रोबोट शरीरों और सिमुलेटेड वैरिएंट पर प्रशिक्षण लेने के लिए बनाया गया है, लेकिन सार्वजनिक जानकारी से अभी उत्पादन स्तर की पूर्णता दर, अपटाइम या निवेश पर रिटर्न स्वतंत्र रूप से सिद्ध न...
Skild AI के अनुसार, S1 एक मानव वीडियो देखने के बाद बिना फाइन ट्यूनिंग के पहले से अनदेखे, कई चरणों वाले 10 मिनट तक के काम कर सकता है। अनदेखे कार्यों के एक आंतरिक परीक्षण में इसकी औसत प्रति चरण सफलता दर 66% रही, जबकि भा... S1 वीडियो को इनपुट निर्देश की तरह इस्तेमाल करता है और प्री ट्रेनिंग के दौरान सीखी गई क्षमताओं—जै...
प्रकाशितकर्ताGPT-5.6 Luna से संपादितGPT Image 1.5 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI का S1 रोबोट प्रोग्रामिंग को “कोड लिखने” के बजाय “उदाहरण दिखाकर सिखाने” जैसा बनाने की कोशिश करता है। व्यक्ति किसी काम का वीडियो बनाता है और S1 उस वीडियो को एक दृश्य निर्देश की तरह देखकर रोबोट को मौजूदा वातावरण में वही लक्ष्य हासिल करने के लिए कार्रवाई करने को कहता है। कंपनी के अनुसार, यह मॉडल पहले से न देखे गए, कई चरणों वाले कामों को 10 मिनट तक की अवधि में कर सकता है—वह भी हर नए काम के लिए फाइन-ट्यूनिंग या अलग पोस्ट-ऑब्जर्वेशन ट्रेनिंग के बिना। 1
यह दावा इसलिए अहम है क्योंकि पारंपरिक रोबोटिक्स में नया काम सिखाने के लिए अक्सर टेलीऑपरेशन, बड़ी मात्रा में कार्य-विशिष्ट डेटा, इंजीनियरिंग और दोबारा प्रशिक्षण की जरूरत पड़ती है। S1 का विचार यह नहीं है कि रोबोट वीडियो को फ्रेम-दर-फ्रेम याद करके उसी गति की नकल करे। इसके बजाय, मॉडल वीडियो से लक्ष्य और क्रियाओं का क्रम समझने की कोशिश करता है और पहले से सीखी गई क्षमताओं को जोड़कर नया कार्य पूरा करता है।
S1 की मुख्य तकनीक को विजुअल इन-कॉन्टेक्स्ट लर्निंग कहा जाता है। आसान शब्दों में, मानव का प्रदर्शन वीडियो मॉडल के लिए नया प्रशिक्षण डेटासेट नहीं, बल्कि उसी समय दिया गया एक कार्य-प्रॉम्प्ट है। S1 वीडियो देखकर यह अनुमान लगाता है कि कौन-सी वस्तु उठानी है, उसे किस दिशा में रखना है, कौन-से कदम पहले या बाद में करने हैं और मौजूदा दृश्य के अनुसार गतिविधियों में कैसे बदलाव करना है। Skild के विवरण के अनुसार, हर नए वीडियो के बाद मॉडल के वेट्स में बदलाव नहीं किया जाता। 1
इस प्रक्रिया में S1 प्री-ट्रेनिंग से मिली बुनियादी क्षमताओं—जैसे वस्तु पकड़ना, ले जाना, रखना और हेरफेर करना—को एक लंबे क्रम में संयोजित करता है। कंपनी के सार्वजनिक उदाहरणों में पोर-ओवर कॉफी बनाना, पौधा गमले में लगाना, किट असेंबल करना और पैनकेक पलटना शामिल हैं। 1
35
सबसे बड़ी चुनौती यहां लॉन्ग-होराइजन नियंत्रण की है। एक छोटी गतिविधि को स्क्रिप्ट करना अपेक्षाकृत आसान हो सकता है, लेकिन 10 मिनट के काम में दर्जनों निर्णय, बदलती वस्तु-स्थितियां और गलती की कई संभावनाएं होती हैं। S1 का लक्ष्य प्रदर्शन करने वाले व्यक्ति की हर गतिविधि की हूबहू नकल करना नहीं, बल्कि पूरे काम के उद्देश्य को बनाए रखते हुए वर्तमान वातावरण के अनुसार कार्रवाई बदलना है।
Skild ने पहले से अनदेखे कार्यों के अपने मूल्यांकन में वीडियो-प्रॉम्प्ट वाले मॉडल की तुलना भाषा-प्रॉम्प्ट वाले विजन-लैंग्वेज-एक्शन मॉडल से की। कंपनी के अनुसार, 100,000 घंटे के बताए गए प्रशिक्षण पैमाने पर वीडियो-प्रॉम्प्ट नीति ने औसतन 66% प्रति-चरण सफलता दर हासिल की, जबकि तुलनीय भाषा-प्रॉम्प्ट नीति 9% पर रही। 32
इससे संकेत मिलता है कि किसी काम का दृश्य प्रदर्शन केवल शब्दों की तुलना में अधिक भौतिक जानकारी दे सकता है। वीडियो में यह दिखाई देता है कि किस वस्तु को पकड़ना है, उसकी दिशा क्या होनी चाहिए, कौन-सा कदम पहले करना है और प्रदर्शन करने वाला व्यक्ति वातावरण में बदलाव पर कैसे प्रतिक्रिया देता है।
फिर भी इस आंकड़े को सावधानी से पढ़ना चाहिए। यह Skild द्वारा बताया गया आंतरिक मूल्यांकन है, स्वतंत्र रूप से दोहराया गया उद्योग-मानक बेंचमार्क नहीं। साथ ही, 66% प्रति-चरण सफलता दर का अर्थ यह नहीं है कि रोबोट हर 10 मिनट का पूरा काम 66% संभावना से शुरू से अंत तक सफलतापूर्वक कर लेगा। लंबे काम में कई चरण होने के कारण कुल कार्य-सफलता इससे काफी अलग हो सकती है।
सार्वजनिक प्रदर्शनों में ये कार्य शामिल हैं:
इन उदाहरणों में केवल एक अलग गतिविधि नहीं, बल्कि वस्तु पहचान, पकड़ने और रखने, सही क्रम बनाए रखने तथा लंबे समय तक नियंत्रण जैसी कई क्षमताएं एक साथ काम करती हैं। Skild का कहना है कि ये कार्य प्री-ट्रेनिंग में पहले से मौजूद नहीं थे। उपलब्ध प्रमाण मुख्य रूप से कंपनी के अपने दावों और उन्हें संक्षेप में पेश करने वाली रिपोर्टों पर आधारित हैं। 1
33
इन प्रदर्शनों से यह समझ आता है कि प्रस्तावित इंटरफेस कैसा है: व्यक्ति एक बार काम दिखाता है और रोबोट उस प्रक्रिया को नए संदर्भ में सामान्यीकृत करने की कोशिश करता है। लेकिन इससे यह सिद्ध नहीं होता कि S1 मनमाने घरेलू काम कर सकता है, हर स्थिति में बिना निगरानी चल सकता है या उत्पादन-स्थल पर मिलने वाले सभी भौतिक बदलावों को संभाल सकता है।
S1 का विज्ञापित लाभ यह है कि प्रदर्शन देखने के बाद अलग पोस्ट-ट्रेनिंग चरण की जरूरत नहीं होती। Skild और लॉन्च कवरेज इसे रियल-टाइम इन-कॉन्टेक्स्ट एक्जीक्यूशन के रूप में बताते हैं। 1
30
हालांकि, उपलब्ध स्रोत वीडियो समाप्त होने और रोबोट की पहली गतिविधि शुरू होने के बीच सटीक समय—मसलन, कितने सेकंड लगते हैं—नहीं बताते। “नो फाइन-ट्यूनिंग” का मतलब यह है कि हर नए कार्य के लिए मॉडल के वेट्स को दोबारा अपडेट नहीं किया जाता। इसका यह अर्थ जरूरी नहीं कि हर वीडियो तुरंत प्रोसेस हो जाए या रोबोट को सेटअप, कैलिब्रेशन और सुरक्षा जांच की जरूरत न हो।
S1, Skild की व्यापक Skild Brain रणनीति का हिस्सा है। कंपनी एक ही सामान्य-उद्देश्य मॉडल को अलग-अलग कार्यों, रोबोट संरचनाओं, सिमुलेशन और मानव वीडियो डेटा पर प्रशिक्षित करना चाहती है, ताकि हर रोबोट और हर काम के लिए अलग नीति न बनानी पड़े। Skild का कहना है कि उसने 100,000 अलग-अलग रोबोट वैरिएंट वाला एक सिमुलेटेड ब्रह्मांड बनाया और ऐसे रोबोट शरीरों पर सामान्यीकरण का परीक्षण किया जिन्हें प्रशिक्षण डेटा से बाहर रखा गया था। 6
इस तरह का क्रॉस-एम्बॉडिमेंट प्रशिक्षण मॉडल को किसी एक मशीन के आकार या मोटर व्यवस्था से आगे सामान्य नियंत्रण सिद्धांत सीखने में मदद कर सकता है। Skild के अनुसार, उसका मॉडल ह्यूमनॉइड, चौपाए रोबोट, टेबलटॉप आर्म और मोबाइल मैनिपुलेटर जैसे अलग-अलग प्रकार के हार्डवेयर के साथ काम करने के लिए बनाया गया है। 3
10
Skild के पास प्रतिस्पर्धियों से 100 से 1,000 गुना अधिक डेटा होने का दावा अक्सर दोहराया जाता है, लेकिन इसे सावधानी से देखना चाहिए। उपलब्ध स्रोत डेटासेट के आकार, गुणवत्ता या उपयोगी रोबोट अनुभव की कंपनियों के बीच कोई मानकीकृत और स्वतंत्र रूप से ऑडिट की गई तुलना नहीं देते। अधिक ठोस निष्कर्ष यह है कि Skild एक ही हार्डवेयर के लिए अलग-अलग प्रदर्शन जुटाने के बजाय सिमुलेशन और कई रोबोट शरीरों पर प्रशिक्षण के जरिए पैमाना बढ़ाने की कोशिश कर रहा है।
ओम्नी-बॉडीड Skild का अपना शब्द है। इसका आशय ऐसे मॉडल से है जो अलग-अलग रोबोट शरीरों में अपनी क्षमताएं स्थानांतरित कर सके। सिद्धांत रूप में, साझा मॉडल किसी एक मशीन की सटीक बनावट से अलग उच्च-स्तरीय कार्य-समझ सीख सकता है और फिर अलग-अलग हाथों, पहियों, पैरों, ग्रिपर और मोटर लेआउट के अनुसार अनुकूलित हो सकता है। Skild का कहना है कि उसके सिमुलेशन परीक्षणों में प्रशिक्षण से बाहर रखे गए रोबोट रूपों को भी जीरो-शॉट तरीके से नियंत्रित किया गया। 6
लेकिन इसका मतलब यह नहीं कि हार्डवेयर अप्रासंगिक हो जाता है। वास्तविक रोबोटों में सेंसर, ग्रिपर, जॉइंट लिमिट, पेलोड, प्रतिक्रिया की देरी, कंट्रोल इंटरफेस और सुरक्षा सीमाएं अलग होती हैं। ओम्नी-बॉडीड मॉडल का दावा यह है कि वह हर रोबोट के लिए शून्य से नई प्रणाली बनाने की जरूरत कम कर सकता है—न कि यह कि तैनाती के लिए किसी एकीकरण या सत्यापन की जरूरत ही नहीं होगी।
सार्वजनिक रिपोर्टों के अनुसार, Skild का सॉफ्टवेयर फैक्ट्रियों, डेटा सेंटर और लॉजिस्टिक्स वातावरण में सैकड़ों रोबोटों पर चल रहा है। बताए गए उदाहरणों में NVIDIA की ह्यूस्टन फैक्ट्री, LaGuardia का परीक्षण और वायरिंग तथा निर्माण कंपनियों के साथ काम शामिल हैं। कंपनी ने ABB Robotics, Universal Robots और NVIDIA के साथ भी साझेदारियों की घोषणा की है। 17
4
इन गतिविधियों से व्यावसायिक रुचि और वास्तविक दुनिया में परीक्षण का संकेत मिलता है, लेकिन इनके आधार पर उत्पादन-स्तर की पूर्णता दर, अपटाइम, लागत बचत या निवेश पर रिटर्न की स्वतंत्र गणना नहीं की जा सकती। किसी नियंत्रित प्रयोगशाला परीक्षण के परिणाम को उत्पादन का आंकड़ा मानना सही नहीं होगा। एक रिपोर्ट में Foxconn के साथ NVIDIA Blackwell GPU सर्वर सिस्टम से जुड़ी असेंबली लाइनों पर नियोजित तैनाती का भी उल्लेख है; यह परीक्षण या तैनाती का प्रमाण है, व्यापक रूप से स्वायत्त फैक्ट्री संचालन का नहीं। 43
Skild को मिली बड़ी फंडिंग ने इसे फिजिकल AI के सबसे अधिक चर्चित प्रयासों में शामिल कर दिया है। Bloomberg के अनुसार, कंपनी ने जनवरी 2026 में SoftBank के नेतृत्व में लगभग 1.4 अरब डॉलर की Series C फंडिंग जुटाई, जिससे उसका मूल्यांकन 14 अरब डॉलर से अधिक हो गया। 13 इससे पहले जुलाई 2024 में घोषित Series A में Skild ने 30 करोड़ डॉलर जुटाए थे और कंपनी का मूल्यांकन 1.5 अरब डॉलर बताया गया था।
9
“रोबोटिक्स का ChatGPT मोमेंट” वाली उपमा उस संभावित बदलाव को दर्शाती है जिसमें किसी कर्मचारी को हर नए काम के लिए रोबोट प्रोग्राम या री-ट्रेन करने के बजाय केवल वांछित व्यवहार दिखाना पड़े। S1 इसी तरह के इंटरफेस की दिशा में एक महत्वपूर्ण कदम दिखता है।
लेकिन यह अभी सामान्य-उद्देश्य रोबोटों के पूरी तरह तैयार हो जाने का प्रमाण नहीं है। अब तक के सबसे मजबूत सार्वजनिक परिणाम कंपनी द्वारा बताए गए हैं, प्रदर्शित कार्यों की संख्या सीमित है और स्वतंत्र रूप से सत्यापित औद्योगिक मेट्रिक्स उपलब्ध नहीं हैं। संतुलित निष्कर्ष यह है कि S1 रोबोटों की कार्य-विशिष्ट ट्रेनिंग कम करने का एक संभावित रास्ता दिखाता है: वीडियो को निर्देश की तरह इस्तेमाल करना, प्री-ट्रेनिंग से मिली क्षमताओं को दोबारा जोड़ना और देखना कि रोबोट उन्हें लंबे, नए कार्यों में कितनी विश्वसनीयता से लागू कर पाता है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Skild AI के अनुसार, S1 एक मानव वीडियो देखने के बाद बिना फाइन ट्यूनिंग के पहले से अनदेखे, कई चरणों वाले 10 मिनट तक के काम कर सकता है। अनदेखे कार्यों के एक आंतरिक परीक्षण में इसकी औसत प्रति चरण सफलता दर 66% रही, जबकि भा...
Skild AI के अनुसार, S1 एक मानव वीडियो देखने के बाद बिना फाइन ट्यूनिंग के पहले से अनदेखे, कई चरणों वाले 10 मिनट तक के काम कर सकता है। अनदेखे कार्यों के एक आंतरिक परीक्षण में इसकी औसत प्रति चरण सफलता दर 66% रही, जबकि भा... S1 वीडियो को इनपुट निर्देश की तरह इस्तेमाल करता है और प्री ट्रेनिंग के दौरान सीखी गई क्षमताओं—जैसे पकड़ना, उठाना, रखना और वस्तुओं को संभालना—को नए क्रम में जोड़कर रोबोट की गतिविधियां तैयार करता है।
Skild का व्यापक Skild Brain अलग अलग रोबोट शरीरों और सिमुलेटेड वैरिएंट पर प्रशिक्षण लेने के लिए बनाया गया है, लेकिन सार्वजनिक जानकारी से अभी उत्पादन स्तर की पूर्णता दर, अपटाइम या निवेश पर रिटर्न स्वतंत्र रूप से सिद्ध न...