HOST एक मानव वीडियो से औसतन 29 सेकंड में नया कौशल हासिल करने का दावा करता है और अनुमान के दौरान मॉडल के पैरामीटर अपडेट नहीं करता। [1] HOST ने 50 नए मैनिपुलेशन कार्यों पर 62% औसत सफलता दर दर्ज की; शोधकर्ताओं के अनुसार यह सबसे मजबूत ज़ीरो शॉट इमिटेशन बेसलाइन से 45% बेहतर था। [1] GEN 1.5 तीन से 12 सेकंड के प्रदर्शन को...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
रोबोटिक्स में लंबे समय से नया काम सिखाने का मतलब था—विशेष डेटा इकट्ठा करना, सैकड़ों या हज़ारों रोबोट-डेमो देना और फिर मॉडल को दोबारा प्रशिक्षित करना। HOST और Generalist AI का GEN-1.5 इस प्रक्रिया का एक अलग रास्ता दिखाते हैं: पहले से प्रशिक्षित मॉडल को एक छोटी मानव-प्रदर्शन वीडियो दीजिए, और वह उसी क्षण नए काम के लिए कार्रवाई तैयार करने की कोशिश करता है।
यह ‘बिना किसी सीखने’ की प्रक्रिया नहीं है। दोनों प्रणालियों ने पहले बड़े पैमाने पर प्रशिक्षण से भौतिक दुनिया के बारे में ज्ञान हासिल किया है। फर्क यह है कि हर नए काम के लिए मॉडल के पैरामीटर दोबारा नहीं बदले जाते। वीडियो अनुमान के समय एक संदर्भ या निर्देश की तरह काम करती है।
HOST मानव के हाथ की गति को ज्यों-का-त्यों रोबोट के शरीर पर चिपकाने की कोशिश नहीं करता। मानव और रोबोट की शारीरिक बनावट अलग होती है, इसलिए सीधे हाथ की चाल कॉपी करना अक्सर काम नहीं करता।
इसके बजाय सिस्टम वीडियो में काम की प्रगति को समझने की कोशिश करता है—मसलन, वस्तु उठाने, सही जगह ले जाने और छोड़ने के चरण। फिर वह रोबोट के वर्तमान दृश्य और शरीर की स्थिति के आधार पर वीडियो के अगले प्रासंगिक चरण से अपने निष्पादन को जोड़ता है। इस तरह वीडियो एक निष्क्रिय रिकॉर्डिंग नहीं, बल्कि रोबोट के लिए चरण-दर-चरण संदर्भ बन जाती है।
HOST की दो-चरणीय प्रशिक्षण व्यवस्था भी महत्वपूर्ण है। पहले मॉडल को बड़े रोबोट-डेटासेट से सामान्य रोबोटिक व्यवहार सिखाया जाता है। बाद में मानव वीडियो और रोबोट ट्रेजेक्टरी के जोड़े दिखाकर उसे अलग-अलग शरीरों और दृष्टिकोणों के बीच संबंध समझने में सक्षम बनाया जाता है। नया कार्य दिखाने के समय मॉडल के वज़न स्थिर रहते हैं; इसलिए नए कौशल को पुराने कौशल के ऊपर लिख देने या ‘सीखकर भूलने’ का जोखिम कम हो सकता है।
50 कार्यों और प्रत्येक पर 20 प्रयासों का परीक्षण इस बात का ठोस संकेत देता है कि HOST नए ऑब्जेक्ट, औज़ार और गतिविधि-प्रकारों के बीच कुछ हद तक सामान्यीकरण कर सकता है। फिर भी 62% औसत सफलता का अर्थ है कि लगभग चार में से एक से अधिक प्रयास विफल हो सकते हैं। यह अभी हर परिस्थिति में भरोसेमंद तैनाती के स्तर का प्रदर्शन नहीं है।
शोधकर्ताओं ने रोशनी, वस्तु, दृश्य और मानव हस्तक्षेप बदलकर मजबूती की जाँच भी की। रिपोर्ट के अनुसार, इन बदलावों पर आधारभूत 62% प्रदर्शन में क्रमशः 1%, 4%, 6% और 9% की कमी आई।
GEN-1.5 इसी विचार को एक बड़े एम्बॉडीड मॉडल के स्तर पर प्रस्तुत करता है। इसमें कुछ सेकंड की मानव-प्रदर्शन वीडियो को मॉडल की संदर्भ-विंडो में रखा जाता है। मॉडल उस डेमो को नए टास्क का ‘फिजिकल प्रॉम्प्ट’ मानकर तुरंत काम करने की कोशिश करता है—बिना नए टास्क के लिए ग्रेडिएंट अपडेट या फाइन-ट्यूनिंग के।
Generalist AI के सार्वजनिक उदाहरणों में जार खोलना, पाउच की ज़िप खोलना, किसी ब्लॉक को कटोरे में झाड़ना और बोल्ट डालना जैसे छोटे, अपेक्षाकृत सरल कार्य शामिल हैं। कंपनी मानव-से-रोबोट इमिटेशन, दो प्रॉम्प्ट किए गए व्यवहारों को जोड़ने और सिमुलेशन में दिए गए प्रदर्शन से वास्तविक रोबोट पर काम करने जैसी क्षमताओं का भी दावा करती है।
हालाँकि, GEN-1.5 में ‘वन-शॉट’ और ‘फ्यू-शॉट’ को अलग समझना ज़रूरी है। आसान कार्यों में एक वीडियो पर्याप्त हो सकती है, लेकिन कठिन कार्यों के लिए कंपनी कुछ मिनट के डेटा पर 1–10 ग्रेडिएंट चरणों वाला अनुकूलन विकल्प भी बताती है। इसलिए यह हर स्थिति में पूरी तरह ‘नो-ट्रेनिंग’ प्रणाली नहीं है।
इस दिशा का सबसे बड़ा असर रोबोट सिखाने के इंटरफ़ेस पर पड़ सकता है। इंसान किसी नए काम को समझाने के लिए अक्सर उसे करके दिखाता है; उसे हर जोड़ की गति, इनाम-फ़ंक्शन या प्रशिक्षण प्रक्रिया नहीं समझानी पड़ती। HOST और GEN-1.5 रोबोटिक्स को इसी सहज मॉडल के करीब ले जाने की कोशिश करते हैं: प्रोग्राम करने के बजाय दिखाकर सिखाइए।
व्यावहारिक लाभ यह है कि महँगी, बड़े पैमाने की प्रीट्रेनिंग एक साझा आधार के रूप में पहले ही की जा चुकी होती है। नया उपयोगकर्ता हर काम के लिए फिर से पूरा प्रशिक्षण चक्र चलाने के बजाय एक छोटा प्रदर्शन दे सकता है। HOST का 29 सेकंड का औसत अधिग्रहण समय और 507 गुना तेज़ी का दावा इस लाभ को संख्यात्मक रूप में सामने रखता है।
लेकिन इसे सही संदर्भ में देखना चाहिए: रोबोट ने पहले से कोई डेटा नहीं देखा, ऐसा नहीं है। असल में बड़े पैमाने पर किया गया पूर्व-प्रशिक्षण महँगी लागत को पहले ही वहन कर लेता है और नए टास्क पर उसका लाभ अनुमान के समय मिलता है।
HOST का परीक्षण नियंत्रित प्रयोगशाला में हुआ है। 50 चुने हुए नए कार्यों पर 62% औसत सफलता उपयोगी प्रमाण है, लेकिन इससे घरेलू वातावरण, औद्योगिक विविधता, लंबे और बहु-चरणीय कार्यों या सुरक्षा-संवेदनशील परिस्थितियों में विश्वसनीयता सिद्ध नहीं होती। स्वतंत्र समूहों द्वारा दोहराया गया मूल्यांकन भी अभी आवश्यक है।
GEN-1.5 के प्रमाणों का स्वतंत्र आकलन कठिन है। मॉडल, प्रशिक्षण अवधि, सिमुलेशन डेटा से जुड़े दावे, डेमो की अवधि और अनुकूलन-संबंधी आँकड़े मुख्यतः Generalist AI या उसके सार्वजनिक घोषणापत्रों से आते हैं।
दोनों के लिए तुलना पूरी तरह समान नहीं है। HOST ने स्पष्ट कार्य-सूची, ट्रायल संख्या और बेसलाइन तुलना के साथ अकादमिक मूल्यांकन दिया है। GEN-1.5 के लिए सार्वजनिक रूप से उपलब्ध जानकारी में समान मानकीकृत टास्क-सूट, परीक्षण प्रोटोकॉल, समेकित वन-शॉट सफलता दर, मॉडल या डेटा रिलीज़ और तृतीय-पक्ष पुनरुत्पादन का अभाव है। इसलिए इसके वीडियो-डेमो संभावित क्षमता का संकेत हैं, अभी अंतिम प्रदर्शन-सीमा का प्रमाण नहीं।
कुल मिलाकर, HOST यह दिखाता है कि एक परिभाषित मैनिपुलेशन टेस्ट-सूट में रोबोट मानव की एक वीडियो से, मॉडल पैरामीटर बदले बिना, नया कौशल हासिल कर सकता है। GEN-1.5 संकेत देता है कि व्यापक भौतिक अनुभव पर प्रशिक्षित सामान्यवादी मॉडल में ऐसी क्षमता संदर्भ से उभर सकती है। दिशा महत्वपूर्ण और वास्तविक है, लेकिन निष्कर्ष अभी संयमित होना चाहिए: रोबोट का अवलोकन से सीखना उभर रहा है—यह अभी अनियंत्रित वातावरण में कठोर सत्यापन, सुरक्षा इंजीनियरिंग और ज़रूरत पड़ने पर अनुकूलन का पूर्ण विकल्प सिद्ध नहीं हुआ है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
HOST एक मानव वीडियो से औसतन 29 सेकंड में नया कौशल हासिल करने का दावा करता है और अनुमान के दौरान मॉडल के पैरामीटर अपडेट नहीं करता। [1]
HOST एक मानव वीडियो से औसतन 29 सेकंड में नया कौशल हासिल करने का दावा करता है और अनुमान के दौरान मॉडल के पैरामीटर अपडेट नहीं करता। [1] HOST ने 50 नए मैनिपुलेशन कार्यों पर 62% औसत सफलता दर दर्ज की; शोधकर्ताओं के अनुसार यह सबसे मजबूत ज़ीरो शॉट इमिटेशन बेसलाइन से 45% बेहतर था। [1]
GEN 1.5 तीन से 12 सेकंड के प्रदर्शन को ‘फिजिकल प्रॉम्प्ट’ की तरह इस्तेमाल करता है और कंपनी के अनुसार बिना ग्रेडिएंट अपडेट के तुरंत कार्य शुरू कर सकता है। [26]