Zeva तैनाती के दौरान Cosmos3 आधारित नीति के वेट नहीं बदलता; वह रोबोट की कार्रवाई और उससे हुए बदलाव की कारणात्मक मेमरी का उपयोग करता है। इसका Causal Transition Encoder कार्रवाई के प्रभाव को एन्कोड करता है, जबकि BIT तत्काल अनुभव और PIM कई कोशिशों के अनुभव को अलग अलग संभालते हैं। रिपोर्ट किए गए नतीजों में RoboCasa365 A...
प्रकाशितकर्ताGPT-5.6 Terra से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is Zeva, the frozen weight in context causal memory method introduced by Tsinghua AIR and Domain Transform for Cosmos3 backed embodied. Article summary: Zeva is a deployment time adaptation framework for embodied manipulation: it keeps the Cosmos3 based policy weights frozen, but lets the robot improve through an online memory of what its actions physically caused.. Topic tags: general web, llm, prompt engineering, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Zeva को रोबोटिक मैनिपुलेशन के लिए तैनाती-समय अनुकूलन (deployment-time adaptation) फ्रेमवर्क के रूप में पेश किया गया है। इसकी खासियत यह है कि Cosmos3-आधारित नीति मॉडल के वेट तैनाती के दौरान फ्रीज़ रहते हैं, फिर भी रोबोट अपनी कार्रवाई से हुए भौतिक परिणामों की ऑनलाइन मेमरी से अगली कोशिश में व्यवहार बदल सकता है। यानी परिचित collect–label–fine-tune चक्र के बजाय, यह अनुमान लगाने के समय निकाले गए कारणात्मक संदर्भ का सहारा लेता है। 1
5
Zeva का विचार केवल यह याद रखना नहीं है कि रोबोट ने क्या देखा या क्या किया था। इसका लक्ष्य यह पकड़ना है कि किस कार्रवाई से वस्तु या वातावरण में कौन-सा बदलाव हुआ—और उस जानकारी को अगली कार्रवाई में काम में लेना है। इसके तीन मुख्य हिस्से हैं।
हर कार्रवाई के बाद Causal Transition Encoder (CTE) दृश्य स्थिति, की गई कार्रवाई और दिखाई दिए बदलाव को एक छिपे हुए कारणात्मक-इंटरैक्शन प्रतिनिधित्व में बदलता है। यह कार्य की प्रगति या चरण बताने वाले टोकन को उस इंटरैक्शन संकेत से अलग करने की कोशिश करता है जो कार्रवाई से पैदा हुई गतिशीलता दिखाता है। उद्देश्य पृष्ठभूमि, रोशनी या अन्य संयोगवश दृश्य संकेतों के बजाय वास्तविक “कार्रवाई → प्रभाव” संबंध को पकड़ना है। 1
4
मसलन, रोबोट सिर्फ यह याद न रखे कि ग्रिपर एक दिशा में गया था, बल्कि यह समझे कि उसी पकड़ और उठाने की क्रिया से टेस्ट ट्यूब उठी या फिसल गई।
Zeva मेमरी को दो परतों में बांटता है:
सरल शब्दों में, BIT को कामकाजी या तात्कालिक मेमरी और PIM को बार-बार की कोशिशों से बनी अपेक्षाकृत टिकाऊ अनुभव-मे़मरी समझा जा सकता है। दोनों को अलग रखने का मकसद यह है कि एक बार की भ्रामक विफलता लंबे समय की मेमरी को आसानी से खराब न कर दे।
निर्णय लेते समय Zeva मेमरी से मौजूदा कार्य-चरण से मेल खाने वाले कारणात्मक अनुभव खोजता है। फिर उन्हें एक causal prompt के रूप में फ्रीज़ फाउंडेशन पॉलिसी के action-generation रास्ते में डालता है। 1
5
इसलिए नीति अपने पैरामीटर या ग्रेडिएंट बदले बिना संदर्भ के आधार पर नई कार्रवाई चुन सकती है। व्यवहारिक रूप से इसका अर्थ है कि नई वस्तु-स्थिति या अनजानी भौतिक प्रतिक्रिया मिलने पर नए लेबल, दोबारा ट्रेनिंग, अलग मॉडल संस्करण या डाउनटाइम की जरूरत कम हो सकती है। हालांकि यह सीखना है, पर यह स्थायी weight learning नहीं बल्कि मेमरी-आधारित in-context adaptation है। 1
6
पेपर और प्रोजेक्ट सामग्री में निम्न परिणाम बताए गए हैं:
एक बार मनुष्य द्वारा भौतिक रूप से निर्देशित rollout को उसी इंटरैक्शन-मे़मरी प्रणाली में warm start की तरह दर्ज किया जा सकता है। मॉडल के वेट तब भी फ्रीज़ रहते हैं; बाद में नीति उस कार्रवाई-परिणाम संदर्भ से क्रम को दोहराने का प्रयास करती है। 6
उपलब्ध सामग्री one-shot human demonstration के इस गुणात्मक warm-up तंत्र की पुष्टि करती है। लेकिन बीकर रखने या पानी डालने के लिए इसके पहले और बाद के सत्यापित, विशिष्ट संख्यात्मक लाभ उपलब्ध नहीं हैं। इसलिए यही कहना उचित है कि इससे उन कार्यों को warm-start या बेहतर करने की रिपोर्ट है, न कि किसी निश्चित प्रतिशत सुधार का दावा। 6
एक संभावित व्याख्या सुधार की अधिक गुंजाइश है। कमजोर प्रीट्रेन्ड पॉलिसी बदली हुई भौतिक व्यवस्था में ज्यादा व्यवस्थित गलतियां कर सकती है। ऐसी स्थिति में कार्रवाई के प्रभाव की स्पष्ट corrective memory से अधिक सुधार संभव है। मजबूत आधार मॉडल पहले ही अधिक बार सफल होता है, इसलिए ठीक की जा सकने वाली त्रुटियां कम बचती हैं।
फिर भी इसे सार्वभौमिक नियम नहीं मानना चाहिए। उपलब्ध प्राथमिक साक्ष्य तुलनात्मक परिणाम और तैनाती के दौरान सुधार दिखाता है; यह सिद्ध नहीं करता कि हर कार्य या हर मॉडल में कमजोर पॉलिसी को ही हमेशा ज्यादा लाभ मिलेगा। 1
ChemLab-Evo में ऐसी भौतिक विविधताएं मिलती हैं जिनके परिणाम महत्वपूर्ण और अपेक्षाकृत स्पष्ट होते हैं: छोटी वस्तुओं की पकड़, कंटेनर का सही स्थान, पानी डालते समय झुकाव, और कई चरणों वाली प्रक्रियाएं। बेंचमार्क में ARX मैनिपुलेटर के सात कार्य हैं—टेस्ट ट्यूब उठाने, बीकर रखने और तरल डालने जैसी बुनियादी क्रियाओं से लेकर टाइट्रेशन, नमक का घोल बनाना, बैलेंस से तौलना और एक्सट्रैक्शन जैसी लंबी प्रक्रियाओं तक। 1
इससे यह जांचने का अवसर मिलता है कि रोबोट केवल दृश्य नकल नहीं कर रहा, बल्कि कार्रवाई और प्रभाव के याद रखे संबंधों को नई कोशिशों और मिलते-जुलते कौशलों में ले जा सकता है या नहीं।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Zeva तैनाती के दौरान Cosmos3 आधारित नीति के वेट नहीं बदलता; वह रोबोट की कार्रवाई और उससे हुए बदलाव की कारणात्मक मेमरी का उपयोग करता है।
Zeva तैनाती के दौरान Cosmos3 आधारित नीति के वेट नहीं बदलता; वह रोबोट की कार्रवाई और उससे हुए बदलाव की कारणात्मक मेमरी का उपयोग करता है। इसका Causal Transition Encoder कार्रवाई के प्रभाव को एन्कोड करता है, जबकि BIT तत्काल अनुभव और PIM कई कोशिशों के अनुभव को अलग अलग संभालते हैं।
रिपोर्ट किए गए नतीजों में RoboCasa365 Atomic5 पर 76.8% औसत सफलता और वास्तविक ChemLab Evo के तीन बुनियादी कार्यों में कोशिशों के साथ सुधार शामिल हैं।