तुलनीय 80 अरब कुल पैरामीटर वाले MoE मॉडल की रिपोर्ट में, 10 लाख टोकन पर HySparse2 के प्रीफ़िल FLOPs, Hybrid SWA से 5.02 गुना कम थे; KV कैश 12.09 GB के बजाय 2.69 GB बताया गया। [6][15] सेल्फ डिकोडर लंबा इनपुट प्रोसेस करता है। बाद की परतें KV कैश और चुने गए टोकन के सूचकांक साझा करती हैं, जबकि हाल के टोकन को चयन में अनि...
प्रकाशितकर्ताGPT-6 Sol से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
किसी AI एजेंट की बातचीत में टूल से आए लंबे जवाब जुड़ते जाएँ, तो अगला जवाब देने से पहले मॉडल को बढ़ते हुए इतिहास को फिर प्रोसेस करना पड़ सकता है। इस शुरुआती प्रोसेसिंग को प्रीफ़िल कहते हैं। Xiaomi का प्रस्तावित HySparse2 डिज़ाइन इसी खर्च को घटाने के लिए है—बिना इस उद्देश्य को छोड़े कि मॉडल हाल की और बहुत पहले की जानकारी खोज सके। यह MiMo-V3 के लिए बताई गई आर्किटेक्चर दिशा से जुड़ा शोध है, MiMo-V3 के नए ओपन-वेट मॉडल की रिलीज़ नहीं। 3
4
YOCO शैली में HySparse2 मॉडल को दो हिस्सों में बाँटता है: सेल्फ-डिकोडर और क्रॉस-डिकोडर। पहला हिस्सा लंबा इनपुट प्रोसेस करता है। फिर KV Bridging के तहत क्रॉस-डिकोडर की फुल-अटेंशन परतें अपने keys और values (KV) सेल्फ-डिकोडर की आंतरिक अवस्थाओं से बनाती हैं। इसलिए पहले से मौजूद लंबे इनपुट का प्रीफ़िल सेल्फ-डिकोडर के बाद पूरा हो सकता है; उसी इनपुट को क्रॉस-डिकोडर से दोबारा गुज़ारने की ज़रूरत नहीं रहती। नए टोकन बनाते समय क्रॉस-डिकोडर फिर भी काम करता है। 4
6
15
दूसरा स्तर KV Reuse है। क्रॉस-डिकोडर के प्रत्येक हाइब्रिड ब्लॉक में स्पार्स-अटेंशन परतें, उससे पहले की फुल-अटेंशन परत का KV कैश और चुने गए टोकन के सूचकांक इस्तेमाल करती हैं। चयन पूरे ब्लॉक के बजाय अलग-अलग टोकन के स्तर पर होता है। साथ ही, हाल के टोकन को चयन में अनिवार्य रूप से शामिल किया जाता है। इससे हाल की जानकारी के लिए अलग स्लाइडिंग-विंडो अटेंशन शाखा रखने के बजाय, हाल के और चुने गए पुराने टोकन एक ही कैश का उपयोग कर सकते हैं। 4
6
15
रिपोर्ट किए गए तुलनीय mixture-of-experts (MoE) कॉन्फ़िगरेशन में कुल 80 अरब पैरामीटर थे, जिनमें प्रति टोकन लगभग 3 अरब सक्रिय होते हैं। 10 लाख टोकन पर HySparse2 के प्रीफ़िल FLOPs—यानी गणनात्मक कार्य का माप—Hybrid SWA के मुकाबले 5.02 गुना कम बताए गए। KV कैश 12.09 GB के बजाय 2.69 GB, यानी लगभग 4.5 गुना छोटा था। Xiaomi ने MRCRv2 और RULER-v2 पर बेहतर पुनर्प्राप्ति स्कोर तथा AgentPPL और LongPPL पर कम मान भी बताए हैं। मूल्यांकन की एक रिपोर्ट के अनुसार, जाँचे गए लंबे संदर्भ के पुनर्प्राप्ति परीक्षणों में HySparse2, HySparse और Hybrid SWA दोनों से आगे था। 6
15
एक अलग परीक्षण में मूल मॉडल संरचना और अटेंशन का बजट समान रखकर सिर्फ़ ब्लॉक-स्तर के चयन को टोकन-स्तर के चयन से बदला गया। 32 हज़ार टोकन या उससे छोटे परीक्षणों में टोकन-स्तर के चयन से RULER-v2 में 6.57 प्रतिशत अंक, दो-सूत्र वाले MRCR-v2 में 8.14 अंक और GraphWalks में 5.55 अंक की बढ़त दर्ज हुई। यह उस परीक्षण में अधिक बारीक चयन के फ़ायदे का प्रमाण है; इससे KV Bridging, KV Reuse या हाल के टोकन को अनिवार्य रूप से शामिल करने का अलग-अलग योगदान तय नहीं होता। 6
सीमा समझना ज़रूरी है: उपलब्ध साक्ष्य 10 लाख टोकन पर HySparse के मुकाबले HySparse2 का संख्यात्मक नतीजा, हर तकनीक का अलग लाभ या बड़े मॉडल पर यही बढ़त बनी रहने की पुष्टि नहीं करते। 2.69 GB वाले आँकड़े में कैश की सटीक संख्यात्मक परिशुद्धता भी निर्दिष्ट नहीं है, इसलिए इसे सत्यापित FP8 KV-कैश माप कहना ठीक नहीं होगा। प्रीफ़िल FLOPs और कैश का आकार, वास्तविक इस्तेमाल में मापी गई जवाब देने की देरी के बराबर भी नहीं हैं। 6
15
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
तुलनीय 80 अरब कुल पैरामीटर वाले MoE मॉडल की रिपोर्ट में, 10 लाख टोकन पर HySparse2 के प्रीफ़िल FLOPs, Hybrid SWA से 5.02 गुना कम थे; KV कैश 12.09 GB के बजाय 2.69 GB बताया गया। [6][15]
तुलनीय 80 अरब कुल पैरामीटर वाले MoE मॉडल की रिपोर्ट में, 10 लाख टोकन पर HySparse2 के प्रीफ़िल FLOPs, Hybrid SWA से 5.02 गुना कम थे; KV कैश 12.09 GB के बजाय 2.69 GB बताया गया। [6][15] सेल्फ डिकोडर लंबा इनपुट प्रोसेस करता है। बाद की परतें KV कैश और चुने गए टोकन के सूचकांक साझा करती हैं, जबकि हाल के टोकन को चयन में अनिवार्य रूप से रखा जाता है। [4][6][15]