في مقارنة معلنة لنموذج خبراء يضم 80 مليار معلمة إجمالًا ويُفعّل نحو 3 مليارات لكل رمز، احتاجت HySparse2 إلى عمليات حسابية أقل بمقدار 5.02 مرات في المعالجة الأولية عند مليون رمز مقارنةً بـHybrid SWA؛ وبلغ حجم ذاكرة KV... تعالج المرحلة الأولى المدخل الطويل، بينما تستمد المرحلة الثانية بيانات KV منها وتعيد طبقاتها استخ...
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
حين يعيد مساعد ذكي استخدام سجل محادثة طويل ثم يضيف إليه مخرجات أداة جديدة، تتكرر كلفة المعالجة الأولية (prefill) للمدخلات المتراكمة. تقترح شاومي بنية HySparse2 لتقليل هذه الكلفة وحجم ذاكرة KV، التي تحتفظ ببيانات «المفاتيح والقيم» اللازمة للانتباه إلى الرموز السابقة، من دون الاكتفاء بالنص القريب وإهمال المعلومات البعيدة. المنشور هنا بحث في البنية مرتبط بخطط MiMo-V3، وليس إعلانًا عن إصدار جديد مفتوح الأوزان من النموذج. 3
4
تقسم HySparse2 النموذج، وفق نهج مستوحى من YOCO، إلى مفكّك ترميز ذاتي يعالج المدخل الطويل، يليه مفكّك ترميز تقاطعي. وبآلية تُسمّى ربط KV (KV Bridging)، تبني طبقات الانتباه الكامل في المرحلة الثانية مفاتيحها وقيمها من الحالات الداخلية التي أنتجتها المرحلة الأولى. لذلك يمكن أن تنتهي المعالجة الأولية للسياق الموجود عند اكتمال المفكّك الذاتي، بدل تمرير السياق الطويل كله مرة أخرى عبر المفكّك التقاطعي. وتظل المرحلة الثانية مشاركة عند توليد رموز جديدة. 4
6
15
داخل كل مجموعة هجينة في المفكّك التقاطعي، تتيح آلية إعادة استخدام KV (KV Reuse) لطبقات الانتباه المتناثر مشاركة ذاكرة KV ومؤشرات اختيار الرموز الخاصة بطبقة الانتباه الكامل السابقة لها. ويجري الاختيار على مستوى الرمز المفرد لا الكتل؛ كما تُدرج الرموز الحديثة إجباريًا ضمن الاختيار، بدل تخصيص فرع مستقل لانتباه النافذة المنزلقة. وهكذا يمكن للرموز القريبة والبعيدة المختارة استخدام الذاكرة نفسها. 4
6
15
في إعداد مقارن معلن لنموذج «خليط خبراء» يضم 80 مليار معلمة إجمالًا ويُفعّل نحو 3 مليارات معلمة لكل رمز، انخفض عدد العمليات الحسابية للمعالجة الأولية عند مليون رمز بمقدار 5.02 مرات مقارنةً ببنية Hybrid SWA. وبلغ حجم ذاكرة KV المعلن 2.69 غيغابايت مقابل 12.09 غيغابايت، أي أصغر بنحو 4.5 مرات. وأعلنت شاومي نتائج أعلى في اختباري استرجاع المعلومات MRCRv2 وRULER-v2، ونتائج أقل في مقياسي AgentPPL وLongPPL؛ ويذكر تقرير عن التقييم أن HySparse2 تقدّمت على كلٍّ من HySparse وHybrid SWA في اختبارات الاسترجاع الطويل التي شملها التقييم. 6
15
وفي تجربة فصل أثر أحد التغييرات، أبقى الباحثون البنية الأساسية ومقدار الانتباه ثابتين، وغيّروا الاختيار من مستوى الكتل إلى مستوى الرموز. في اختبارات لا يتجاوز طولها 32 ألف رمز، سُجّلت زيادات قدرها 6.57 نقاط مئوية في RULER-v2، و8.14 نقاط في اختبار MRCR-v2 ذي الدليلين، و5.55 نقاط في GraphWalks. تدعم هذه النتيجة فائدة الاختيار الأدق في ذلك الإعداد، لكنها لا تحدد نصيب ربط KV أو إعادة استخدامه أو إدراج الرموز الحديثة من التحسن. 6
حدود ما يمكن استنتاجه: لا تكفي المعلومات المتاحة لتحديد فرق عددي بين HySparse وHySparse2 عند مليون رمز، أو إثبات استمرار المكاسب نفسها في نموذج أكبر. كما لا تحدد المقتطفات دقة التخزين المستخدمة في رقم 2.69 غيغابايت؛ لذا لا يصح وصفه بأنه قياس موثّق لذاكرة KV بتنسيق FP8. وعدد العمليات الحسابية وحجم الذاكرة ليسا قياسًا مباشرًا لزمن الاستجابة في بيئة تشغيل فعلية. 6
15
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
في مقارنة معلنة لنموذج خبراء يضم 80 مليار معلمة إجمالًا ويُفعّل نحو 3 مليارات لكل رمز، احتاجت HySparse2 إلى عمليات حسابية أقل بمقدار 5.02 مرات في المعالجة الأولية عند مليون رمز مقارنةً بـHybrid SWA؛ وبلغ حجم ذاكرة KV...
في مقارنة معلنة لنموذج خبراء يضم 80 مليار معلمة إجمالًا ويُفعّل نحو 3 مليارات لكل رمز، احتاجت HySparse2 إلى عمليات حسابية أقل بمقدار 5.02 مرات في المعالجة الأولية عند مليون رمز مقارنةً بـHybrid SWA؛ وبلغ حجم ذاكرة KV... تعالج المرحلة الأولى المدخل الطويل، بينما تستمد المرحلة الثانية بيانات KV منها وتعيد طبقاتها استخدام الذاكرة ونتائج اختيار الرموز، مع إدراج الرموز الحديثة ضمن الاختيار الإجباري.