בהשוואה מדווחת בין מודלי MoE בעלי 80 מיליארד פרמטרים בסך הכול וכ־3 מיליארד פרמטרים פעילים לכל טוקן, HySparse2 דורשת פי 5.02 פחות חישובי עיבוד ראשוני במיליון טוקנים לעומת Hybrid SWA. העיבוד הראשוני של הקלט הארוך מסתיים אחרי ה־self decoder; שכבות בהמשך המודל חולקות נתוני KV ותוצאות בחירת טוקנים, בעוד שטוקנים מההקשר הק...
פורסם על ידינערך באמצעות GPT-6 Solהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
סוכן AI שמקבל שוב ושוב פלטים ארוכים מכלים צריך להתמודד עם היסטוריית שיחה שהולכת ותופחת. לפני יצירת תשובה חדשה, המודל מעבד את הקלט הקיים — שלב שנקרא עיבוד ראשוני (prefill). HySparse2, ארכיטקטורה שהציגו חוקרי שיאומי, נועדה להוזיל את השלב הזה בלי לאבד גישה לפרטים רלוונטיים מתחילת ההיסטוריה או מסופה. מדובר במחקר ארכיטקטוני הקשור לתוכניות עבור MiMo-V3, ולא בהכרזה על שחרור חדש של משקלי המודל לציבור. 3
4
HySparse2 מחלקת את המודל, בגישה המזכירה את YOCO, ל־self-decoder שמעבד את הקלט הארוך ול־cross-decoder שמגיע אחריו. באמצעות KV Bridging, שכבות הקשב המלא ב־cross-decoder בונות את נתוני ה־KV שלהן מתוך המצבים הפנימיים שחישב ה־self-decoder. לכן אפשר לסיים את העיבוד הראשוני של ההקשר הקיים כבר אחרי ה־self-decoder, במקום להעביר את כולו גם בשכבות ה־cross-decoder. בעת יצירת טוקנים חדשים, ה־cross-decoder עדיין משתתף בחישוב. 4
6
15
בתוך כל מקטע משולב של ה־cross-decoder, מנגנון KV Reuse מאפשר לשכבות הקשב הדליל להשתמש במטמון ה־KV ובאינדקסים של הטוקנים שנבחרו בשכבת הקשב המלא שקדמה להן. הבחירה נעשית ברמת הטוקן הבודד, ולא ברמת קבוצות טוקנים. נוסף על כך, טוקנים מההקשר הקרוב נכללים בבחירה באופן מחייב: כך הם וטוקנים נבחרים ממקומות רחוקים יותר יכולים להסתמך על אותו מטמון, בלי ענף נפרד של קשב בחלון נע. 4
6
15
בהשוואה מדווחת בין מודלי תערובת מומחים (MoE) בעלי 80 מיליארד פרמטרים בסך הכול וכ־3 מיליארד פעילים לכל טוקן, HySparse2 דורשת במיליון טוקנים פי 5.02 פחות חישובי עיבוד ראשוני לעומת Hybrid SWA. גודל מטמון ה־KV המדווח הוא 2.69 לעומת 12.09 ג׳יגה־בייט — קטן בערך פי 4.5. שיאומי מדווחת גם על ציונים גבוהים יותר במבחני אחזור המידע MRCRv2 ו־RULER-v2 ועל מדדי AgentPPL ו־LongPPL נמוכים יותר; לפי דיווח על ההערכה, HySparse2 מקדימה במבחני אחזור ההקשר הארוך שנבדקו הן את HySparse והן את Hybrid SWA. 6
15
בניסוי שבודד את רמת הבחירה של המידע, החוקרים שמרו על אותו מבנה בסיסי ועל אותו תקציב קשב, והחליפו בחירת קבוצות בבחירת טוקנים בודדים. במבחנים של עד 32 אלף טוקנים, הדיווח מציין שיפור של 6.57 נקודות אחוז ב־RULER-v2, 8.14 נקודות במבחן שני פריטי המידע של MRCR-v2 ו־5.55 נקודות ב־GraphWalks. זו ראיה לתועלת של בחירה מדויקת יותר בתנאי הניסוי הללו, אך לא מדידה נפרדת של תרומת KV Bridging, שיתוף המטמון או החלון המקומי הכפוי. 6
המידע הזמין אינו מבסס השוואה מספרית בין HySparse ל־HySparse2 דווקא במיליון טוקנים, או קביעה שהשיפורים נשמרים גם במודל גדול יותר. הקטעים המצוטטים גם אינם מציינים באיזו רמת דיוק נשמר המטמון שמדידתו 2.69 ג׳יגה־בייט, ולכן אין להציג את הנתון כמדידת FP8 מאומתת. לבסוף, מספר פעולות החישוב וגודל המטמון אינם מדידה של זמן התגובה במערכת פעילה. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
בהשוואה מדווחת בין מודלי MoE בעלי 80 מיליארד פרמטרים בסך הכול וכ־3 מיליארד פרמטרים פעילים לכל טוקן, HySparse2 דורשת פי 5.02 פחות חישובי עיבוד ראשוני במיליון טוקנים לעומת Hybrid SWA.
בהשוואה מדווחת בין מודלי MoE בעלי 80 מיליארד פרמטרים בסך הכול וכ־3 מיליארד פרמטרים פעילים לכל טוקן, HySparse2 דורשת פי 5.02 פחות חישובי עיבוד ראשוני במיליון טוקנים לעומת Hybrid SWA. העיבוד הראשוני של הקלט הארוך מסתיים אחרי ה־self decoder; שכבות בהמשך המודל חולקות נתוני KV ותוצאות בחירת טוקנים, בעוד שטוקנים מההקשר הקרוב נשארים זמינים.