I en rapporterad jämförelse mellan MoE modeller med 80 miljarder parametrar totalt och cirka 3 miljarder aktiva per token kräver HySparse2 5,02 gånger färre beräkningar vid förbehandling av en miljon token än Hybrid SWA. Den första dekoderdelen bearbetar den långa inmatningen.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
När en AI-agent läser stora verktygssvar ovanpå en redan lång samtalshistorik växer arbetet med att bearbeta inmatningen innan nästa svar kan genereras. Xiaomis HySparse2 är ett arkitekturförslag för att minska det arbetet och behovet av KV-cache, utan att ge upp möjligheten att hämta information längre bak i historiken. Arbetet kopplas till planerna för MiMo-V3, men är inte ett belägg för att en ny MiMo-V3-modell med öppna vikter har släppts. 3
4
HySparse2 delar, i linje med YOCO-idén, upp modellen i en self-decoder och en efterföljande cross-decoder. Self-decoder bearbetar den långa inmatningen. Med metoden KV Bridging bygger cross-decoderns lager med full uppmärksamhet sina nyckel- och värdedata, K och V, från self-decoderns interna tillstånd. Därför kan förbehandlingen av den befintliga historiken avslutas efter self-decoder, i stället för att också köra hela historiken genom cross-decoder. När modellen sedan genererar nya token deltar cross-decoder fortfarande. 4
6
15
En andra nivå av delning, KV Reuse, finns inne i cross-decoderns hybridblock. Där återanvänder lager med gles uppmärksamhet både KV-cachen och indexen över utvalda token från det föregående lagret med full uppmärksamhet. Urvalet görs token för token, inte i större block. Nyligen tillkomna token tas dessutom alltid med i det glesa urvalet. Det ersätter en separat gren med glidande fönster, så att närliggande token och utvalda äldre token kan använda samma cache. 4
6
15
I en rapporterad jämförelse med samma MoE-konfiguration – 80 miljarder parametrar totalt, varav ungefär 3 miljarder aktiva per token – kräver HySparse2 vid en miljon token 5,02 gånger färre FLOPs för förbehandling än Hybrid SWA. Den rapporterade KV-cachen är 2,69 GB jämfört med 12,09 GB, omkring 4,5 gånger mindre. Xiaomi rapporterar också högre resultat på återhämtningstesterna MRCRv2 och RULER-v2 samt lägre AgentPPL och LongPPL. En redogörelse för utvärderingen uppger att HySparse2 ligger före både HySparse och Hybrid SWA på de utvärderade testerna av informationsåterhämtning i långa kontexter. 6
15
Ett separat test där grundmodellen och uppmärksamhetsbudgeten hålls konstanta jämför urval i block med urval av enskilda token. Vid högst 32 000 token rapporteras förbättringar på 6,57 procentenheter i RULER-v2, 8,14 procentenheter i MRCR-v2 med två ledtrådar och 5,55 procentenheter i GraphWalks. Det stöder nyttan av ett mer finfördelat urval i just den jämförelsen, men säger inte hur stor del av förbättringen som kommer från KV Bridging, KV Reuse eller det påtvingade lokala fönstret. 6
Underlaget räcker däremot inte för att ange en siffersatt HySparse–HySparse2-jämförelse vid en miljon token eller slå fast att samma förbättringar kvarstår i en större modell. Källutdragen anger inte heller vilken numerisk precision som ligger bakom 2,69 GB: siffran bör alltså inte beskrivas som ett verifierat FP8-mått. Färre FLOPs och mindre cache är dessutom inte samma sak som uppmätt svarstid i drift. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
I en rapporterad jämförelse mellan MoE modeller med 80 miljarder parametrar totalt och cirka 3 miljarder aktiva per token kräver HySparse2 5,02 gånger färre beräkningar vid förbehandling av en miljon token än Hybrid SWA.
I en rapporterad jämförelse mellan MoE modeller med 80 miljarder parametrar totalt och cirka 3 miljarder aktiva per token kräver HySparse2 5,02 gånger färre beräkningar vid förbehandling av en miljon token än Hybrid SWA. Den första dekoderdelen bearbetar den långa inmatningen. Den andra återanvänder KV data och urval av token, samtidigt som nyligen tillkomna token alltid finns med i urvalet.