Ved én million tokener rapporteres HySparse2 å bruke 1/5,02 av beregningsoperasjonene i forhåndsbehandlingen og 2,69 GB KV hurtigbuffer mot 12,09 GB for Hybrid SWA, i en sammenligning av modeller med samme konfigurasjon. En første dekoderdel behandler det lange innholdet.
Publisert avRedigert med GPT-6 SolBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
En AI-agent kan svare kort, men få store mengder tekst tilbake fra verktøy den bruker. Når dette legges til en allerede lang samtalehistorikk, blir det stadig mer krevende å behandle hele konteksten før neste svar. Xiaomis HySparse2 er et forslag til modellarkitektur som skal redusere dette arbeidet uten å gi opp muligheten til å finne både nylig og eldre informasjon. Arbeidet er knyttet til planer for MiMo-V3; det er ikke i seg selv en ny utgivelse av åpne MiMo-V3-modellvekter. 3
4
HySparse2 deler modellen i to dekoderdeler etter et YOCO-inspirert prinsipp. Self-decoder behandler det lange innholdet først. Med KV Bridging lager lag med full oppmerksomhet i den påfølgende cross-decoder sine nøkler og verdier – K og V – fra de interne tilstandene i self-decoder. Dermed kan forhåndsbehandlingen, ofte kalt prefill, av den eksisterende lange konteksten avsluttes etter første del i stedet for å kjøre hele konteksten gjennom begge. Cross-decoder er fortsatt med når modellen genererer nye tokener. 4
6
15
Inne i cross-decoder bruker KV Reuse samme KV-hurtigbuffer og de samme indeksene for utvalgte tokener i sparsomme lag som i det foregående laget med full oppmerksomhet. Utvalget skjer på tokennivå, ikke i større blokker. Nylige tokener tas dessuten alltid med. Slik kan modellen bruke både nærliggende kontekst og utvalgte tokener lenger tilbake, uten en egen gren for et glidende oppmerksomhetsvindu. Målet er mindre gjentatt lagring og utvalgsarbeid. 4
6
15
I en rapportert sammenligning av MoE-modeller med 80 milliarder parametere totalt og rundt 3 milliarder aktive per token krever HySparse2 ved én million tokener 1/5,02 av beregningsoperasjonene i prefill sammenlignet med Hybrid SWA. KV-hurtigbufferen oppgis til 2,69 GB mot 12,09 GB, altså omtrent 4,5 ganger mindre. Xiaomi rapporterer også bedre resultater på gjenfinningstestene MRCRv2 og RULER-v2 og lavere verdier på AgentPPL og LongPPL. I den omtalte evalueringen ligger HySparse2 foran både HySparse og Hybrid SWA på de undersøkte testene av gjenfinning i lang kontekst. 6
15
En separat test holder modellens grunnstruktur og oppmerksomhetsbudsjett konstant, men bytter utvalg på blokknivå med utvalg på tokennivå. Ved 32 000 tokener eller mindre oppgis forbedringer på 6,57 prosentpoeng i RULER-v2, 8,14 prosentpoeng i MRCR-v2 med to ledetråder og 5,55 prosentpoeng i GraphWalks. Det støtter nytten av et mer finmasket utvalg i denne testen, men viser ikke hvor stor del av gevinsten som skyldes KV Bridging, KV Reuse eller at nylige tokener alltid tas med. 6
De tilgjengelige opplysningene gir ikke et tallfestet HySparse-mot-HySparse2-resultat ved én million tokener eller grunnlag for å si at forbedringene er vist i en større modell. De angir heller ikke hvilken tallpresisjon som ligger bak tallet 2,69 GB; det bør derfor ikke omtales som en verifisert FP8-måling. Beregningsoperasjoner i prefill og størrelsen på en hurtigbuffer er heller ikke det samme som målt svartid i drift. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ved én million tokener rapporteres HySparse2 å bruke 1/5,02 av beregningsoperasjonene i forhåndsbehandlingen og 2,69 GB KV hurtigbuffer mot 12,09 GB for Hybrid SWA, i en sammenligning av modeller med samme konfigurasjon.
Ved én million tokener rapporteres HySparse2 å bruke 1/5,02 av beregningsoperasjonene i forhåndsbehandlingen og 2,69 GB KV hurtigbuffer mot 12,09 GB for Hybrid SWA, i en sammenligning av modeller med samme konfigurasjon. En første dekoderdel behandler det lange innholdet. Den neste delen gjenbruker KV data og resultatene fra tokenutvalget, mens nylige tokener alltid tas med.
Dette er publisert arkitekturforskning knyttet til planer for MiMo V3, ikke dokumentasjon på at nye åpne MiMo V3 modellvekter er sluppet.