I en rapporteret sammenligning af MoE modeller med 80 mia. parametre i alt og cirka 3 mia. Den første del af modellen behandler det lange input, mens senere lag genbruger KV data og tokenudvælgelse.
Udgivet afRedigeret med GPT-6 SolBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Når en AI-agent gentagne gange får lange svar fra værktøjer, vokser samtalehistorikken, selv om agentens egne svar kan være korte. Hver ny omgang gør den indledende behandling af inputtet – prefill – mere krævende. Xiaomis HySparse2 er et forslag til en modelarkitektur, der skal begrænse det arbejde og samtidig bevare adgangen til information langt tilbage i historikken. Det offentliggjorte arbejde er arkitekturforskning knyttet til planerne for MiMo-V3, ikke en ny udgivelse af MiMo-V3 som åben model. 3
4
HySparse2 deler modellen i en YOCO-inspireret self-decoder og en efterfølgende cross-decoder. Self-decoderen behandler det lange input. Med mekanismen KV Bridging danner cross-decoderens lag med fuld attention deres nøgler og værdier – de såkaldte KV-data – ud fra self-decoderens interne tilstande. Derfor kan prefill af den eksisterende kontekst afsluttes efter self-decoderen i stedet for også at sende hele inputtet gennem cross-decoderen. Cross-decoderen er fortsat med, når modellen genererer nye tokens. 4
6
15
Inde i hvert hybridblok lader KV Reuse lag med sparsom attention genbruge KV-cachen og indeksene over udvalgte tokens fra det foregående lag med fuld attention. Udvælgelsen sker for enkelte tokens frem for hele blokke. Samtidig tvinges de nyeste tokens med i udvælgelsen. Det erstatter en særskilt gren med glidende vindue, så både nyere og udvalgte ældre tokens kan bruge samme cache. Formålet er at undgå gentaget lagring og udvælgelsesarbejde uden at miste den nære kontekst. 4
6
15
I en rapporteret sammenligning med samme MoE-modelstørrelse – 80 mia. parametre i alt og omtrent 3 mia. aktive pr. token – er HySparse2s prefill-forbrug målt i FLOPs 5,02 gange lavere end Hybrid SWA's ved én million tokens. KV-cachen er opgjort til 2,69 GB mod 12,09 GB, omtrent 4,5 gange mindre. Xiaomi rapporterer også højere resultater i søgetestene MRCRv2 og RULER-v2 samt lavere AgentPPL og LongPPL. En gennemgang af evalueringen angiver, at HySparse2 klarer sig bedre end både HySparse og Hybrid SWA i de undersøgte test af informationssøgning i lange kontekster. 6
15
Et forsøg, hvor modellens grundstruktur og attention-budget holdes fast, sammenligner udvælgelse af hele blokke med udvælgelse af enkelte tokens. Ved 32.000 tokens eller derunder giver tokenudvælgelse ifølge gennemgangen en forbedring på 6,57 procentpoint i RULER-v2, 8,14 procentpoint i MRCR-v2 med to søgeelementer og 5,55 procentpoint i GraphWalks. Det peger på en fordel ved mere præcis udvælgelse i netop den opsætning, men siger ikke, hvor stor en del af den samlede forbedring der skyldes KV Bridging, KV Reuse eller det tvungne vindue for nyere tokens. 6
De tilgængelige oplysninger giver ikke et tal for forskellen mellem HySparse og HySparse2 ved én million tokens eller dokumentation for, at gevinsterne holder ved en større modelskala. De angiver heller ikke, hvilken præcision der ligger bag cachetallet 2,69 GB; det bør derfor ikke kaldes en verificeret FP8-måling. Færre FLOPs og en mindre cache er desuden ikke det samme som dokumenteret lavere svartid i drift. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
I en rapporteret sammenligning af MoE modeller med 80 mia. parametre i alt og cirka 3 mia.
I en rapporteret sammenligning af MoE modeller med 80 mia. parametre i alt og cirka 3 mia. Den første del af modellen behandler det lange input, mens senere lag genbruger KV data og tokenudvælgelse.