Bij een miljoen tokens rapporteert Xiaomi in een vergelijking met Hybrid SWA 5,02 keer minder rekenwerk voor de voorverwerking en een KV cache van 2,69 GB in plaats van 12,09 GB. De self decoder verwerkt de lange invoer; de cross decoder gebruikt daaruit afgeleide KV gegevens.
Gepubliceerd doorBewerkt met GPT-6 SolAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Een AI-agent die tijdens een taak telkens zoekresultaten, code of andere tooluitvoer aan zijn gesprek toevoegt, moet een steeds langere geschiedenis verwerken. HySparse2 is Xiaomi’s voorstel om vooral die eerste verwerking — prefill — minder kostbaar te maken, zonder de toegang tot recente én verder terugliggende informatie op te geven. Het gepubliceerde werk beschrijft een architectuur die voor MiMo-V3 is voorzien; het is geen bewijs dat er nieuwe open modelgewichten van MiMo-V3 zijn uitgebracht. 3
4
HySparse2 verdeelt het model, volgens een YOCO-achtig ontwerp, in een self-decoder en een cross-decoder. De self-decoder verwerkt de lange invoer. Via KV Bridging bouwen lagen met volledige aandacht in de cross-decoder hun keys en values op uit verborgen toestanden van de self-decoder. Daardoor kan de prefill van de bestaande geschiedenis eindigen zodra de self-decoder klaar is: die hele geschiedenis hoeft niet ook nog eens door de cross-decoder. Bij het genereren van nieuwe tokens doet de cross-decoder wel mee. 4
6
15
Binnen elk hybride blok volgt een tweede vorm van delen. Met KV Reuse gebruiken schaarse lagen de KV-cache én de tokenselectie-indices van de voorafgaande laag met volledige aandacht opnieuw. HySparse2 kiest daarbij afzonderlijke tokens in plaats van hele blokken. Recente tokens worden verplicht in die selectie opgenomen. Zo blijft nabije context beschikbaar zonder een aparte tak met sliding-window-attention; recente en geselecteerde verder weg gelegen tokens gebruiken dezelfde cache. 4
6
15
In een gerapporteerde vergelijking met gelijkwaardige MoE-configuraties — modellen met 80 miljard parameters in totaal, waarvan circa 3 miljard actief per token — vergt de prefill van HySparse2 bij een miljoen tokens 5,02 keer minder rekenwerk, gemeten in FLOPs, dan Hybrid SWA. De opgegeven KV-cache is 2,69 GB tegenover 12,09 GB: ongeveer 4,5 keer kleiner. Xiaomi meldt daarnaast hogere scores op de retrievaltests MRCRv2 en RULER-v2 en lagere waarden voor AgentPPL en LongPPL. Volgens een verslag van de evaluatie scoort HySparse2 op de onderzochte lange-context-retrievaltests beter dan zowel HySparse als Hybrid SWA. 6
15
Een afzonderlijke ablatietest houdt de basisarchitectuur en het aandachtbudget gelijk en verandert alleen de selectie van blokniveau naar tokenniveau. Bij tests met maximaal 32.000 tokens levert dat volgens het verslag 6,57 procentpunt winst op RULER-v2 op, 8,14 procentpunt op MRCR-v2 met twee verborgen aanwijzingen en 5,55 procentpunt op GraphWalks. Dat ondersteunt het nut van fijnmaziger selecteren in deze testopzet, maar zegt niet hoeveel KV Bridging, KV Reuse of het verplichte venster met recente tokens afzonderlijk bijdragen. 6
De grens van de cijfers: het beschikbare materiaal onderbouwt geen numeriek verschil tussen HySparse en HySparse2 bij een miljoen tokens en laat niet zien of de verbeteringen aanhouden bij een groter model. De aangehaalde gegevens vermelden evenmin met welke precisie de cachegrootte van 2,69 GB is berekend; die mag dus niet als bevestigde FP8-meting worden gepresenteerd. Minder FLOPs en een kleinere cache betekenen bovendien niet automatisch een gemeten lagere wachttijd in een productiesysteem. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Bij een miljoen tokens rapporteert Xiaomi in een vergelijking met Hybrid SWA 5,02 keer minder rekenwerk voor de voorverwerking en een KV cache van 2,69 GB in plaats van 12,09 GB.
Bij een miljoen tokens rapporteert Xiaomi in een vergelijking met Hybrid SWA 5,02 keer minder rekenwerk voor de voorverwerking en een KV cache van 2,69 GB in plaats van 12,09 GB. De self decoder verwerkt de lange invoer; de cross decoder gebruikt daaruit afgeleide KV gegevens.
De cijfers tonen geen gemeten snelheid in productie. Ook is niet vastgesteld dat de genoemde cachegrootte specifiek een FP8 meting is.