Miljoonan tokenin vertailussa HySparse2:n esikäsittely vaati 5,02 kertaa vähemmän laskentaoperaatioita kuin Hybrid SWA; KV välimuisti oli 2,69 gigatavua verrattuna 12,09 gigatavuun. Pitkä syöte kulkee itse dekooderin läpi.
JulkaisijaMuokattu mallilla GPT-6 SolKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Pitkään toimiva tekoälyagentti voi saada työkaluiltaan suuria määriä uutta tekstiä samalla, kun aiempi keskustelu pysyy mukana. Ennen vastauksen tuottamista mallin on käsiteltävä tämä kertynyt syöte – vaihetta kutsutaan esikäsittelyksi (prefill). Xiaomin esittelemä HySparse2 pyrkii vähentämään sen laskentaa ja muistinkulutusta säilyttäen pääsyn sekä tuoreisiin että kauempana historiassa oleviin tokeneihin. Kyse on MiMo-V3:een liittyvästä arkkitehtuuritutkimuksesta, ei osoituksesta, että uudet MiMo-V3-mallipainot olisi julkaistu avoimesti. 3
4
HySparse2 jakaa mallin YOCO-tyylisesti itse-dekooderiin (self-decoder) ja ristidekooderiin (cross-decoder). Itse-dekooderi käsittelee pitkän syötteen. KV Bridging -menetelmässä ristidekooderin täyden huomion kerrokset muodostavat avaimet ja arvot eli KV-tiedot itse-dekooderin sisäisistä tiloista. Näin olemassa olevan pitkän kontekstin esikäsittely voi päättyä itse-dekooderin jälkeen: samaa syötettä ei tarvitse ajaa myös ristidekooderin läpi. Ristidekooderi osallistuu silti uusien tokenien tuottamiseen. 4
6
15
Toinen jakamisen taso on KV Reuse. Kunkin ristidekooderin hybridilohkon harvat huomiokerrokset käyttävät edeltävän täyden huomion kerroksen KV-välimuistia ja tietoa valituista tokeneista. Valinta tehdään yksittäisten tokenien, ei kokonaisten lohkojen tasolla. Lisäksi viimeisimmät tokenit otetaan valintaan aina mukaan. Siksi lähellä oleva konteksti ja valitut kaukaisemmat kohdat voivat käyttää samaa välimuistia ilman erillistä liukuvan ikkunan huomiopolkua. 4
6
15
Raportoidussa vertailussa käytettiin MoE- eli mixture-of-experts-mallikokoonpanoa, jossa on yhteensä 80 miljardia parametria ja noin 3 miljardia aktiivista parametria tokenia kohti. Miljoonan tokenin kontekstissa HySparse2:n esikäsittelyn FLOP-laskentamäärä oli 5,02 kertaa pienempi kuin Hybrid SWA:n. Raportoidut KV-välimuistin koot olivat 2,69 ja 12,09 gigatavua – HySparse2:lla siis noin 4,5 kertaa pienempi. Xiaomi raportoi myös parempia MRCRv2- ja RULER-v2-tiedonhakutuloksia sekä pienempiä AgentPPL- ja LongPPL-arvoja. Arviointia käsittelevän raportin mukaan HySparse2 menestyi testatuissa pitkän kontekstin tiedonhakukokeissa sekä HySparsea että Hybrid SWA:ta paremmin. 6
15
Yhdessä raportoidussa osakokeessa mallin perusrakenne ja huomiomekanismin laskentabudjetti pidettiin samoina, mutta lohkoittainen valinta vaihdettiin tokenikohtaiseen. Enintään 32 000 tokenin testeissä tulos parani RULER-v2:ssa 6,57 prosenttiyksikköä, kahden etsittävän tiedon MRCR-v2:ssa 8,14 prosenttiyksikköä ja GraphWalksissa 5,55 prosenttiyksikköä. Koe tukee tarkemman valinnan hyötyä tässä asetelmassa, mutta ei kerro erikseen, paljonko KV Bridging, KV Reuse tai viimeisimpien tokenien pakollinen mukaanotto vaikuttivat. 6
Lähteistä ei selviä numeerista HySparse–HySparse2-vertailua miljoonan tokenin kohdalla eikä sitä, säilyvätkö vertailumallilla havaitut hyödyt suuremmassa mallissa. Ne eivät myöskään täsmennä 2,69 gigatavun välimuistiluvun tallennustarkkuutta, joten sitä ei pidä kutsua varmennetuksi FP8-mittaukseksi. Laskentaoperaatioiden määrä ja välimuistin koko eivät lisäksi ole sama asia kuin tuotantokäytössä mitattu vasteaika. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Miljoonan tokenin vertailussa HySparse2:n esikäsittely vaati 5,02 kertaa vähemmän laskentaoperaatioita kuin Hybrid SWA; KV välimuisti oli 2,69 gigatavua verrattuna 12,09 gigatavuun.
Miljoonan tokenin vertailussa HySparse2:n esikäsittely vaati 5,02 kertaa vähemmän laskentaoperaatioita kuin Hybrid SWA; KV välimuisti oli 2,69 gigatavua verrattuna 12,09 gigatavuun. Pitkä syöte kulkee itse dekooderin läpi. Ristidekooderi hyödyntää sen tiloja, ja harvat huomiokerrokset jakavat KV välimuistia sekä tokenien valintatietoa.
Tulokset koskevat julkaistua arkkitehtuuritutkimusta, eivät uutta avointa MiMo V3 mallijulkaisua tai mitattua tuotantokäytön vasteaikaa.