Ve srovnání modelů MoE s 80 miliardami parametrů celkem a zhruba 3 miliardami aktivních na token uvádí Xiaomi při milionu tokenů 5,02krát méně výpočtů při zpracování vstupu než u Hybrid SWA. Dlouhý vstup zpracuje první část modelu; druhá využívá její stavy a řídké vrstvy sdílejí cache i výběr tokenů.
PublikovalUpraveno pomocí GPT-6 SolObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Když AI agent opakovaně načítá dlouhé výstupy nástrojů, musí při dalších krocích pracovat s čím dál delší historií. HySparse2 je návrh architektury od Xiaomi, který má zlevnit její úvodní zpracování (prefill), ale zachovat možnost vyhledat informace z nedávné i vzdálené části kontextu. Jde o zveřejněný výzkum spojovaný s plány pro MiMo-V3, nikoli o oznámení vydání nového modelu MiMo-V3 s veřejně dostupnými váhami. 3
4
HySparse2 rozděluje model po vzoru YOCO na dvě části označované jako self-decoder a cross-decoder. Dlouhý vstup nejprve projde první z nich. Díky mechanismu KV Bridging si vrstvy s plnou pozorností ve druhé části vytvářejí klíče a hodnoty (K/V) ze skrytých stavů první části. Úvodní zpracování dosavadního dlouhého kontextu tak může skončit po self-decoderu, místo aby celý vstup procházel i cross-decoderem. Při generování nových tokenů se však cross-decoder dál zapojuje. 4
6
15
Další úsporu přináší KV Reuse: řídké vrstvy v každém hybridním bloku přebírají od předchozí vrstvy s plnou pozorností KV cache, tedy uložené klíče a hodnoty, i údaje o tom, které tokeny byly vybrány. Výběr probíhá po jednotlivých tokenech, nikoli po blocích. Nedávné tokeny se do něj navíc zařazují povinně, takže blízký kontext nepotřebuje samostatnou větev pozornosti s posuvným oknem (SWA) a může sdílet cache s vybranými vzdálenějšími tokeny. 4
6
15
Při uváděném srovnání modelů typu MoE (mixture of experts) s 80 miliardami parametrů celkem a zhruba 3 miliardami aktivních na token vyžaduje HySparse2 při kontextu o milionu tokenů 5,02krát méně výpočtů při prefillu než Hybrid SWA. Uváděná velikost KV cache je 2,69 GB oproti 12,09 GB, tedy přibližně 4,5krát méně. Xiaomi zároveň hlásí lepší výsledky v testech vyhledávání MRCR-v2 a RULER-v2 a nižší hodnoty AgentPPL a LongPPL; podle zprávy o hodnocení vede HySparse2 v posuzovaných testech vyhledávání v dlouhém kontextu také před HySparse. 6
15
Jeden z dílčích experimentů ponechal stejný základ modelu i rozpočet pozornosti a změnil pouze výběr po blocích na výběr po tokenech. V testech s nejvýše 32 tisíci tokeny tím skóre RULER-v2 vzrostlo o 6,57 procentního bodu, dvoustopového MRCR-v2 o 8,14 bodu a GraphWalks o 5,55 bodu. Výsledek podporuje jemnější výběr v tomto nastavení, ale neurčuje samostatný přínos KV Bridging, KV Reuse ani povinného zahrnutí nedávných tokenů. 6
Dostupné podklady neudávají číselné srovnání HySparse a HySparse2 při milionu tokenů ani nepotvrzují, že stejné přínosy přetrvají u většího modelu. U údaje 2,69 GB také nespecifikují přesnost uložení cache, a nelze jej proto označovat za ověřené měření pro FP8. Počet výpočtů a velikost cache navíc nejsou totéž co změřená odezva při reálném provozu. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ve srovnání modelů MoE s 80 miliardami parametrů celkem a zhruba 3 miliardami aktivních na token uvádí Xiaomi při milionu tokenů 5,02krát méně výpočtů při zpracování vstupu než u Hybrid SWA.
Ve srovnání modelů MoE s 80 miliardami parametrů celkem a zhruba 3 miliardami aktivních na token uvádí Xiaomi při milionu tokenů 5,02krát méně výpočtů při zpracování vstupu než u Hybrid SWA. Dlouhý vstup zpracuje první část modelu; druhá využívá její stavy a řídké vrstvy sdílejí cache i výběr tokenů.