W porównaniu modeli MoE o 80 mld parametrów, z około 3 mld aktywnych na token, HySparse2 wymaga przy milionie tokenów 5,02 razy mniej operacji prefill niż Hybrid SWA. Pierwsza część modelu przetwarza długi kontekst, a druga korzysta z jej stanów i współdzieli dane KV.
Opublikowane przezEdytowane za pomocą GPT-6 SolObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Gdy agent AI pracuje przez wiele tur, krótkie polecenia mogą przeplatać się z obszernymi wynikami narzędzi. Każdy kolejny etap powiększa historię, którą model musi uwzględnić. HySparse2 to propozycja architektury Xiaomi mająca ograniczyć koszt wstępnego przetwarzania takiego kontekstu — etapu zwanego prefill — bez utraty możliwości sięgania po informacje z jego początku. Opublikowano wyniki prac nad architekturą wiązaną z planami dotyczącymi MiMo-V3; nie jest to informacja o nowym wydaniu otwartych wag tego modelu. 3
4
Model dzieli się, zgodnie z podejściem YOCO, na dwie części: self-decoder i cross-decoder. Pierwsza przetwarza długi tekst wejściowy. W mechanizmie KV Bridging warstwy pełnej uwagi w drugiej części tworzą klucze i wartości (K/V) ze stanów ukrytych pierwszej. Dzięki temu wstępne przetwarzanie istniejącej historii może zakończyć się po przejściu przez self-decoder, zamiast przepuszczać ją również przez cross-decoder. Ta druga część nadal bierze udział w generowaniu nowych tokenów. 4
6
15
Drugi poziom współdzielenia to KV Reuse. W każdym hybrydowym bloku cross-decodera warstwy uwagi rzadkiej korzystają z pamięci podręcznej KV oraz indeksów wybranych tokenów pochodzących z poprzedzającej je warstwy pełnej uwagi. HySparse2 wybiera pojedyncze tokeny, a nie całe bloki. Jednocześnie obowiązkowo uwzględnia niedawne tokeny, zastępując osobną gałąź uwagi z przesuwanym oknem (sliding-window attention, SWA). Najnowsze fragmenty i wybrane informacje z dalszej historii mogą więc korzystać z tej samej pamięci podręcznej. 4
6
15
W podanym porównaniu modeli MoE — czyli modeli, w których na dany token aktywuje się tylko część parametrów — konfiguracja ma 80 mld parametrów łącznie i około 3 mld aktywnych na token. Przy kontekście długości miliona tokenów HySparse2 wymaga 5,02 razy mniej operacji zmiennoprzecinkowych (FLOPs) na etapie prefill niż Hybrid SWA. Podane wielkości pamięci podręcznej KV wynoszą odpowiednio 2,69 GB i 12,09 GB, co oznacza około 4,5-krotną różnicę. Xiaomi podaje też wyższe wyniki w testach wyszukiwania informacji MRCRv2 i RULER-v2 oraz niższe wartości AgentPPL i LongPPL. Według relacji z ewaluacji HySparse2 wyprzedza zarówno HySparse, jak i Hybrid SWA w ocenianych testach wyszukiwania w długim kontekście. 6
15
Osobny test sprawdza zmianę wyboru całych bloków na wybór pojedynczych tokenów, przy zachowaniu tej samej podstawowej konstrukcji modelu i budżetu uwagi. Dla kontekstów o długości do 32 tys. tokenów odnotowano poprawę o 6,57 punktu procentowego w RULER-v2, 8,14 punktu w dwuwskazówkowym MRCR-v2 i 5,55 punktu w GraphWalks. To argument za dokładniejszym wyborem tokenów w tych warunkach, ale nie miara osobnego wpływu KV Bridging, KV Reuse czy obowiązkowego okna najnowszych tokenów. 6
Granice tych danych są istotne: dostępne informacje nie pozwalają podać liczbowego porównania HySparse z HySparse2 przy milionie tokenów ani stwierdzić, czy przewaga z porównania utrzyma się w większym modelu. Cytowane fragmenty nie określają też precyzji zapisu stojącej za wartością 2,69 GB, więc nie należy przedstawiać jej jako potwierdzonego pomiaru pamięci KV w formacie FP8. Liczba FLOPs i wielkość pamięci podręcznej nie są również pomiarem opóźnienia działającej usługi. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
W porównaniu modeli MoE o 80 mld parametrów, z około 3 mld aktywnych na token, HySparse2 wymaga przy milionie tokenów 5,02 razy mniej operacji prefill niż Hybrid SWA.
W porównaniu modeli MoE o 80 mld parametrów, z około 3 mld aktywnych na token, HySparse2 wymaga przy milionie tokenów 5,02 razy mniej operacji prefill niż Hybrid SWA. Pierwsza część modelu przetwarza długi kontekst, a druga korzysta z jej stanów i współdzieli dane KV.