In einem Vergleich von MoE Modellen mit 80 Milliarden Parametern insgesamt und rund 3 Milliarden aktiven Parametern pro Token benötigt HySparse2 bei einer Million Token 5,02 mal weniger Prefill Rechenoperationen als H... Der Self Decoder verarbeitet den langen Eingabekontext.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Wenn ein KI-Agent über viele Schritte arbeitet, wachsen seine Eingaben: Zu bisherigen Nachrichten kommen etwa umfangreiche Ausgaben von Werkzeugen hinzu. HySparse2 ist Xiaomis Architekturvorschlag, um diesen langen Kontext mit weniger Rechenaufwand zu verarbeiten und trotzdem Informationen aus jüngeren wie weiter zurückliegenden Teilen abrufen zu können. Veröffentlicht wurde Architekturarbeit mit Blick auf MiMo-V3 – keine neue Open-Weight-Version von MiMo-V3. 3
4
HySparse2 teilt das Modell nach dem YOCO-Prinzip in einen Self-Decoder und einen Cross-Decoder. Zunächst verarbeitet der Self-Decoder die lange Eingabe. Beim sogenannten KV Bridging bilden die Full-Attention-Schichten des Cross-Decoders ihre Schlüssel und Werte – kurz KV – aus dessen verborgenen Zuständen. Dadurch kann die Prefill-Phase für den bereits vorliegenden langen Kontext nach dem Self-Decoder enden. Beim Erzeugen neuer Token arbeitet der Cross-Decoder weiterhin mit. 4
6
15
Eine zweite Form der gemeinsamen Nutzung heißt KV Reuse: Innerhalb eines Hybridblocks verwenden sparsame Attention-Schichten den KV-Cache und die Token-Auswahlindizes der vorhergehenden Full-Attention-Schicht erneut. Statt ganze Blöcke auszuwählen, wählt HySparse2 einzelne Token. Die jüngsten Token werden dabei zwingend berücksichtigt. So ersetzt ein lokales Fenster einen separaten Sliding-Window-Attention-Zweig; ausgewählte ältere und nahe Token können denselben Cache nutzen. 4
6
15
Für eine verglichene Mixture-of-Experts-Konfiguration mit 80 Milliarden Parametern insgesamt und etwa 3 Milliarden aktiven Parametern pro Token werden bei einer Million Token für HySparse2 5,02-mal weniger Prefill-FLOPs als für Hybrid SWA angegeben. Der ausgewiesene KV-Cache liegt bei 2,69 statt 12,09 GB, also bei ungefähr einem Viertel. Xiaomi nennt außerdem bessere Ergebnisse bei den Langkontext-Abrufstests MRCRv2 und RULER-v2 sowie niedrigere Werte für AgentPPL und LongPPL. Ein Bericht zur Auswertung sieht HySparse2 bei den untersuchten Abrufstests vor HySparse und Hybrid SWA. 6
15
Ein Ablationstest vergleicht bei gleichem Modellgrundgerüst und gleichem Attention-Budget die Auswahl ganzer Blöcke mit der Auswahl einzelner Token. Bei Tests mit höchstens 32.000 Token verbessert die Token-Auswahl laut Bericht RULER-v2 um 6,57 Prozentpunkte, MRCR-v2 mit zwei Suchzielen um 8,14 Punkte und GraphWalks um 5,55 Punkte. Das belegt einen Vorteil der feineren Auswahl in diesem Versuchsaufbau, beziffert aber nicht den Einzelbeitrag von KV Bridging, KV Reuse oder dem lokalen Fenster. 6
Die verfügbaren Angaben liefern keinen bezifferten HySparse-gegen-HySparse2-Vergleich bei einer Million Token und keinen Nachweis, dass die Verbesserungen bei einem größeren Modellmaßstab bestehen bleiben. Auch die Speicherpräzision hinter den 2,69 GB ist in den zitierten Auszügen nicht angegeben: Die Zahl sollte daher nicht als verifizierter FP8-Wert gelten. Prefill-FLOPs und Cache-Größe sind zudem keine Messung der Latenz im Produktivbetrieb. 6
15
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
In einem Vergleich von MoE Modellen mit 80 Milliarden Parametern insgesamt und rund 3 Milliarden aktiven Parametern pro Token benötigt HySparse2 bei einer Million Token 5,02 mal weniger Prefill Rechenoperationen als H...
In einem Vergleich von MoE Modellen mit 80 Milliarden Parametern insgesamt und rund 3 Milliarden aktiven Parametern pro Token benötigt HySparse2 bei einer Million Token 5,02 mal weniger Prefill Rechenoperationen als H... Der Self Decoder verarbeitet den langen Eingabekontext. Der Cross Decoder nutzt daraus abgeleitete KV Daten; seine sparsamen Schichten teilen sich zudem Cache und Auswahlindizes.