Dans une comparaison de modèles MoE à 80 milliards de paramètres au total, dont environ 3 milliards actifs par token, HySparse2 requiert 5,02 fois moins d’opérations de préremplissage que Hybrid SWA à un million de to... Le long contexte est traité par un premier décodeur ; le second réutilise les données KV et les...
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Pour un agent IA qui enchaîne les appels à des outils, chaque nouveau résultat peut s’ajouter à un historique déjà volumineux. Avant de répondre, le modèle doit traiter ce contexte : c’est le préremplissage, ou prefill. HySparse2, l’architecture présentée par Xiaomi en lien avec les projets pour MiMo-V3, cherche à réduire ce travail sans perdre l’accès aux informations récentes ou enfouies loin dans l’historique. Il s’agit de travaux sur une architecture, pas de l’annonce d’une nouvelle version de MiMo-V3 dont les poids seraient disponibles publiquement. 3
4
HySparse2 reprend une organisation inspirée de YOCO : un self-decoder traite d’abord la longue entrée, puis un cross-decoder intervient. Grâce au mécanisme appelé KV Bridging, les couches à attention complète du second construisent leurs clés et valeurs — les données conservées dans le cache KV pour accéder au contexte — à partir des états produits par le premier. Le préremplissage du contexte déjà présent peut donc s’arrêter à la fin du self-decoder, au lieu de faire également passer toute cette entrée dans le cross-decoder. Ce dernier reste actif lors de la génération de nouveaux tokens. 4
6
15
Un second mécanisme, KV Reuse, évite de dupliquer une partie du travail au sein de chaque bloc hybride du cross-decoder : ses couches à attention clairsemée réutilisent le cache KV et les indices de sélection de la couche à attention complète qui les précède. La sélection se fait token par token plutôt que par blocs. Les tokens récents y sont obligatoirement inclus, ce qui remplace une branche distincte d’attention à fenêtre glissante : informations proches et tokens plus lointains sélectionnés peuvent ainsi utiliser le même cache. 4
6
15
Dans une configuration comparative de modèles à mélange d’experts (MoE) comptant 80 milliards de paramètres au total, dont environ 3 milliards actifs par token, HySparse2 nécessite, à un million de tokens, 5,02 fois moins d’opérations de préremplissage que Hybrid SWA. Le cache KV rapporté est de 2,69 Go contre 12,09 Go, soit une taille environ 4,5 fois moindre. Xiaomi annonce également de meilleurs scores aux tests de recherche d’informations MRCRv2 et RULER-v2, ainsi que des valeurs AgentPPL et LongPPL plus basses ; un compte rendu indique que HySparse2 devance HySparse et Hybrid SWA sur les tests de recherche en long contexte évalués. 6
15
Une étude comparative ciblée maintient l’architecture de base et le budget d’attention constants, en ne remplaçant que la sélection par blocs par une sélection token par token. Sur des tests à 32 000 tokens ou moins, les gains rapportés sont de 6,57 points de pourcentage sur RULER-v2, 8,14 points sur la version à deux indices de MRCR-v2 et 5,55 points sur GraphWalks. Ce résultat étaye l’intérêt d’une sélection plus fine dans ce cadre ; il ne mesure pas séparément l’apport de KV Bridging, de KV Reuse ou de la fenêtre locale imposée. 6
Les limites à garder en tête : les éléments cités ne permettent pas de chiffrer l’écart entre HySparse et HySparse2 à un million de tokens, ni de vérifier que les gains observés se maintiennent à une échelle de modèle supérieure. Ils ne précisent pas non plus la précision de stockage à l’origine des 2,69 Go : présenter ce chiffre comme une mesure spécifiquement en FP8 serait injustifié. Enfin, un nombre d’opérations et une taille de cache ne constituent pas une mesure de latence en conditions de production. 6
15
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Dans une comparaison de modèles MoE à 80 milliards de paramètres au total, dont environ 3 milliards actifs par token, HySparse2 requiert 5,02 fois moins d’opérations de préremplissage que Hybrid SWA à un million de to...
Dans une comparaison de modèles MoE à 80 milliards de paramètres au total, dont environ 3 milliards actifs par token, HySparse2 requiert 5,02 fois moins d’opérations de préremplissage que Hybrid SWA à un million de to... Le long contexte est traité par un premier décodeur ; le second réutilise les données KV et les résultats de sélection, tout en conservant systématiquement les tokens récents parmi ceux auxquels il peut accéder.