En una comparación de modelos MoE con 80.000 millones de parámetros totales y unos 3.000 millones activos por token, HySparse2 registra 5,02 veces menos operaciones de prefill que Hybrid SWA con un millón de tokens; l... Un decodificador procesa el historial largo; el segundo reutiliza estados, caché e índices de se...
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Cuando un agente de IA añade resultados extensos de herramientas a una conversación que ya es larga, volver a procesar el historial puede resultar costoso. HySparse2, la arquitectura presentada por investigadores de Xiaomi para este tipo de tareas, busca reducir tanto el cálculo inicial —conocido como prefill— como la memoria necesaria para conservar la caché de claves y valores (KV), sin perder acceso a información reciente o distante. Se trata de investigación sobre una arquitectura asociada a los planes para MiMo-V3, no de una nueva publicación de pesos abiertos de MiMo-V3. 3
4
HySparse2 divide el modelo, siguiendo una idea de YOCO, en un self-decoder y un cross-decoder. El primero procesa la entrada larga. Mediante KV Bridging, las capas de atención completa del segundo construyen sus claves y valores a partir de los estados generados por el primero. Así, el prefill del contexto existente puede terminar al completar el self-decoder, en lugar de hacer pasar también todo ese contexto por el cross-decoder. Este último sí interviene después, cuando el modelo genera nuevos tokens. 4
6
15
Hay un segundo nivel de aprovechamiento: dentro de cada bloque híbrido del cross-decoder, KV Reuse permite que las capas de atención dispersa compartan la caché KV y los índices de selección de tokens de la capa de atención completa anterior. La selección se hace token por token, no por bloques. Además, HySparse2 incluye obligatoriamente los tokens recientes en esa selección: así conserva el contexto inmediato sin mantener una rama independiente de atención con ventana deslizante, y los tokens cercanos y lejanos seleccionados pueden usar la misma caché. 4
6
15
En una comparación reportada con modelos de mezcla de expertos (MoE) de 80.000 millones de parámetros totales y unos 3.000 millones activos por token, HySparse2 requiere 5,02 veces menos operaciones de prefill que Hybrid SWA al llegar a un millón de tokens. La caché KV indicada es de 2,69 GB frente a 12,09 GB, aproximadamente 4,5 veces menor. Xiaomi también comunica mejores puntuaciones en las pruebas de recuperación MRCRv2 y RULER-v2, junto con valores más bajos de AgentPPL y LongPPL; un informe de la evaluación señala que HySparse2 supera a HySparse y Hybrid SWA en las pruebas de recuperación de contexto largo consideradas. 6
15
Una prueba de ablación ayuda a precisar qué aporta la selección más fina. Al mantener constantes la estructura base y el presupuesto de atención, y cambiar solo la selección por bloques por la selección por tokens, el informe recoge, en pruebas de 32.000 tokens o menos, mejoras de 6,57 puntos porcentuales en RULER-v2, 8,14 puntos en MRCR-v2 de dos pistas y 5,55 puntos en GraphWalks. Es evidencia a favor de seleccionar tokens individualmente en ese escenario, pero no permite atribuir esas mejoras por separado a KV Bridging, KV Reuse o la ventana local obligatoria. 6
Lo que aún no puede concluirse: las fuentes disponibles no establecen una cifra comparativa entre HySparse y HySparse2 a un millón de tokens, ni cuantifican la aportación individual de cada mecanismo o confirman que las mejoras se mantengan a una escala de modelo mayor. Tampoco especifican la precisión utilizada para calcular los 2,69 GB de caché, por lo que no corresponde describir esa cifra como una medición verificada en FP8. Menos operaciones y una caché más pequeña, además, no equivalen por sí solas a una medición de latencia en producción. 6
15
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
En una comparación de modelos MoE con 80.000 millones de parámetros totales y unos 3.000 millones activos por token, HySparse2 registra 5,02 veces menos operaciones de prefill que Hybrid SWA con un millón de tokens; l...
En una comparación de modelos MoE con 80.000 millones de parámetros totales y unos 3.000 millones activos por token, HySparse2 registra 5,02 veces menos operaciones de prefill que Hybrid SWA con un millón de tokens; l... Un decodificador procesa el historial largo; el segundo reutiliza estados, caché e índices de selección.
Son resultados de investigación sobre una arquitectura prevista para MiMo V3, no el anuncio de una nueva versión de MiMo V3 con pesos abiertos.