Em uma comparação entre modelos MoE com 80 bilhões de parâmetros totais e cerca de 3 bilhões ativos por token, o HySparse2 registrou 1/5,02 dos FLOPs de prefill do Hybrid SWA em 1 milhão de tokens. O self decoder processa a entrada longa; o cross decoder aproveita seus estados para construir dados KV.
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Quando um agente de IA recebe a saída extensa de uma ferramenta, precisa incorporá-la a um histórico que já pode ser enorme. Esse processamento inicial da entrada — chamado prefill — fica mais caro conforme o contexto cresce. O HySparse2, arquitetura proposta por pesquisadores da Xiaomi, tenta reduzir esse custo sem deixar de consultar informações recentes ou distantes no histórico. O trabalho está associado aos planos para o MiMo-V3, mas não representa, por si só, o lançamento de um novo modelo MiMo-V3 com pesos abertos. 3
4
O HySparse2 divide o modelo em duas partes, seguindo uma abordagem do tipo YOCO: self-decoder e cross-decoder. O self-decoder processa a entrada longa. Por meio do mecanismo chamado KV Bridging, as camadas de atenção completa do cross-decoder constroem suas chaves e valores — os dados K e V guardados no cache — a partir dos estados produzidos pelo self-decoder. Assim, o prefill do contexto existente pode terminar ao fim da primeira parte, sem executar novamente toda a entrada longa pelo cross-decoder. Essa segunda parte continua participando da geração de novos tokens. 4
6
15
Há um segundo nível de compartilhamento. Em cada bloco híbrido do cross-decoder, o KV Reuse permite que as camadas de atenção esparsa aproveitem o cache KV e os índices de seleção de tokens da camada anterior de atenção completa. A seleção ocorre token a token, não por blocos. Além disso, tokens recentes entram obrigatoriamente nessa seleção: isso substitui um ramo separado de atenção por janela deslizante e permite que o contexto próximo e os tokens distantes selecionados usem o mesmo cache. 4
6
15
Na comparação reportada para modelos de mistura de especialistas (MoE) com 80 bilhões de parâmetros totais e aproximadamente 3 bilhões ativos por token, o HySparse2 usa, em um contexto de 1 milhão de tokens, 1/5,02 dos FLOPs de prefill do Hybrid SWA. FLOPs são uma medida da quantidade de operações de cálculo, não do tempo de resposta. O cache KV informado cai de 12,09 GB para 2,69 GB — cerca de 4,5 vezes menor. A Xiaomi também relata pontuações mais altas nos testes de recuperação MRCRv2 e RULER-v2 e valores menores de AgentPPL e LongPPL. Segundo um relato da avaliação, o HySparse2 supera tanto o HySparse quanto o Hybrid SWA nos testes de recuperação de contexto longo avaliados. 6
15
Um teste de ablação ajuda a entender uma das escolhas de projeto: mantendo a estrutura básica do modelo e o orçamento de atenção, os pesquisadores trocaram a seleção por blocos pela seleção por tokens. Em testes com até 32 mil tokens, os ganhos reportados foram de 6,57 pontos percentuais no RULER-v2, 8,14 pontos no MRCR-v2 com duas pistas e 5,55 pontos no GraphWalks. O resultado favorece a seleção mais precisa nesse cenário, mas não separa o efeito do KV Bridging, do KV Reuse ou da inclusão obrigatória dos tokens recentes. 6
O limite da conclusão: os trechos disponíveis não estabelecem uma comparação numérica entre HySparse e HySparse2 em 1 milhão de tokens, nem demonstram que os ganhos se mantêm em um modelo maior. Também não especificam a precisão usada para chegar aos 2,69 GB de cache; portanto, esse número não deve ser tratado como uma medição comprovadamente específica de FP8. Menos FLOPs e menos memória são resultados relevantes, mas não equivalem a uma medição de latência em produção. 6
15
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Em uma comparação entre modelos MoE com 80 bilhões de parâmetros totais e cerca de 3 bilhões ativos por token, o HySparse2 registrou 1/5,02 dos FLOPs de prefill do Hybrid SWA em 1 milhão de tokens.
Em uma comparação entre modelos MoE com 80 bilhões de parâmetros totais e cerca de 3 bilhões ativos por token, o HySparse2 registrou 1/5,02 dos FLOPs de prefill do Hybrid SWA em 1 milhão de tokens. O self decoder processa a entrada longa; o cross decoder aproveita seus estados para construir dados KV.