O SparkDiffusion combina atenção esparsa, destilação em poucas etapas e kernels FP8. A “armadilha da alta esparsidade” ocorre quando a perda de treinamento melhora, mas a qualidade do vídeo final deixa de avançar ou piora.
Publicado porEditado com GPT-6 LunaImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
O SparkDiffusion é um framework de código aberto para acelerar modelos de geração de vídeo Wan, desenvolvido por pesquisadores da Universidade de Pequim, da Universidade Tsinghua e do Alibaba. A proposta reúne três otimizações: atenção esparsa, destilação para gerar o vídeo em menos etapas e kernels fundidos com precisão FP8. 6
8
A equipe relata até 265 vezes mais velocidade em um teste específico do Wan 2.1. Esse número não deve ser interpretado como uma garantia para qualquer modelo, vídeo, resolução ou configuração de hardware. 6
8
Modelos de difusão para vídeo processam sequências longas de informação visual, e o cálculo de atenção pode exigir bastante processamento. A atenção esparsa reduz o número de interações calculadas para tornar essa etapa mais leve.
O problema, segundo os pesquisadores, é que elevar demais a esparsidade pode criar uma diferença entre o que o treinamento indica e o resultado final: a perda medida em etapas individuais continua caindo, mas o vídeo gerado para de melhorar ou perde qualidade. Esse fenômeno foi chamado de “armadilha da alta esparsidade”. 18
A resposta proposta pelo SparkDiffusion é gradual. Primeiro, o modelo esparso passa por um breve aquecimento para formar uma representação geral; depois, a destilação procura corrigir a trajetória de geração e o resultado final. 8
O ganho não vem de uma única otimização. O framework combina mudanças que reduzem o trabalho em diferentes pontos da geração:
Em conjunto, as técnicas reduzem a quantidade de atenção calculada, o número de etapas e o tempo de execução de cada uma. Portanto, o ganho total não deve ser atribuído apenas à esparsidade de 97%. 8
No teste divulgado com o Wan 2.1 T2V 14B, um vídeo de 81 quadros em 720p levou 18 segundos para ser gerado em uma única RTX 5090, contra 4.769 segundos na comparação apresentada — uma aceleração de aproximadamente 265 vezes. Em um resultado divulgado para uma H100, o tempo passou de 1.757 para 8 segundos, cerca de 220 vezes mais rápido. São medições de configurações específicas, não previsões para outros equipamentos ou tarefas. 6
O projeto também relata uma aceleração de aproximadamente 140 vezes em um caso com Wan 2.1 1.3B e resolução 480p. A diferença entre os números reforça a importância de considerar o modelo e a resolução junto com qualquer velocidade de destaque. 5
7
O SparkDiffusion afirma manter qualidade visual forte em configurações de alta esparsidade. Ainda assim, os números de velocidade, por si só, não demonstram que todos os vídeos terão qualidade equivalente à do Wan sem essas otimizações. A própria armadilha da alta esparsidade mostra que uma melhora na métrica de treinamento por etapa não garante um resultado final melhor. 8
18
Por isso, as afirmações sobre velocidade e qualidade devem ser lidas dentro das configurações avaliadas. As informações de benchmark disponíveis não bastam para concluir que todo vídeo gerado será igual ao produzido pelo modelo Wan de referência mais denso.
As listagens fornecidas incluem checkpoints do Wan 2.1 T2V 14B em 480p e 720p, além do Wan 2.2 T2V A14B em 480p. Os limites de esparsidade variam entre eles: o checkpoint do Wan 2.1 em 480p lista 90%, enquanto variantes em 720p chegam a 95% ou 97%; a versão do Wan 2.2 em 480p lista uma faixa de 90% a 95%. Assim, 97% não é uma opção disponível em todos os checkpoints publicados. 9
10
11
12
O projeto apresenta o SparkDiffusion como uma estrutura que pode ir além dos modelos Wan listados, mas as fontes disponíveis não confirmam um cronograma nem resultados verificados para futuras extensões a outros modelos ou hardwares. 8
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O SparkDiffusion combina atenção esparsa, destilação em poucas etapas e kernels FP8.
O SparkDiffusion combina atenção esparsa, destilação em poucas etapas e kernels FP8. A “armadilha da alta esparsidade” ocorre quando a perda de treinamento melhora, mas a qualidade do vídeo final deixa de avançar ou piora.
Os checkpoints publicados abrangem configurações selecionadas do Wan 2.1 e do Wan 2.2, com diferentes limites de esparsidade; nem todos chegam a 97%.