Sur un test précis de Wan 2.1, une vidéo de 81 images en 720p est passée de 4 769 à 18 secondes sur une RTX 5090, soit un facteur d’environ 265. SparkDiffusion associe attention creuse RoLA, distillation CrossDistill en quelques étapes et noyaux fusionnés FP8 pour réduire le calcul à plusieurs niveaux.
Publié parModifié avec GPT-6 LunaImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion est un framework open source conçu pour accélérer les modèles vidéo Wan d’Alibaba. Il a été développé par des chercheurs de l’université de Pékin, de l’université Tsinghua et d’Alibaba. Sa recette combine trois leviers : calculer moins d’interactions d’attention, réduire le nombre d’étapes de génération et accélérer les opérations restantes avec des noyaux FP8 fusionnés. 6
8
Le chiffre qui retient l’attention est un facteur d’accélération pouvant atteindre 265 fois. Il correspond à un test particulier de Wan 2.1, et non à une promesse valable pour tous les modèles, toutes les vidéos ou toutes les cartes graphiques. 6
8
Les modèles de diffusion vidéo traitent de longues séquences d’informations visuelles. Le mécanisme d’attention, qui met en relation différentes parties de ces séquences, peut donc représenter une part importante du calcul. L’attention creuse réduit le nombre d’interactions effectivement calculées.
Mais pousser cette réduction à l’extrême peut créer un décalage : la perte mesurée à chaque étape d’entraînement continue de diminuer, alors que la vidéo finale cesse de s’améliorer, voire perd en qualité. Les chercheurs appellent ce phénomène le « piège de la forte parcimonie ». 18
SparkDiffusion propose une approche par étapes : commencer par un bref préentraînement du modèle creux pour établir une représentation générale, puis utiliser une distillation qui vise à corriger la trajectoire de génération et le résultat final. 8
Le gain annoncé vient de l’accumulation de ces optimisations : moins de calcul d’attention, moins d’étapes et une exécution plus rapide du travail restant. Il ne découle pas du seul taux de parcimonie. 8
Pour une vidéo de 81 images en 720p générée avec Wan 2.1 T2V 14B — un modèle de création vidéo à partir de texte —, le temps annoncé passe de 4 769 à 18 secondes sur une seule RTX 5090, soit environ 265 fois plus vite. Sur un H100, le test rapporté passe de 1 757 à 8 secondes, soit environ 220 fois plus vite. Ces résultats correspondent à des configurations de test précises : ils ne garantissent pas les mêmes performances ailleurs. 6
Le projet rapporte aussi un facteur d’accélération d’environ 140 pour un cas Wan 2.1 de 1,3 milliard de paramètres en 480p. La comparaison souligne l’importance du modèle et de la résolution lorsqu’on interprète les chiffres mis en avant. 5
7
Les auteurs indiquent que SparkDiffusion conserve une forte qualité visuelle malgré un niveau élevé de parcimonie. Mais les chiffres de vitesse, à eux seuls, ne démontrent pas que la qualité sera équivalente pour chaque consigne, résolution ou variante de modèle. Le piège de la forte parcimonie rappelle précisément qu’une amélioration d’une mesure d’entraînement ne garantit pas une meilleure vidéo finale. 8
18
Il faut donc comprendre les résultats de qualité comme liés aux configurations évaluées, et non comme une garantie que chaque génération égalera la version Wan dense de référence.
Les checkpoints publiés comprennent Wan 2.1 T2V 14B en 480p et en 720p, ainsi que Wan 2.2 T2V A14B en 480p. Les niveaux de parcimonie pris en charge diffèrent selon les checkpoints : la version Wan 2.1 480p indiquée prend en charge 90 %, certaines versions 720p vont jusqu’à 95 % ou 97 %, et la version Wan 2.2 480p couvre de 90 % à 95 %. Le niveau de 97 % ne s’applique donc pas à tous les modèles publiés. 9
10
11
12
SparkDiffusion est présenté comme un framework susceptible d’être étendu au-delà de ces versions de Wan. Les sources disponibles ne permettent toutefois pas d’établir un calendrier ferme ni de vérifier les résultats de futures extensions à d’autres modèles ou matériels. 8
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Sur un test précis de Wan 2.1, une vidéo de 81 images en 720p est passée de 4 769 à 18 secondes sur une RTX 5090, soit un facteur d’environ 265.
Sur un test précis de Wan 2.1, une vidéo de 81 images en 720p est passée de 4 769 à 18 secondes sur une RTX 5090, soit un facteur d’environ 265. SparkDiffusion associe attention creuse RoLA, distillation CrossDistill en quelques étapes et noyaux fusionnés FP8 pour réduire le calcul à plusieurs niveaux.
Le « piège de la forte parcimonie » désigne un décalage : la perte d’entraînement peut baisser tandis que la qualité de la vidéo finale stagne ou se dégrade.