SparkDiffusion combineert sparse attention, distillatie naar weinig stappen en FP8 kernels. De ‘high sparsity trap’ is het probleem dat de trainingsfout kan dalen terwijl de uiteindelijke video niet beter wordt, of zelfs verslechtert.
Gepubliceerd doorBewerkt met GPT-6 LunaAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Een video die eerder ruim een uur rekentijd kostte, kan in een specifieke test in 18 seconden klaar zijn. Dat is de opvallendste claim van SparkDiffusion, een open-sourceframework van onderzoekers van Peking University, Tsinghua University en Alibaba. Het versnelt de videogeneratiemodellen Wan 2.1 en Wan 2.2 door op meerdere plekken tegelijk rekenwerk te besparen. 6
8
Die factor van 265 geldt voor een afgebakende benchmark, niet automatisch voor elke video, modelvariant of computer. De gemelde resultaten hangen onder meer af van de resolutie, het model en de gebruikte GPU. 6
8
Videomodellen verwerken lange reeksen beeldinformatie. Daarbij vraagt de zogeheten attention-berekening veel rekenkracht: het model bepaalt welke delen van die informatie met elkaar samenhangen. Sparse attention beperkt het aantal berekende interacties.
Maar die besparing kent een risico. De onderzoekers beschrijven dat bij zeer hoge sparsity de trainingsfout per stap kan blijven dalen, terwijl de uiteindelijke video stagneert of slechter wordt. Dat verschil tussen een gunstige trainingsmeting en het eindresultaat noemen ze de high-sparsity trap. 18
SparkDiffusion pakt dit trapsgewijs aan: eerst krijgt het sparse model een korte opwarmfase om een grove basis te leren. Daarna moet distillatie de uiteindelijke generatie-uitkomst bijsturen, in plaats van alleen de tussenstappen te optimaliseren. 8
SparkDiffusion richt zich niet op één enkele versnelling, maar op verschillende onderdelen van het generatieproces:
De winst ontstaat door die ingrepen te stapelen: minder attention-berekeningen, minder generatiestappen en efficiëntere uitvoering van het resterende werk. De claim van 265 keer sneller is dus niet het gevolg van sparsity alleen. 8
In de gerapporteerde test voor een video van 81 frames in 720p met Wan 2.1 T2V 14B daalde de generatietijd op één RTX 5090 van 4.769 naar 18 seconden: ongeveer 265 keer sneller. Voor een vergelijking op een H100 wordt een daling gemeld van 1.757 naar 8 seconden, ongeveer 220 keer sneller. Het gaat om specifieke tests en hardware, geen garantie voor andere toepassingen. 6
Voor een kleinere Wan 2.1-configuratie met 1,3 miljard parameters in 480p wordt een versnelling van ongeveer 140 keer gemeld. Ook dat onderstreept dat model en resolutie ertoe doen bij het interpreteren van de headlinecijfers. 5
7
Het project stelt dat SparkDiffusion bij hoge sparsity sterke visuele kwaliteit behoudt. Maar een snelheidsmeting bewijst op zichzelf niet dat elk resultaat dezelfde kwaliteit heeft als de oorspronkelijke, dense Wan-versie. De high-sparsity trap laat juist zien waarom: een betere trainingsscore betekent niet vanzelf een betere eindvideo. 8
18
Lees de snelheids- en kwaliteitsclaims daarom als resultaten voor de geteste configuraties. De beschikbare benchmarkinformatie is onvoldoende om te concluderen dat elke prompt, resolutie of modelvariant hetzelfde kwaliteitsniveau oplevert.
De gepubliceerde checkpoints omvatten Wan 2.1 T2V 14B in 480p en 720p, en Wan 2.2 T2V A14B in 480p. De ondersteunde sparsity verschilt per versie: het Wan 2.1-checkpoint voor 480p ondersteunt 90 procent, terwijl de vermelde 720p-varianten tot 95 of 97 procent gaan. De Wan 2.2-versie voor 480p ondersteunt 90 tot 95 procent. Niet elk checkpoint kan dus op 97 procent sparsity draaien. 9
10
11
12
De makers presenteren SparkDiffusion als een aanpak die ook buiten de genoemde Wan-modellen toepasbaar kan zijn. De beschikbare bronnen geven geen vaste planning of geverifieerde resultaten voor toekomstige modellen of hardware. 8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SparkDiffusion combineert sparse attention, distillatie naar weinig stappen en FP8 kernels.
SparkDiffusion combineert sparse attention, distillatie naar weinig stappen en FP8 kernels. De ‘high sparsity trap’ is het probleem dat de trainingsfout kan dalen terwijl de uiteindelijke video niet beter wordt, of zelfs verslechtert.
Er zijn checkpoints uitgebracht voor specifieke Wan 2.1 en Wan 2.2 configuraties.