I en test med Wan 2.1 faldt genereringstiden for en video på 81 billeder i 720p fra 4.769 til 18 sekunder på ét RTX 5090 kort – cirka 265 gange hurtigere i netop den test. Den såkaldte »høj sparsitet fælde« opstår, når træningstabet bliver bedre, mens den færdige video står stille kvalitetsmæssigt eller bliver dårli...
Udgivet afRedigeret med GPT-6 LunaBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion er et open source-framework, der skal gøre video genereret med Wan-modeller hurtigere. Forskerne bag kommer fra Peking University, Tsinghua University og Alibaba. Metoden kombinerer sparsom attention, destillering til færre genereringstrin og FP8-kernels. 6
8
I en bestemt benchmark faldt tiden for at generere en video på 81 billeder i 720p med Wan 2.1 fra 4.769 sekunder til 18 sekunder på ét RTX 5090-kort. Det svarer til cirka 265 gange hurtigere. Resultatet gælder den afprøvede model, opløsning og hardware – ikke nødvendigvis andre opsætninger. 6
Videomodeller baseret på diffusion bruger store mængder beregning på attention: modellen vurderer, hvordan forskellige dele af den visuelle sekvens hænger sammen. Sparsom attention skærer ned på antallet af forbindelser, der beregnes, og kan dermed reducere arbejdsbyrden.
Men forskerne beskriver et problem, når sparsiteten bliver meget høj: Træningstabet for de enkelte trin kan blive ved med at falde, selv om den færdige video ikke bliver bedre – eller ligefrem forringes. Det misforhold kalder de »høj-sparsitet-fælden«. 18
SparkDiffusions løsning er trinvist opbygget. Først får den sparsomme model en kort opvarmningsfase, så den kan etablere et groft udgangspunkt. Derefter bruges destillering, der skal korrigere modellens genereringsforløb og det endelige resultat. 8
SparkDiffusion forsøger ikke at hente hele hastighedsgevinsten fra én enkelt optimering. Frameworket kombinerer tre greb:
Den samlede hastighedsgevinst kommer altså fra mindre beregning i hvert trin, færre trin og hurtigere afvikling af de resterende beregninger. Den kan ikke tilskrives 97 procents sparsitet alene. 8
For en 81-billeders video i 720p med Wan 2.1 T2V 14B – en model til tekst-til-video – faldt den rapporterede genereringstid fra 4.769 til 18 sekunder på ét RTX 5090-kort. En sammenligning på H100-kort viser et fald fra 1.757 til 8 sekunder, svarende til cirka 220 gange hurtigere. Begge tal gælder specifikke testopsætninger og er ikke en garanti for andre modeller eller arbejdsgange. 6
Frameworket rapporterer også omkring 140 gange hastighedsforøgelse for Wan 2.1 1.3B ved 480p. Forskellen mellem resultaterne understreger, hvorfor tallet »265 gange« bør ses sammen med den konkrete model og opløsning, det gælder. 5
7
Projektet beskriver kvaliteten som stærk ved høj sparsitet, men hastighedstal alene viser ikke, at kvaliteten er uændret på tværs af prompts, opløsninger og modelvarianter. Høj-sparsitet-fælden viser netop, at et bedre træningsmål for de enkelte trin ikke nødvendigvis giver en bedre færdig video. 8
18
Derfor bør hastigheds- og kvalitetsudsagn læses som resultater for de konfigurationer, der er undersøgt. De tilgængelige benchmarkoplysninger er ikke tilstrækkelige til at konkludere, at enhver genereret video matcher den tætte Wan-reference.
De udgivne checkpoints omfatter Wan 2.1 T2V 14B ved 480p og 720p samt Wan 2.2 T2V A14B ved 480p. De understøttede sparsitetniveauer varierer mellem checkpoints: Wan 2.1 ved 480p har en udgave med 90 procents sparsitet, mens nogle 720p-udgaver går op til 95 eller 97 procent. Wan 2.2-udgaven ved 480p dækker 90–95 procent. 9
10
11
12
Projektet præsenterer SparkDiffusion som et framework, der kan række ud over de Wan-udgivelser, der er nævnt her. De foreliggende kilder fastslår dog hverken en tidsplan eller verificerede resultater for fremtidige modeller og hardware. 8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
I en test med Wan 2.1 faldt genereringstiden for en video på 81 billeder i 720p fra 4.769 til 18 sekunder på ét RTX 5090 kort – cirka 265 gange hurtigere i netop den test.
I en test med Wan 2.1 faldt genereringstiden for en video på 81 billeder i 720p fra 4.769 til 18 sekunder på ét RTX 5090 kort – cirka 265 gange hurtigere i netop den test. Den såkaldte »høj sparsitet fælde« opstår, når træningstabet bliver bedre, mens den færdige video står stille kvalitetsmæssigt eller bliver dårligere.
Der findes checkpoints til udvalgte Wan 2.1 og Wan 2.2 konfigurationer, men de understøtter forskellige sparsitetniveauer.