I en test med Wan 2.1 tok det 18 sekunder å lage en video på 81 bilder i 720p, mot 4 769 sekunder på én RTX 5090 – omtrent 265 ganger raskere i akkurat dette oppsettet. «Høy sparsitet fellen» beskriver hvordan treningsfeilen kan synke selv om den ferdige videoen stagnerer eller blir dårligere.
Publisert avRedigert med GPT-6 LunaBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion er et rammeverk med åpen kildekode som skal få Wan-modeller til å generere video raskere. Bak prosjektet står forskere fra Pekinguniversitetet, Tsinghua-universitetet og Alibaba. Metoden kombinerer sparsom oppmerksomhet, destillering til færre genereringstrinn og FP8-kjøring med sammenslåtte kjerner. 6
8
Prosjektet rapporterer opptil 265 ganger høyere hastighet i en bestemt Wan 2.1-test. Det er et resultat for en bestemt modell, oppløsning, video og maskinvare – ikke en garanti for tilsvarende fart i alle oppsett. 6
8
Videomodeller basert på diffusjon behandler store sekvenser av visuell informasjon, og oppmerksomhetsberegninger kan derfor kreve mye regnekraft. Sparsom oppmerksomhet kutter ned på hvor mange slike beregninger modellen gjør.
Forskerne beskriver imidlertid en fallgruve når sparsomheten blir svært høy: Treningsfeilen for hvert enkelt steg kan fortsette å synke, selv om den ferdige videoen ikke blir bedre – eller faktisk blir dårligere. Dette kaller de «høy-sparsitet-fellen». 18
SparkDiffusions foreslåtte løsning er å gå trinnvis fram: Først varmes den sparsomme modellen opp, slik at den lærer et grovt utgangspunkt. Deretter brukes destillering som retter seg mot hele genereringsforløpet og sluttresultatet, ikke bare feilen ved hvert enkelt steg. 8
SparkDiffusion prøver ikke å hente ut farten fra én enkelt optimalisering. Rammeverket kombinerer tre teknikker som reduserer ulike deler av jobben:
Fartsgevinsten kommer av at modellen gjør mindre oppmerksomhetsarbeid, bruker færre genereringstrinn og utfører det gjenværende arbeidet mer effektivt. Den kan derfor ikke tilskrives 97 prosent sparsomhet alene. 8
I en rapportert test med Wan 2.1 T2V 14B tok det 18 sekunder å generere en video på 81 bilder i 720p på én RTX 5090. Den opprinnelige tiden var 4 769 sekunder, som tilsvarer omtrent 265 ganger høyere hastighet. En sammenligning på H100 viser en reduksjon fra 1 757 til 8 sekunder, eller rundt 220 ganger. Dette er resultater fra bestemte tester og maskinvareoppsett. 6
Prosjektet rapporterer også omtrent 140 ganger høyere hastighet for en Wan 2.1-modell med 1,3 milliarder parametere i 480p. At tallet avviker fra 265-ganger-resultatet, understreker hvorfor modell og oppløsning må følge med når slike fartstall oppgis. 5
7
SparkDiffusion beskriver kvaliteten som sterk også ved høy sparsomhet. Men et fartstall alene viser ikke at alle videoer blir like gode på tvers av instruksjoner, oppløsninger eller modellvarianter. Høy-sparsitet-fellen illustrerer nettopp at en forbedring i et treningsmål for enkeltsteg ikke nødvendigvis gir et bedre sluttresultat. 8
18
Det er derfor tryggest å forstå påstandene om fart og kvalitet som knyttet til oppsettene som er testet. Benchmark-oppsummeringene som er tilgjengelige her, gir ikke grunnlag for å konkludere med at hver genererte video vil være på nivå med den vanlige, tette Wan-modellen.
De publiserte sjekkpunktene omfatter Wan 2.1 T2V 14B i 480p og 720p, samt Wan 2.2 T2V A14B i 480p. Støttet sparsomhet varierer mellom dem: Wan 2.1-sjekkpunktet for 480p støtter 90 prosent, mens oppførte 720p-varianter dekker opptil 95 eller 97 prosent. Wan 2.2-varianten for 480p dekker 90–95 prosent. Dermed støtter ikke alle de publiserte modellene 97 prosent sparsomhet. 9
10
11
12
Prosjektet presenterer SparkDiffusion som et rammeverk som kan brukes utover de Wan-modellene som er listet her. Kildene som foreligger, fastsetter imidlertid ingen tydelig tidsplan eller verifiserte resultater for framtidige modeller eller maskinvareoppsett. 8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
I en test med Wan 2.1 tok det 18 sekunder å lage en video på 81 bilder i 720p, mot 4 769 sekunder på én RTX 5090 – omtrent 265 ganger raskere i akkurat dette oppsettet.
I en test med Wan 2.1 tok det 18 sekunder å lage en video på 81 bilder i 720p, mot 4 769 sekunder på én RTX 5090 – omtrent 265 ganger raskere i akkurat dette oppsettet. «Høy sparsitet fellen» beskriver hvordan treningsfeilen kan synke selv om den ferdige videoen stagnerer eller blir dårligere.
SparkWan sjekkpunktene dekker utvalgte Wan 2.1 og Wan 2.2 oppsett, men støtter ulike nivåer av sparsomhet.