SparkDiffusion yhdistää harvennetun huomion, muutamaan generointivaiheeseen tislaamisen ja FP8 ytimet. ”Korkean harvennuksen ansa” tarkoittaa, että koulutuksen askelkohtainen häviö voi pienentyä samalla, kun lopullisen videon laatu pysähtyy tai heikkenee.
JulkaisijaMuokattu mallilla GPT-6 LunaKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion on Pekingin yliopiston, Tsinghuan yliopiston ja Alibaban tutkijoiden kehittämä avoimen lähdekoodin kehys Wan-videomallien nopeuttamiseen. Se yhdistää harvennetun huomion, harvaan generointiin tarkoitetun tislausmenetelmän ja FP8-laskennan. Tekijät raportoivat yhdessä Wan 2.1 -testissä jopa 265-kertaisesta nopeutuksesta – lukua ei pidä tulkita yleiseksi lupaukseksi kaikille malleille, videoille tai laitteille. 6
8
Videodiffuusiomallit käsittelevät pitkiä ruutu- ja aikajaksoja, joten huomio eli attention voi viedä paljon laskentatehoa. Harvennettu huomio vähentää mallin laskemia vuorovaikutuksia. Mutta SparkDiffusionin tutkijoiden kuvaamassa ääritilanteessa koulutuksen askelkohtainen häviö voi pienentyä, vaikka valmis video ei enää parane – tai sen laatu jopa heikkenee. 18
Tätä ristiriitaa kutsutaan ”korkean harvennuksen ansaksi”. SparkDiffusionin ratkaisu etenee vaiheittain: ensin harvennettu malli lämmitetään oppimaan karkea lähtömalli, minkä jälkeen tislausmenetelmä pyrkii korjaamaan generoinnin lopputulosta ja kehityskulkua. 8
SparkDiffusion pyrkii vähentämään työn määrää prosessin eri kohdissa sen sijaan, että se luottaisi yhteen optimointiin.
Kokonaisnopeutus syntyy keinojen yhdistelmästä: huomiossa lasketaan vähemmän, generointivaiheita tarvitaan vähemmän ja jäljellä oleva laskenta suoritetaan nopeammin. Tulosta ei siis voi selittää pelkällä 97 prosentin harvennuksella. 8
Raportoidussa Wan 2.1 T2V 14B -testissä luotiin 81 ruudun 720p-video. Yhdellä RTX 5090 -näytönohjaimella generointiaika putosi 4 769 sekunnista 18 sekuntiin eli noin 265-kertaiseksi nopeutukseksi. H100-laitteella ilmoitettu vertailu putosi 1 757 sekunnista kahdeksaan sekuntiin, mikä vastaa noin 220-kertaista nopeutusta. Nämä ovat tiettyjen mallien ja laitteiden testituloksia, eivät takuita muista käyttötapauksista. 6
Wan 2.1 1.3B -mallille ja 480p-tarkkuudelle ilmoitetaan noin 140-kertainen nopeutus. Tulos havainnollistaa, miksi suuri nopeusluku kannattaa aina lukea yhdessä testatun mallin ja kuvatarkkuuden kanssa. 5
7
Projektin mukaan SparkDiffusion säilyttää hyvän visuaalisen laadun myös voimakkaasti harvennetuissa asetuksissa. Pelkkä nopeusluku ei kuitenkaan osoita, että laatu olisi sama kaikilla kehotteilla, tarkkuuksilla tai malliversioilla. Korkean harvennuksen ansa itsessään muistuttaa, ettei koulutuksen askelkohtaisen mittarin paraneminen välttämättä tarkoita paremmin onnistunutta lopullista videota. 8
18
Siksi nopeus- ja laatulupaukset kannattaa rajata niihin kokoonpanoihin, joita on arvioitu. Käytettävissä olevat testiyhteenvedot eivät riitä osoittamaan, että jokainen tuotettu video vastaisi tiheää Wan-mallia.
Julkaistujen mallipainojen joukossa on Wan 2.1 T2V 14B -kokoonpanoja 480p- ja 720p-tarkkuudelle sekä Wan 2.2 T2V A14B 480p -kokoonpano. Tuetut harvennustasot vaihtelevat: esimerkiksi Wan 2.1:n 480p-malli tukee 90 prosentin harvennusta, kun taas julkaistut 720p-versiot kattavat enintään 95 tai 97 prosenttia. Wan 2.2:n 480p-versio kattaa 90–95 prosenttia. Näin ollen 97 prosentin harvennus ei ole käytettävissä kaikissa julkaistuissa malleissa. 9
10
11
12
Hankkeen tekijät esittelevät SparkDiffusionia myös Wan-julkaisujen ulkopuolelle soveltuvana kehyksenä. Käytettävissä olevat lähteet eivät kuitenkaan vahvista tulevien mallien tai laitteiden aikataulua tai testituloksia. 8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SparkDiffusion yhdistää harvennetun huomion, muutamaan generointivaiheeseen tislaamisen ja FP8 ytimet.
SparkDiffusion yhdistää harvennetun huomion, muutamaan generointivaiheeseen tislaamisen ja FP8 ytimet. ”Korkean harvennuksen ansa” tarkoittaa, että koulutuksen askelkohtainen häviö voi pienentyä samalla, kun lopullisen videon laatu pysähtyy tai heikkenee.
Julkaistut SparkWan mallit kattavat valikoituja Wan 2.1 ja Wan 2.2 kokoonpanoja, mutta niiden tukemat harvennustasot vaihtelevat.