In un test su un video Wan 2.1 a 720p di 81 fotogrammi, la generazione è scesa da 4.769 a 18 secondi su una RTX 5090: circa 265 volte più veloce in quella configurazione. Il framework affronta la «trappola dell’alta sparsità»: la perdita misurata durante l’addestramento può migliorare mentre il video finale smette d...
Pubblicato daModificato con GPT-6 LunaImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion è un framework open source per accelerare i modelli video Wan sviluppato da ricercatori della Peking University, della Tsinghua University e di Alibaba. Combina attenzione sparsa, distillazione in pochi passaggi e kernel FP8 ottimizzati. Il progetto riporta un’accelerazione fino a 265 volte in uno specifico benchmark con Wan 2.1: non è una promessa valida per qualsiasi modello, video o hardware. 6
8
I modelli di diffusione video elaborano lunghe sequenze di informazioni visive, e il calcolo dell’attenzione può richiedere molte risorse. L’attenzione sparsa riduce il numero di interazioni che il modello deve calcolare. Ma spingerla al massimo può creare un problema: la perdita misurata durante l’addestramento può continuare a diminuire mentre la qualità del video finito si blocca o peggiora. 18
È questo il fenomeno che i ricercatori chiamano «trappola dell’alta sparsità»: una metrica di addestramento apparentemente migliore non garantisce un risultato finale migliore. La risposta proposta da SparkDiffusion procede per fasi: prima un breve riscaldamento del modello sparso, per costruire una rappresentazione iniziale, poi una distillazione orientata a correggere la traiettoria e il risultato finale della generazione. 8
SparkDiffusion interviene su più parti del processo, invece di affidarsi a una singola ottimizzazione:
Il vantaggio complessivo deriva dalla combinazione: meno calcoli di attenzione, meno passaggi di generazione e un’esecuzione più rapida del lavoro rimanente. Non è corretto attribuire l’intero guadagno al solo 97% di sparsità. 8
Nel test riportato per Wan 2.1 T2V 14B, la generazione di un video di 81 fotogrammi a 720p scende da 4.769 a 18 secondi su una singola RTX 5090: circa 265 volte più veloce. Nel confronto riportato su H100, il tempo passa da 1.757 a 8 secondi, circa 220 volte più veloce. Si tratta di risultati riferiti a specifici benchmark e configurazioni hardware, non di garanzie per altri carichi di lavoro. 6
Il progetto riporta anche un’accelerazione di circa 140 volte per Wan 2.1 1.3B a 480p. Il confronto fra i due risultati mostra perché è importante considerare modello e risoluzione insieme al numero in evidenza. 5
7
SparkDiffusion dichiara di mantenere una forte qualità visiva anche con livelli elevati di sparsità. Tuttavia, un dato sulla velocità non dimostra che la qualità sia identica per ogni prompt, risoluzione o variante del modello. La stessa trappola dell’alta sparsità evidenzia che migliorare una metrica locale durante l’addestramento non significa necessariamente migliorare il video finale. 8
18
È quindi più prudente considerare le affermazioni su velocità e qualità come riferite alle configurazioni valutate. Le sintesi dei benchmark disponibili non bastano per concludere che ogni video generato equivalga al risultato del Wan denso di riferimento.
I checkpoint pubblicati includono Wan 2.1 T2V 14B a 480p e 720p e Wan 2.2 T2V A14B a 480p. I livelli di sparsità supportati variano: il checkpoint Wan 2.1 a 480p arriva al 90%, mentre le versioni elencate a 720p arrivano al 95% o al 97%; il checkpoint Wan 2.2 a 480p copre dal 90% al 95%. Il 97%, quindi, non è disponibile per ogni checkpoint. 9
10
11
12
Il progetto presenta SparkDiffusion come un framework potenzialmente estendibile oltre le versioni Wan già elencate. Le fonti disponibili, però, non indicano una scadenza precisa né risultati verificati per futuri modelli o hardware. 8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
In un test su un video Wan 2.1 a 720p di 81 fotogrammi, la generazione è scesa da 4.769 a 18 secondi su una RTX 5090: circa 265 volte più veloce in quella configurazione.
In un test su un video Wan 2.1 a 720p di 81 fotogrammi, la generazione è scesa da 4.769 a 18 secondi su una RTX 5090: circa 265 volte più veloce in quella configurazione. Il framework affronta la «trappola dell’alta sparsità»: la perdita misurata durante l’addestramento può migliorare mentre il video finale smette di migliorare o peggiora.
RoLA, CrossDistill e kernel FP8 riducono rispettivamente il lavoro di attenzione, il numero di passaggi e il costo di ciascun passaggio; i checkpoint disponibili supportano livelli di sparsità diversi.