SparkDiffusion łączy rzadką uwagę, destylację do kilku kroków i jądra FP8. W jednym teście klip Wan 2.1 720p powstał w 18 sekund zamiast 4769 — na pojedynczej karcie RTX 5090.
Opublikowane przezEdytowane za pomocą GPT-6 LunaObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion to otwarty framework przyspieszający generowanie wideo za pomocą modeli Wan. Opracowali go badacze z Uniwersytetu Pekińskiego, Uniwersytetu Tsinghua i Alibaba. Łączy trzy techniki: rzadką uwagę, destylację modelu do niewielu kroków oraz skompilowane jądra obliczeniowe FP8. W konkretnym teście Wan 2.1 uzyskano nawet 265-krotne przyspieszenie, ale nie oznacza to, że każdy model, klip i zestaw sprzętowy będzie działać równie szybko. 6
8
Modele dyfuzyjne do generowania wideo przetwarzają długie sekwencje informacji wizualnych, a obliczanie uwagi jest kosztowne. Rzadka uwaga ogranicza liczbę analizowanych zależności między elementami sekwencji. Problem pojawia się przy bardzo wysokim poziomie rzadkości: lokalna strata treningowa może nadal spadać, choć końcowe wideo przestaje być lepsze albo wręcz traci jakość. 18
Badacze nazywają tę rozbieżność „pułapką wysokiej rzadkości”. Ich rozwiązanie jest etapowe: najpierw krótko dostrajają rzadki model, by nauczył się ogólnego zarysu, a następnie stosują destylację ukierunkowaną na poprawę końcowego przebiegu generowania. 8
SparkDiffusion optymalizuje różne części procesu, zamiast polegać na jednej sztuczce:
Przyspieszenie wynika z połączenia tych metod: model wykonuje mniej obliczeń uwagi, potrzebuje mniej kroków, a pozostałe obliczenia są realizowane sprawniej. Nie jest to efekt samego osiągnięcia 97-procentowej rzadkości. 8
W teście Wan 2.1 T2V 14B — modelu tworzącego wideo na podstawie tekstu — wygenerowanie klipu o długości 81 klatek w rozdzielczości 720p zajęło 18 sekund zamiast 4769 sekund na pojedynczej karcie RTX 5090. To około 265 razy szybciej. W porównaniu na karcie H100 czas spadł z 1757 do 8 sekund, czyli około 220 razy. Są to wyniki dla opisanych konfiguracji sprzętu i modelu, a nie gwarancja podobnego przyspieszenia w innych warunkach. 6
Projekt podaje też około 140-krotne przyspieszenie dla Wan 2.1 1.3B w rozdzielczości 480p. Różne wyniki pokazują, dlaczego warto sprawdzać nie tylko nagłówek, ale też konkretny model i rozdzielczość użyte w teście. 5
7
Twórcy projektu deklarują, że SparkDiffusion zachowuje wysoką jakość obrazu przy dużej rzadkości uwagi. Sama szybkość nie dowodzi jednak, że jakość będzie taka sama dla każdego promptu, modelu i rozdzielczości. Opisana przez badaczy pułapka wysokiej rzadkości pokazuje zresztą, że poprawa lokalnej miary treningowej nie musi oznaczać lepszego końcowego filmu. 8
18
Dlatego wyniki dotyczące szybkości i jakości należy odnosić do przetestowanych konfiguracji. Dostępne podsumowania benchmarków nie wystarczają, by stwierdzić, że każde wygenerowane wideo dorówna gęstemu modelowi Wan.
Udostępnione checkpointy obejmują Wan 2.1 T2V 14B w rozdzielczościach 480p i 720p oraz Wan 2.2 T2V A14B w 480p. Obsługiwany poziom rzadkości zależy od checkpointu: wariant Wan 2.1 480p wymienia 90%, wybrane warianty 720p — do 95% lub 97%, a Wan 2.2 480p — od 90% do 95%. Nie należy więc zakładać, że każdy udostępniony model obsługuje 97-procentową rzadkość. 9
10
11
12
Projekt przedstawia SparkDiffusion jako rozwiązanie, które można rozwijać poza wymienione modele Wan. Dostępne źródła nie potwierdzają jednak konkretnego harmonogramu ani wyników dla przyszłych modeli czy sprzętu. 8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SparkDiffusion łączy rzadką uwagę, destylację do kilku kroków i jądra FP8. W jednym teście klip Wan 2.1 720p powstał w 18 sekund zamiast 4769 — na pojedynczej karcie RTX 5090.
SparkDiffusion łączy rzadką uwagę, destylację do kilku kroków i jądra FP8. W jednym teście klip Wan 2.1 720p powstał w 18 sekund zamiast 4769 — na pojedynczej karcie RTX 5090. „Pułapka wysokiej rzadkości” oznacza, że strata treningowa może maleć, choć jakość gotowego wideo przestaje się poprawiać lub się pogarsza.
Udostępnione checkpointy obejmują wybrane konfiguracje Wan 2.1 i Wan 2.2, ale obsługują różne poziomy rzadkości i liczbę kroków.