SparkDiffusion spojuje řídkou pozornost, destilaci do několika kroků a optimalizované výpočty FP8. Takzvaná „past vysoké řídkosti“ popisuje situaci, kdy se trénovací ztráta zlepšuje, ale výsledné video se už nezlepšuje, případně se jeho kvalita zhorší.
PublikovalUpraveno pomocí GPT-6 LunaObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion je open-source framework pro zrychlení video modelů Wan, který připravili výzkumníci z Pekingské univerzity, univerzity Tsinghua a Alibaby. Spojuje tři přístupy: omezuje výpočty pozornosti, zmenšuje počet kroků při generování a zrychluje zbývající výpočty pomocí FP8 a sloučených výpočetních operací. 6
8
Tým uvádí až 265násobné zrychlení v konkrétním testu Wan 2.1. Nejde ale o obecnou záruku pro každé video, model ani grafickou kartu.
Video modely založené na difuzi zpracovávají dlouhé posloupnosti obrazových informací. Významnou část výpočtů přitom zabírá pozornost — mechanismus, který modelu pomáhá určovat, jak spolu jednotlivé části vstupu souvisejí. Řídká pozornost omezí počet těchto interakcí, a tím i množství práce.
Při příliš vysoké míře řídkosti však může nastat problém: ztráta měřená během jednotlivých kroků trénování dál klesá, zatímco výsledné video se přestane zlepšovat, nebo se jeho kvalita dokonce zhorší. Právě tento nesoulad výzkumníci označují jako „past vysoké řídkosti“. 18
SparkDiffusion na ni reaguje postupně: nejprve řídký model krátce zahřívá, aby si vytvořil hrubý základ, a následně pomocí destilace upravuje průběh generování s ohledem na konečný výsledek. 8
Framework nezrychluje generování jedinou úpravou. Kombinuje několik změn, z nichž každá omezuje jinou část výpočetní zátěže:
Výsledné zrychlení tedy vzniká jejich kombinací: model počítá méně interakcí, provede méně kroků a zbytek práce vykoná rychleji. Nelze je připsat samotné 97% řídkosti pozornosti. 8
V testu s Wan 2.1 T2V 14B — modelem pro tvorbu videa z textu — trvala generace 81 snímků v rozlišení 720p na jedné grafické kartě RTX 5090 podle uvedených výsledků 18 sekund místo 4 769 sekund. To odpovídá zhruba 265násobnému zrychlení. U testu na H100 klesl uváděný čas z 1 757 sekund na 8 sekund, tedy přibližně 220násobně. 6
Pro menší model Wan 2.1 s 1,3 miliardy parametrů a rozlišením 480p se uvádí zrychlení přibližně 140×. Rozdílné výsledky připomínají, že samotný násobek nedává smysl bez znalosti modelu, rozlišení a použitého hardwaru. 5
7
Jde o výsledky konkrétních benchmarků, nikoli o příslib, že se stejně zrychlí každá úloha. Výzkumníci uvádějí, že si metoda při vysoké řídkosti zachovává dobrou vizuální kvalitu, ale samotné časové údaje nepotvrzují shodu s původním modelem u všech zadání, rozlišení nebo variant. 8
Mezi zveřejněnými kontrolními body jsou Wan 2.1 T2V 14B v rozlišení 480p i 720p a Wan 2.2 T2V A14B v rozlišení 480p. Liší se ale podporovanou mírou řídkosti: uvedená varianta Wan 2.1 480p podporuje 90 %, zatímco varianty 720p sahají až k 95 % nebo 97 %. U Wan 2.2 480p je uvedeno rozmezí 90–95 %. Hodnota 97 % tedy není dostupná pro každý zveřejněný kontrolní bod. 9
10
11
12
Projekt popisuje SparkDiffusion jako framework, který lze rozvíjet i pro další modely. Dostupné podklady však nepotvrzují konkrétní harmonogram rozšíření ani výsledky pro budoucí modely či hardware. 8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SparkDiffusion spojuje řídkou pozornost, destilaci do několika kroků a optimalizované výpočty FP8.
SparkDiffusion spojuje řídkou pozornost, destilaci do několika kroků a optimalizované výpočty FP8. Takzvaná „past vysoké řídkosti“ popisuje situaci, kdy se trénovací ztráta zlepšuje, ale výsledné video se už nezlepšuje, případně se jeho kvalita zhorší.
Uvolněné kontrolní body SparkWan pokrývají vybrané konfigurace Wan 2.1 a Wan 2.2.