Dalam uji video Wan 2.1 berdurasi 81 frame pada 720p, waktu pembuatan dilaporkan turun dari 4.769 detik menjadi 18 detik pada satu RTX 5090—sekitar 265 kali lebih cepat untuk konfigurasi tersebut. SparkDiffusion menggabungkan perhatian jarang, distilasi beberapa langkah, dan kernel FP8; kenaikan kecepatan bukan hasi...
Diterbitkan olehDiedit dengan GPT-6 LunaGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion adalah kerangka sumber terbuka untuk mempercepat model video Wan, yang dikembangkan oleh peneliti dari Universitas Peking, Universitas Tsinghua, dan Alibaba. Kerangka ini memadukan perhatian jarang (sparse attention), distilasi agar model bekerja dalam lebih sedikit langkah, serta kernel gabungan berpresisi FP8. 6
8
Angka yang paling mencolok datang dari uji Wan 2.1 T2V 14B: pembuatan video 81 frame pada resolusi 720p dilaporkan turun dari 4.769 detik menjadi 18 detik menggunakan satu RTX 5090—sekitar 265 kali lebih cepat. Itu hasil untuk model, resolusi, dan perangkat yang diuji, bukan janji bahwa setiap proses pembuatan video akan mendapat percepatan serupa. 6
Model difusi video memproses rangkaian informasi visual yang panjang, sehingga perhitungan perhatian (attention) dapat memakan banyak komputasi. Perhatian jarang mengurangi jumlah interaksi yang perlu dihitung. Namun, tim SparkDiffusion mengidentifikasi masalah saat tingkat sparsitas dibuat sangat tinggi: loss pelatihan untuk tiap langkah bisa terus turun, sementara kualitas video akhir tidak membaik atau justru merosot. 18
Ketidaksesuaian antara metrik pelatihan dan hasil video akhir ini disebut “perangkap sparsitas tinggi”. Pendekatan SparkDiffusion dilakukan bertahap: model sparse lebih dulu menjalani pemanasan singkat untuk membentuk prior kasar, lalu distilasi diarahkan untuk mengoreksi lintasan generasi hingga hasil akhirnya. 8
SparkDiffusion menyasar beberapa bagian proses generasi sekaligus, alih-alih mengandalkan satu optimasi saja:
Dengan kata lain, percepatan berasal dari gabungan lebih sedikit komputasi perhatian, lebih sedikit langkah generasi, dan eksekusi yang lebih cepat. Angka tersebut tidak bisa dijelaskan oleh sparsitas 97% saja. 8
Selain uji RTX 5090, perbandingan yang dilaporkan untuk H100 menunjukkan waktu pembuatan turun dari 1.757 detik menjadi 8 detik—sekitar 220 kali lebih cepat. Untuk Wan 2.1 1.3B pada 480p, proyek juga melaporkan percepatan sekitar 140 kali. Semua angka ini berlaku untuk tolok ukur dan konfigurasi tertentu, bukan untuk setiap model, resolusi, atau perangkat keras. 5
6
7
Soal kualitas, proyek menyatakan SparkDiffusion mempertahankan kualitas visual yang kuat pada tingkat sparsitas tinggi. Namun, angka kecepatan saja tidak membuktikan bahwa semua video akan setara dengan keluaran model Wan tanpa optimasi. Perangkap sparsitas tinggi juga menunjukkan bahwa metrik pelatihan yang membaik belum tentu berarti hasil akhir ikut membaik. Klaim kualitas sebaiknya dibaca sebagai hasil pada konfigurasi yang dievaluasi, bukan jaminan untuk semua prompt dan kondisi. 8
18
Daftar checkpoint yang diberikan mencakup Wan 2.1 T2V 14B pada 480p dan 720p, serta Wan 2.2 T2V A14B pada 480p. Rentang sparsitasnya berbeda-beda: checkpoint Wan 2.1 480p yang tercantum mendukung 90%, sementara varian 720p mencakup hingga 95% atau 97%. Untuk Wan 2.2 480p, rentangnya 90% hingga 95%. Jadi, dukungan sparsitas 97% tidak berlaku untuk semua checkpoint. 9
10
11
12
SparkDiffusion juga diperkenalkan sebagai kerangka yang berpotensi diperluas ke model visual lain. Namun, informasi yang tersedia belum memastikan jadwal maupun hasil terverifikasi untuk model atau perangkat keras tambahan. 8
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Dalam uji video Wan 2.1 berdurasi 81 frame pada 720p, waktu pembuatan dilaporkan turun dari 4.769 detik menjadi 18 detik pada satu RTX 5090—sekitar 265 kali lebih cepat untuk konfigurasi tersebut.
Dalam uji video Wan 2.1 berdurasi 81 frame pada 720p, waktu pembuatan dilaporkan turun dari 4.769 detik menjadi 18 detik pada satu RTX 5090—sekitar 265 kali lebih cepat untuk konfigurasi tersebut. SparkDiffusion menggabungkan perhatian jarang, distilasi beberapa langkah, dan kernel FP8; kenaikan kecepatan bukan hasil dari tingkat sparsitas saja.
“Perangkap sparsitas tinggi” terjadi ketika loss pelatihan per langkah terus membaik, tetapi kualitas video akhir stagnan atau menurun.