SparkDiffusion menggabungkan perhatian jarang, penyulingan beberapa langkah dan kernel FP8. “Perangkap sparsiti tinggi” merujuk keadaan apabila kehilangan latihan bagi setiap langkah terus menurun, tetapi kualiti video akhir tidak bertambah baik atau merosot.
Diterbitkan olehDisunting dengan GPT-6 LunaImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion ialah rangka kerja sumber terbuka untuk mempercepat model video Wan, dibangunkan oleh penyelidik dari Universiti Peking, Universiti Tsinghua dan Alibaba. Ia menggabungkan perhatian jarang, penyulingan kepada beberapa langkah dan kernel gabungan FP8. Pasukan projek melaporkan penjanaan sehingga 265 kali lebih pantas dalam satu penanda aras khusus Wan 2.1—bukan jaminan bahawa semua model, video atau perkakasan akan mencapai kelajuan yang sama. 6
8
Model resapan video memproses urutan maklumat visual yang panjang, jadi operasi perhatian boleh menelan banyak pengiraan. Perhatian jarang mengurangkan bilangan interaksi yang perlu dikira. Namun, penyelidik SparkDiffusion mengenal pasti satu masalah apabila sparsiti dibuat terlalu tinggi: kehilangan latihan bagi setiap langkah boleh terus menurun, sedangkan video akhir tidak bertambah baik atau malah merosot. 18
Percanggahan antara ukuran latihan dengan hasil video itulah yang dinamakan “perangkap sparsiti tinggi”. Penyelesaian yang dicadangkan dibuat secara berperingkat: model jarang terlebih dahulu melalui latihan pemanasan ringkas untuk membentuk gambaran kasar, kemudian disuling supaya trajektori penjanaan akhir dapat diperbetulkan. 8
SparkDiffusion menyasarkan beberapa bahagian proses penjanaan, bukannya bergantung pada satu pengoptimuman sahaja:
Kelajuan keseluruhan datang daripada gabungan ketiga-tiganya: kurang pengiraan perhatian, lebih sedikit langkah penjanaan dan pelaksanaan yang lebih pantas bagi kerja yang masih perlu dibuat. Dakwaan pecutan itu bukan hasil sparsiti 97% semata-mata. 8
Bagi ujian Wan 2.1 T2V 14B yang menghasilkan video 81 bingkai pada 720p, masa penjanaan dilaporkan turun daripada 4,769 saat kepada 18 saat menggunakan satu RTX 5090—kira-kira 265 kali lebih pantas. Perbandingan yang dilaporkan pada H100 pula turun daripada 1,757 saat kepada 8 saat, atau sekitar 220 kali. Angka ini merujuk penanda aras dan perkakasan tertentu, bukan hasil yang dijamin untuk tetapan lain. 6
Rangka kerja itu turut melaporkan pecutan kira-kira 140 kali bagi ujian Wan 2.1 1.3B pada 480p. Perbezaan ini menunjukkan sebab angka utama perlu dibaca bersama model dan resolusi yang diuji. 5
7
Projek tersebut menyatakan SparkDiffusion mengekalkan kualiti visual yang baik walaupun pada tahap sparsiti tinggi. Namun, angka kelajuan sahaja tidak membuktikan kualiti setara bagi semua arahan, resolusi atau varian model. “Perangkap sparsiti tinggi” sendiri menunjukkan bahawa penambahbaikan ukuran latihan bagi setiap langkah tidak semestinya menghasilkan video akhir yang lebih baik. 8
18
Jadi, dakwaan kelajuan dan kualiti wajar dianggap khusus kepada konfigurasi yang dinilai. Ringkasan penanda aras yang tersedia tidak memberikan butiran mencukupi untuk menyimpulkan bahawa setiap video yang dijana akan menyamai rujukan Wan tanpa sparsiti.
Senarai checkpoint yang diberikan merangkumi Wan 2.1 T2V 14B pada 480p dan 720p, serta Wan 2.2 T2V A14B pada 480p. Julat sparsiti yang disokong berbeza mengikut checkpoint. Contohnya, checkpoint Wan 2.1 480p yang disenaraikan menyokong sparsiti 90%; varian 720p yang disenaraikan pula meliputi sehingga 95% atau 97%. Senarai Wan 2.2 480p meliputi 90% hingga 95%. Maka, tetapan 97% bukan tersedia untuk setiap checkpoint yang dikeluarkan. 9
10
11
12
Projek ini membentangkan SparkDiffusion sebagai rangka kerja yang berpotensi digunakan melangkaui keluaran Wan yang disenaraikan. Namun, sumber yang tersedia tidak menetapkan jadual khusus atau mengesahkan keputusan bagi model atau perkakasan masa depan. 8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SparkDiffusion menggabungkan perhatian jarang, penyulingan beberapa langkah dan kernel FP8.
SparkDiffusion menggabungkan perhatian jarang, penyulingan beberapa langkah dan kernel FP8. “Perangkap sparsiti tinggi” merujuk keadaan apabila kehilangan latihan bagi setiap langkah terus menurun, tetapi kualiti video akhir tidak bertambah baik atau merosot.
Checkpoint SparkWan yang disenaraikan meliputi konfigurasi terpilih Wan 2.1 dan Wan 2.2, dengan tahap sparsiti yang berbeza beza.