एक RTX 5090 पर 81 फ्रेम, 720p Wan 2.1 वीडियो बनाने का समय 4,769 सेकंड से घटकर 18 सेकंड बताया गया है—यह उस benchmark में करीब 265× की तेज़ी है। [6] SparkDiffusion sparse attention, कम generation steps और FP8 fused kernels को मिलाता है; तेज़ी का दावा इन बदलावों के संयुक्त असर पर आधारित है। [8] ‘High sparsity trap’ उस...
प्रकाशितकर्ताGPT-6 Luna से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Wan जैसे वीडियो जनरेशन मॉडल को तेज़ चलाना सिर्फ एक computation घटाने का मामला नहीं है। मॉडल को वीडियो के कई frames और उनके बीच के संबंधों पर काम करना पड़ता है, इसलिए लंबी clips में attention की गणना महँगी हो सकती है। SparkDiffusion इसी काम को कम करने के साथ-साथ generation के steps और हर step की लागत भी घटाने की कोशिश करता है।
बीजिंग विश्वविद्यालय, त्सिंगहुआ विश्वविद्यालय और Alibaba के शोधकर्ताओं का यह ओपन-सोर्स फ्रेमवर्क Wan 2.1 और Wan 2.2 जैसे वीडियो मॉडल के लिए बनाया गया है। 6
8 इसके तीन मुख्य हिस्से हैं: RoLA से sparse attention, CrossDistill से कम steps में generation, और FP8 fused kernels से तेज़ computation।
8
दिए गए benchmark में Wan 2.1 T2V 14B से 81-फ्रेम का 720p वीडियो बनाने में एक RTX 5090 पर समय 4,769 सेकंड से घटकर 18 सेकंड बताया गया—करीब 265× का अंतर। H100 के एक अन्य test में समय 1,757 सेकंड से 8 सेकंड हुआ, यानी लगभग 220× तेज़। 6
ये आंकड़े खास model, वीडियो और hardware configuration के लिए हैं; इन्हें हर computer या हर generation पर मिलने वाली गारंटी नहीं समझना चाहिए। Wan 2.1 के 1.3B मॉडल और 480p के एक अलग test में करीब 140× तेज़ी रिपोर्ट की गई है। 5
7
वीडियो diffusion मॉडल frames के बीच दृश्य जानकारी का हिसाब लगाने के लिए attention का इस्तेमाल करते हैं। Sparse attention में मॉडल सभी संभावित संबंधों की गणना करने के बजाय उनमें से एक छोटा हिस्सा चुनता है। इससे computation घट सकती है।
लेकिन शोधकर्ताओं ने बहुत अधिक sparsity पर एक समस्या देखी: training के दौरान हर step का loss कम होता रह सकता है, जबकि आखिर में बना वीडियो बेहतर होने के बजाय वैसा ही रहे या उसकी गुणवत्ता बिगड़ जाए। इसी विसंगति को “high-sparsity trap” कहा गया है। 8
18
SparkDiffusion का तरीका चरणबद्ध है: पहले sparse मॉडल को छोटा warm-up दिया जाता है, ताकि वह दृश्य का एक मोटा आधार सीख सके। इसके बाद distillation का इस्तेमाल generation trajectory और अंतिम output को सुधारने के लिए किया जाता है। 8
इसलिए 265× का दावा सिर्फ 97% sparsity से नहीं आता। विचार यह है कि कम attention गणना हो, कुल steps भी कम हों और हर step तेज़ चले। 8
परियोजना high-sparsity पर मजबूत visual quality बनाए रखने का दावा करती है। 8 लेकिन सिर्फ speed benchmark से यह साबित नहीं होता कि हर prompt, resolution या model variant में output dense Wan मॉडल जैसा ही होगा। High-sparsity trap की समस्या भी यही दिखाती है कि training का एक metric सुधरने से अंतिम वीडियो की गुणवत्ता अपने-आप बेहतर नहीं मानी जा सकती।
18
इसलिए उपलब्ध गुणवत्ता-संबंधी दावों को उन्हीं configurations तक सीमित समझना बेहतर है जिनका मूल्यांकन किया गया। दिए गए benchmark विवरणों से यह निष्कर्ष नहीं निकाला जा सकता कि हर generated वीडियो reference output से पूरी तरह मेल खाएगा।
दिए गए checkpoint listings में Wan 2.1 T2V 14B के 480p और 720p विकल्प, और Wan 2.2 T2V A14B का 480p विकल्प शामिल हैं। 9
10
11
12 इनके supported sparsity स्तर अलग-अलग हैं: उदाहरण के लिए, Wan 2.1 का 480p checkpoint 90% sparsity के लिए सूचीबद्ध है; 720p के कुछ विकल्प 95% या 97% तक जाते हैं; वहीं Wan 2.2 का सूचीबद्ध 480p विकल्प 90% से 95% तक समर्थन देता है।
9
10
11
12
इसलिए 97% sparsity को हर released checkpoint की सुविधा नहीं मानना चाहिए। परियोजना SparkDiffusion को Wan releases से आगे visual generation के लिए भी उपयोगी framework के रूप में पेश करती है, लेकिन उपलब्ध स्रोत भविष्य के मॉडल या hardware के लिए कोई पक्की समय-सीमा या सत्यापित नतीजे नहीं देते। 8
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
एक RTX 5090 पर 81 फ्रेम, 720p Wan 2.1 वीडियो बनाने का समय 4,769 सेकंड से घटकर 18 सेकंड बताया गया है—यह उस benchmark में करीब 265× की तेज़ी है। [6]
एक RTX 5090 पर 81 फ्रेम, 720p Wan 2.1 वीडियो बनाने का समय 4,769 सेकंड से घटकर 18 सेकंड बताया गया है—यह उस benchmark में करीब 265× की तेज़ी है। [6] SparkDiffusion sparse attention, कम generation steps और FP8 fused kernels को मिलाता है; तेज़ी का दावा इन बदलावों के संयुक्त असर पर आधारित है। [8]
‘High sparsity trap’ उस स्थिति को कहता है जब training loss घटता रहे, लेकिन तैयार वीडियो की गुणवत्ता ठहर जाए या बिगड़ने लगे। [8][18]