SparkDiffusion ผสาน sparse attention, การกลั่นโมเดลให้สร้างวิดีโอในไม่กี่ขั้น และเคอร์เนล FP8 โดยการทดสอบหนึ่งรายงานว่า วิดีโอ Wan 2.1 ความละเอียด 720p ใช้เวลา 18 วินาที แทน 4,769 วินาทีบน RTX 5090 เครื่องเดียว หรือเร... “กับดักความเบาบางสูง” คือกรณีที่ loss ระหว่างฝึกยังลดลง แต่คุณภาพวิดีโอที่สร้างเสร็จกลับไม่ดีขึ้...
เผยแพร่โดยแก้ไขด้วย GPT-6 Lunaรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion เป็นเฟรมเวิร์กโอเพนซอร์สสำหรับเร่งโมเดลสร้างวิดีโอ Wan พัฒนาโดยนักวิจัยจากมหาวิทยาลัยปักกิ่ง มหาวิทยาลัยชิงหัว และอาลีบาบา จุดเด่นคือไม่ได้พึ่งการปรับแต่งอย่างใดอย่างหนึ่ง แต่รวมการลดงานคำนวณด้าน attention การลดจำนวนขั้นตอนสร้างวิดีโอ และการเร่งการประมวลผลเข้าด้วยกัน 6
8
ตัวเลขที่เป็นข่าวคือการทดสอบกับ Wan 2.1 T2V 14B ซึ่งสร้างวิดีโอ 81 เฟรม ความละเอียด 720p ได้ใน 18 วินาที จากเดิม 4,769 วินาที บน RTX 5090 เครื่องเดียว คิดเป็นความเร็วประมาณ 265 เท่า อย่างไรก็ตาม นี่เป็นผลจากชุดทดสอบและฮาร์ดแวร์ที่ระบุ ไม่ใช่คำรับประกันว่าจะเร็วขึ้นเท่านี้กับทุกโมเดลหรือทุกงาน 6
โมเดลสร้างวิดีโอแบบ diffusion ต้องประมวลผลข้อมูลภาพจำนวนมากที่เชื่อมโยงกันทั้งในแต่ละเฟรมและตลอดลำดับวิดีโอ การทำ attention แบบ sparse หรือ “เบาบาง” ช่วยลดจำนวนความสัมพันธ์ที่โมเดลต้องคำนวณ จึงอาจลดภาระการประมวลผลได้มาก
แต่การลดการคำนวณลงมากเกินไปมีความเสี่ยง นักวิจัยเรียกปัญหานี้ว่า “กับดักความเบาบางสูง”: แม้ค่า loss ที่ใช้ติดตามการฝึกในแต่ละขั้นจะลดลง คุณภาพของวิดีโอเมื่อสร้างเสร็จอาจหยุดพัฒนา หรือแย่ลงได้ 18
SparkDiffusion เสนอให้ฝึกเป็นช่วง เริ่มจากปรับโมเดล sparse ในระยะสั้นเพื่อสร้างพื้นฐานภาพรวม แล้วจึงใช้การกลั่นโมเดลที่มุ่งปรับแนวทางการสร้างจนถึงผลลัพธ์สุดท้าย แทนที่จะอาศัยสัญญาณการฝึกเฉพาะรายขั้นเพียงอย่างเดียว 8
ความเร็วที่เพิ่มขึ้นจึงมาจากการทำงานร่วมกันของทั้งสามส่วน ได้แก่ คำนวณ attention น้อยลง ใช้ขั้นตอนสร้างน้อยลง และทำแต่ละขั้นได้เร็วขึ้น ไม่ใช่ผลจาก sparsity 97% เพียงอย่างเดียว 8
นอกจากผลทดสอบ Wan 2.1 T2V 14B บน RTX 5090 แล้ว ยังมีการรายงานผลบน H100 ซึ่งลดเวลาจาก 1,757 วินาทีเหลือ 8 วินาที หรือเร็วขึ้นประมาณ 220 เท่า ส่วนกรณี Wan 2.1 รุ่น 1.3B ที่ความละเอียด 480p มีรายงานความเร็วเพิ่มขึ้นราว 140 เท่า 5
6
7
ตัวเลขเหล่านี้ช่วยให้เห็นศักยภาพของวิธีดังกล่าว แต่ควรอ่านควบคู่กับรุ่นโมเดล ความละเอียด และฮาร์ดแวร์ที่ใช้ทดสอบ เพราะผลจากงานหนึ่งไม่ได้ยืนยันว่าจะได้ความเร็วเท่ากันในเงื่อนไขอื่น
ด้านคุณภาพ โครงการระบุว่าสามารถรักษาคุณภาพภาพได้ดีแม้ใช้ sparsity สูง แต่ตัวเลขความเร็วอย่างเดียวไม่เพียงพอจะยืนยันว่าผลลัพธ์จะเทียบเท่า Wan รุ่นปกติสำหรับทุกพรอมป์ต์ ทุกความละเอียด หรือทุกรุ่นของโมเดล และแนวคิดเรื่องกับดักความเบาบางสูงเองก็ชี้ให้เห็นว่า loss ระหว่างฝึกที่ดีขึ้นไม่ได้แปลว่าวิดีโอสุดท้ายจะดีขึ้นเสมอไป 8
18
รายการที่เผยแพร่มี checkpoint สำหรับ Wan 2.1 T2V 14B ที่ความละเอียด 480p และ 720p รวมถึง Wan 2.2 T2V A14B ที่ 480p แต่ระดับ sparsity ที่รองรับแตกต่างกันไป เช่น รุ่น Wan 2.1 480p ที่ระบุรองรับ 90% ส่วนรายการ Wan 2.1 720p มีรุ่นที่รองรับได้ถึง 95% หรือ 97% และ Wan 2.2 480p ระบุช่วง 90–95% 9
10
11
12
ดังนั้น ก่อนประเมินว่าจะนำไปใช้กับงานใด ควรตรวจสอบ checkpoint และการตั้งค่าของรุ่นนั้นโดยตรง ส่วนการขยายไปยังโมเดลหรือฮาร์ดแวร์อื่นยังไม่มีข้อมูลในแหล่งที่อ้างถึงนี้เพียงพอจะยืนยันกำหนดการหรือผลทดสอบที่ชัดเจน 8
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
SparkDiffusion ผสาน sparse attention, การกลั่นโมเดลให้สร้างวิดีโอในไม่กี่ขั้น และเคอร์เนล FP8 โดยการทดสอบหนึ่งรายงานว่า วิดีโอ Wan 2.1 ความละเอียด 720p ใช้เวลา 18 วินาที แทน 4,769 วินาทีบน RTX 5090 เครื่องเดียว หรือเร...
SparkDiffusion ผสาน sparse attention, การกลั่นโมเดลให้สร้างวิดีโอในไม่กี่ขั้น และเคอร์เนล FP8 โดยการทดสอบหนึ่งรายงานว่า วิดีโอ Wan 2.1 ความละเอียด 720p ใช้เวลา 18 วินาที แทน 4,769 วินาทีบน RTX 5090 เครื่องเดียว หรือเร... “กับดักความเบาบางสูง” คือกรณีที่ loss ระหว่างฝึกยังลดลง แต่คุณภาพวิดีโอที่สร้างเสร็จกลับไม่ดีขึ้นหรือแย่ลง SparkDiffusion จึงใช้การฝึกเป็นช่วงและการกลั่นที่มุ่งแก้แนวทางการสร้างผลลัพธ์ [8][18]
มีการเผยแพร่ checkpoint สำหรับ Wan 2.1 และ Wan 2.2 บางรุ่น โดยแต่ละรุ่นรองรับระดับ sparsity ไม่เท่ากัน จึงไม่ควรเหมารวมว่าทุกรุ่นทำ sparsity ได้ถึง 97% [9][10][11][12]