SparkDiffusion משלבת קשב דליל, זיקוק למספר קטן של צעדי יצירה וליבות FP8. בבדיקת Wan 2.1 מסוימת, יצירת סרטון 720p בן 81 פריימים ארכה 18 שניות במקום 4,769 שניות בכרטיס RTX 5090 יחיד — האצה של בערך פי 265.
פורסם על ידינערך באמצעות GPT-6 Lunaהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion היא מסגרת האצה בקוד פתוח למודלי הווידאו Wan של Alibaba, שפותחה בידי חוקרים מאוניברסיטת פקינג, אוניברסיטת טסינגהואה ו-Alibaba. היא משלבת קשב דליל, זיקוק למספר קטן של צעדי יצירה וליבות חישוב FP8. הצוות מדווח על האצה של עד פי 265 בבדיקת Wan 2.1 מסוימת — לא על שיפור מובטח בכל מודל, סרטון או מערכת מחשב. 6
8
מודלי דיפוזיה לווידאו מעבדים רצפים ארוכים של מידע חזותי, וחישובי הקשב — שמסייעים למודל לקשר בין חלקים שונים ברצף — דורשים משאבים רבים. SparkDiffusion מצמצמת את החישובים האלה, מפחיתה את מספר צעדי היצירה ומייעלת את החישוב שנותר.
קשב דליל מאפשר למודל לחשב רק חלק מהאינטראקציות האפשריות. אלא שלפי החוקרים, כשמצמצמים את החישובים באופן קיצוני, מדד האימון בכל צעד יכול להמשיך להשתפר גם כשהסרטון הסופי מפסיק להשתפר — או אפילו נעשה פחות איכותי. הפער הזה בין מדד האימון לתוצאה המוגמרת מכונה ״מלכודת הדלילות״. 18
הפתרון שמציעה SparkDiffusion הוא תהליך מדורג: תחילה מבצעים חימום קצר של המודל הדליל כדי שיבנה בסיס כללי, ובהמשך משתמשים בזיקוק שמכוון לתקן את מסלול היצירה ואת התוצאה הסופית. 8
ההאצה הכוללת נובעת משילוב של שלושת המרכיבים: פחות חישובי קשב, פחות צעדי יצירה והרצה יעילה יותר של העבודה שנותרה. אין לייחס את כל השיפור לדלילות של 97% בלבד. 8
בבדיקה שדווחה עבור Wan 2.1 T2V 14B — מודל טקסט־לווידאו — נוצר סרטון בן 81 פריימים ברזולוציית 720p בתוך 18 שניות בכרטיס RTX 5090 יחיד, לעומת 4,769 שניות קודם לכן: בערך פי 265 מהר יותר. בהשוואה שדווחה עם H100, זמן היצירה ירד מ-1,757 שניות ל-8 שניות, כלומר בערך פי 220. אלה תוצאות של תצורות וחומרה מסוימות, ולא הבטחה לביצועים זהים בתנאים אחרים. 6
הפרויקט מדווח גם על האצה של בערך פי 140 בתצורת Wan 2.1 1.3B ברזולוציית 480p. הפער בין הנתונים מדגיש שחשוב לבדוק לא רק את מספר ההאצה, אלא גם איזה מודל ורזולוציה נבדקו. 5
7
הפרויקט מתאר איכות חזותית חזקה גם ברמות דלילות גבוהות. עם זאת, נתוני מהירות לבדם אינם מוכיחים שהאיכות נשמרת בכל הנחיה, רזולוציה או גרסת מודל. מלכודת הדלילות עצמה ממחישה ששיפור במדד אימון נקודתי לא בהכרח מעיד על שיפור בסרטון המוגמר. 8
18
לכן כדאי להתייחס לטענות המהירות והאיכות כאל תוצאות של התצורות שנבדקו. המידע הזמין אינו מספיק כדי לקבוע שכל סרטון שנוצר יהיה זהה באיכותו לתוצאה של מודל Wan המלא.
רשימות המשקולות כוללות את Wan 2.1 T2V 14B ברזולוציות 480p ו-720p, וכן את Wan 2.2 T2V A14B ברזולוציית 480p. רמות הדלילות הנתמכות משתנות: למשל, תצורת Wan 2.1 ברזולוציית 480p תומכת בדלילות של 90%, בעוד שתצורות 720p שפורסמו מגיעות עד 95% או 97%. תצורת Wan 2.2 ברזולוציית 480p תומכת בטווח של 90%–95%. לכן, לא כל משקולת שפורסמה תומכת בדלילות של 97%. 9
10
11
12
הפרויקט מציג את SparkDiffusion כמסגרת שאפשר להרחיב מעבר לגרסאות Wan שכבר פורסמו. עם זאת, המקורות הזמינים אינם מבססים לוח זמנים ברור או תוצאות מאומתות לגבי מודלים או חומרה עתידיים. 8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SparkDiffusion משלבת קשב דליל, זיקוק למספר קטן של צעדי יצירה וליבות FP8. בבדיקת Wan 2.1 מסוימת, יצירת סרטון 720p בן 81 פריימים ארכה 18 שניות במקום 4,769 שניות בכרטיס RTX 5090 יחיד — האצה של בערך פי 265.
SparkDiffusion משלבת קשב דליל, זיקוק למספר קטן של צעדי יצירה וליבות FP8. בבדיקת Wan 2.1 מסוימת, יצירת סרטון 720p בן 81 פריימים ארכה 18 שניות במקום 4,769 שניות בכרטיס RTX 5090 יחיד — האצה של בערך פי 265. ״מלכודת הדלילות״ מתארת מצב שבו מדד האימון משתפר, אבל איכות הסרטון הסופי נתקעת או נפגעת.
המשקולות שפורסמו כוללות תצורות מסוימות של Wan 2.1 ו Wan 2.2, אך רמות הדלילות הנתמכות שונות בין המודלים.