SparkDiffusion kombiniert sparse Attention, Destillation auf wenige Schritte und FP8 Kernels. Die sogenannte „High Sparsity Falle“ beschreibt ein Problem, bei dem der Trainingsverlust weiter sinkt, die Qualität des fertigen Videos aber stagniert oder nachlässt.
Veröffentlicht vonBearbeitet mit GPT-6 LunaBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion ist ein Open-Source-Framework, das die Videogenerierung mit Wan-Modellen beschleunigen soll. Entwickelt wurde es von Forschenden der Peking-Universität, der Tsinghua-Universität und Alibaba. Der Ansatz verbindet sparse Attention, Destillation auf wenige Generierungsschritte und FP8-Kernels. Das Team berichtet für einen bestimmten Wan-2.1-Benchmark von einer bis zu 265-mal schnelleren Generierung. Dieser Spitzenwert ist kein allgemeines Versprechen für jedes Modell, Video oder Hardware-Setup. 6
8
Videodiffusionsmodelle verarbeiten lange Sequenzen visueller Informationen. Dabei kann die Attention – also die Berechnung, welche Teile der Eingabe für andere Teile relevant sind – einen großen Teil des Rechenaufwands ausmachen. Sparse Attention beschränkt diese Berechnungen auf eine kleinere Auswahl von Verknüpfungen.
Bei extrem hoher Sparsity kann laut den Forschenden jedoch eine Lücke entstehen: Der Trainingsverlust für einzelne Schritte sinkt weiter, während die Qualität des fertigen Videos nicht mehr besser wird oder sogar nachlässt. Dieses Problem nennen sie die „High-Sparsity-Falle“. 18
SparkDiffusion setzt deshalb auf ein gestuftes Vorgehen: Zunächst wird das sparse Modell kurz aufgewärmt, damit es eine grobe Vorhersage lernt. Anschließend soll eine gezielte Destillation Fehler im Verlauf der Generierung und im Endergebnis korrigieren. 8
SparkDiffusion versucht nicht, die Generierung mit einer einzelnen Optimierung zu beschleunigen. Die Komponenten greifen an unterschiedlichen Stellen an:
Der Gesamteffekt entsteht durch das Zusammenspiel: weniger Attention-Berechnungen, weniger Generierungsschritte und eine schnellere Ausführung der verbleibenden Arbeit. Er lässt sich nicht allein mit der Sparsity von bis zu 97 Prozent erklären. 8
Im berichteten Benchmark für ein 81-Frame-Video in 720p mit Wan 2.1 T2V 14B sank die Generierungszeit auf einer einzelnen RTX 5090 von 4.769 auf 18 Sekunden – rund 265-mal schneller. Für einen Vergleich auf einer H100 werden 1.757 Sekunden gegenüber 8 Sekunden angegeben, also etwa das 220-Fache. Das sind Messwerte für die konkret genannten Benchmarks und Grafikkarten, keine Garantie für andere Konfigurationen. 6
Für Wan 2.1 mit 1,3 Milliarden Parametern bei 480p wird außerdem eine Beschleunigung um ungefähr den Faktor 140 berichtet. Auch dieser Wert bezieht sich auf einen eigenen Modell- und Auflösungstest. 5
7
Das Projekt gibt an, dass SparkDiffusion auch bei hoher Sparsity eine starke visuelle Qualität erzielt. Die Geschwindigkeit allein belegt jedoch nicht, dass die Ergebnisse bei allen Eingaben, Auflösungen und Modellvarianten mit einer dichten Wan-Referenz mithalten. Die High-Sparsity-Falle zeigt gerade, warum ein besserer Trainingswert auf Ebene einzelner Schritte nicht automatisch ein besseres fertiges Video bedeutet. 8
18
Die Qualitäts- und Geschwindigkeitsangaben sollten daher als Ergebnisse der jeweils getesteten Konfigurationen verstanden werden. Aus den verfügbaren Benchmark-Zusammenfassungen lässt sich nicht ableiten, dass jedes erzeugte Video der dichten Wan-Version entspricht.
Die aufgeführten Checkpoints umfassen Wan 2.1 T2V 14B mit 480p und 720p sowie Wan 2.2 T2V A14B mit 480p. Die jeweils unterstützte Sparsity ist unterschiedlich: Der gelistete Wan-2.1-Checkpoint für 480p unterstützt 90 Prozent; Varianten für 720p reichen bis 95 beziehungsweise 97 Prozent. Für den Wan-2.2-Checkpoint bei 480p werden 90 bis 95 Prozent genannt. Die 97-Prozent-Einstellung gilt also nicht für jeden veröffentlichten Checkpoint. 9
10
11
12
SparkDiffusion wird als Framework vorgestellt, das über die aufgeführten Wan-Veröffentlichungen hinaus erweitert werden könnte. Die verfügbaren Quellen nennen jedoch weder einen verbindlichen Zeitplan noch bestätigte Ergebnisse für künftige Modelle oder Hardware. 8
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
SparkDiffusion kombiniert sparse Attention, Destillation auf wenige Schritte und FP8 Kernels.
SparkDiffusion kombiniert sparse Attention, Destillation auf wenige Schritte und FP8 Kernels. Die sogenannte „High Sparsity Falle“ beschreibt ein Problem, bei dem der Trainingsverlust weiter sinkt, die Qualität des fertigen Videos aber stagniert oder nachlässt.
Verfügbare SparkWan Checkpoints decken ausgewählte Wan 2.1 und Wan 2.2 Konfigurationen ab.