En una prueba con Wan 2.1 de 14.000 millones de parámetros, un vídeo de 81 fotogramas a 720p tardó 18 segundos en generarse con una RTX 5090, frente a 4.769 segundos en la comparación: unas 265 veces más rápido. SparkDiffusion combina RoLA para reducir los cálculos de atención, CrossDistill para generar en pocos pas...
Publicado porEditado con GPT-6 LunaImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion es un sistema de código abierto para acelerar los modelos de vídeo Wan, desarrollado por investigadores de la Universidad de Pekín, la Universidad Tsinghua y Alibaba. Combina atención dispersa, destilación en pocos pasos y kernels fusionados de precisión FP8. El equipo informa de una aceleración de hasta 265 veces en una prueba concreta con Wan 2.1; no es una garantía para cualquier modelo, vídeo o tarjeta gráfica. 6
8
Los modelos de difusión de vídeo procesan secuencias largas de información visual, y calcular la atención entre sus elementos puede requerir mucho trabajo. La atención dispersa reduce el número de interacciones que se calculan. Pero los investigadores describen un efecto no deseado cuando la dispersidad es extrema: la pérdida medida durante cada paso del entrenamiento puede seguir bajando mientras la calidad del vídeo final se estanca o empeora. 18
A ese desajuste lo llaman «problema de la alta dispersidad». La respuesta de SparkDiffusion es un proceso por etapas: primero, un breve calentamiento adapta el modelo disperso para que forme una representación general; después, una destilación busca corregir la trayectoria de generación y el resultado final. 8
El sistema no depende de una sola optimización. Cada componente reduce un coste distinto:
La aceleración total resulta de sumar estos cambios: se calcula menos atención, se hacen menos pasos y cada paso se ejecuta con mayor rapidez. No se debe atribuir el resultado únicamente al porcentaje de dispersidad. 8
En una prueba con Wan 2.1 T2V de 14.000 millones de parámetros, para generar un vídeo de 81 fotogramas a 720p, el tiempo indicado bajó de 4.769 segundos a 18 segundos en una sola RTX 5090: unas 265 veces más rápido. En una comparación con una H100, pasó de 1.757 segundos a 8, aproximadamente 220 veces más rápido. Son resultados de pruebas con modelos y hardware especificados, no promesas de rendimiento para otros equipos o usos. 6
El proyecto también informa de una aceleración de alrededor de 140 veces para una configuración de Wan 2.1 de 1.300 millones de parámetros a 480p. La diferencia entre cifras subraya por qué conviene fijarse en el modelo y la resolución, además del número más llamativo. 5
7
El proyecto afirma que SparkDiffusion mantiene una calidad visual sólida incluso con alta dispersidad. Sin embargo, las cifras de velocidad por sí solas no demuestran que la calidad sea equivalente en todos los prompts, resoluciones o modelos. El propio problema de la alta dispersidad muestra que mejorar una métrica de entrenamiento paso a paso no garantiza un mejor vídeo final. 8
18
Por tanto, las afirmaciones sobre velocidad y calidad deben entenderse dentro de las configuraciones evaluadas. Los resúmenes de las pruebas disponibles no bastan para concluir que cada vídeo generado igualará al de la versión densa de Wan.
Los checkpoints publicados incluyen Wan 2.1 T2V de 14.000 millones de parámetros a 480p y 720p, y Wan 2.2 T2V A14B a 480p. Los niveles de dispersidad admitidos cambian según la versión: el checkpoint de Wan 2.1 a 480p admite un 90 %, mientras que las variantes de 720p llegan a un 95 % o un 97 %; el de Wan 2.2 a 480p admite entre un 90 % y un 95 %. Por eso, no debe darse por hecho que cada checkpoint permite alcanzar el 97 %. 9
10
11
12
Los responsables presentan SparkDiffusion como un marco que podría aplicarse más allá de los modelos Wan publicados. La información disponible no confirma un calendario ni resultados verificados para futuros modelos o equipos. 8
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
En una prueba con Wan 2.1 de 14.000 millones de parámetros, un vídeo de 81 fotogramas a 720p tardó 18 segundos en generarse con una RTX 5090, frente a 4.769 segundos en la comparación: unas 265 veces más rápido.
En una prueba con Wan 2.1 de 14.000 millones de parámetros, un vídeo de 81 fotogramas a 720p tardó 18 segundos en generarse con una RTX 5090, frente a 4.769 segundos en la comparación: unas 265 veces más rápido. SparkDiffusion combina RoLA para reducir los cálculos de atención, CrossDistill para generar en pocos pasos y kernels fusionados FP8 para acelerar los cálculos restantes.
El «problema de la alta dispersidad» aparece cuando la pérdida de entrenamiento mejora, pero el vídeo final deja de mejorar o empeora.