Trong thử nghiệm với video Wan 2.1 T2V 14B dài 81 khung hình ở 720p, thời gian tạo giảm từ 4.769 giây xuống 18 giây trên một RTX 5090 — nhanh hơn khoảng 265 lần trong cấu hình này. SparkDiffusion ghép attention thưa RoLA, chưng cất CrossDistill để giảm số bước tạo video và kernel hợp nhất FP8 nhằm giảm chi phí tính...
Đăng bởiBiên tập bằng GPT-6 LunaHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How does the open-source SparkDiffusion framework from Peking University, Tsinghua University and Alibaba accelerate Wan 2.1 and Wan 2.2 vid. Article summary: SparkDiffusion speeds up Wan video generation by combining three changes: it computes far less attention, distils generation into a few steps, and runs the resulting model with FP8 fused kernels. The researchers report u. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SparkDiffusion là khung tăng tốc mã nguồn mở dành cho các mô hình tạo video Wan, do các nhà nghiên cứu tại Đại học Bắc Kinh, Đại học Thanh Hoa và Alibaba phát triển. Thay vì chỉ tối ưu một khâu, hệ thống kết hợp attention thưa, chưng cất để giảm số bước suy luận và kernel hợp nhất FP8. Nhóm nghiên cứu báo cáo mức tăng tốc tối đa 265 lần trong một thử nghiệm Wan 2.1 cụ thể; con số này không đồng nghĩa mọi mô hình, video hay phần cứng đều đạt tốc độ tương tự. 6
8
Với Wan 2.1 T2V 14B — mô hình chuyển văn bản thành video — thử nghiệm tạo video 81 khung hình ở độ phân giải 720p mất 4.769 giây trên một GPU RTX 5090 trước khi tăng tốc, và 18 giây với SparkDiffusion, tương đương khoảng 265 lần nhanh hơn. Một phép so sánh được báo cáo trên H100 giảm từ 1.757 giây xuống 8 giây, tức khoảng 220 lần. Đây là kết quả của những cấu hình phần cứng và tác vụ cụ thể, không phải cam kết hiệu năng cho mọi trường hợp. 6
Khung này cũng báo cáo mức tăng tốc khoảng 140 lần với Wan 2.1 1.3B ở 480p. Sự khác biệt giữa các con số cho thấy cần xem kèm tên mô hình và độ phân giải, thay vì chỉ nhìn vào mức tăng tốc cao nhất. 5
7
Mô hình khuếch tán video phải xử lý chuỗi thông tin hình ảnh dài, khiến attention — cơ chế tính toán mối liên hệ giữa các phần của dữ liệu — tiêu tốn nhiều tài nguyên. Attention thưa giúp giảm số tương tác cần tính. Nhưng theo nhóm SparkDiffusion, khi độ thưa quá cao, loss đo theo từng bước huấn luyện vẫn có thể giảm trong khi video hoàn chỉnh không khá lên, thậm chí chất lượng còn đi xuống. 18
Nhóm gọi sự lệch pha này là “bẫy độ thưa cao”: chỉ số ở từng bước không phản ánh chắc chắn chất lượng đầu ra cuối cùng. Cách tiếp cận của SparkDiffusion là huấn luyện theo từng giai đoạn: trước hết cho mô hình thưa một giai đoạn khởi động ngắn để hình thành biểu diễn khái quát, sau đó dùng chưng cất hướng vào quỹ đạo tạo video và kết quả cuối. 8
Do đó, mức tăng tốc tổng thể đến từ việc tính ít attention hơn, chạy ít bước hơn và thực thi các bước còn lại nhanh hơn — chứ không phải chỉ nhờ độ thưa 97%. 8
Dự án cho biết SparkDiffusion duy trì chất lượng hình ảnh tốt ở mức độ thưa cao. Tuy nhiên, riêng số đo tốc độ không chứng minh chất lượng tương đương trong mọi lời nhắc, độ phân giải hay phiên bản mô hình. Chính hiện tượng “bẫy độ thưa cao” cũng cho thấy loss ở từng bước giảm không nhất thiết đồng nghĩa video cuối tốt hơn. 8
18
Vì vậy, nên hiểu các tuyên bố về tốc độ và chất lượng trong phạm vi những cấu hình đã được đánh giá. Thông tin benchmark được cung cấp chưa đủ để kết luận rằng mọi video tạo ra đều khớp với kết quả của mô hình Wan không dùng attention thưa.
Các checkpoint được liệt kê gồm Wan 2.1 T2V 14B ở 480p và 720p, cùng Wan 2.2 T2V A14B ở 480p. Mức độ thưa hỗ trợ tùy loại: checkpoint Wan 2.1 480p được nêu ở mức 90%; các bản 720p có phạm vi tới 95% hoặc 97%; bản Wan 2.2 480p hỗ trợ 90%–95%. Vì thế, không nên mặc định mọi checkpoint đều chạy ở mức 97%. 9
10
11
12
SparkDiffusion được giới thiệu như một khung có thể mở rộng ra ngoài các bản Wan hiện có. Tuy vậy, những nguồn hiện có không xác nhận lịch trình cụ thể hay kết quả đã kiểm chứng cho các mô hình hoặc phần cứng tương lai. 8
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Trong thử nghiệm với video Wan 2.1 T2V 14B dài 81 khung hình ở 720p, thời gian tạo giảm từ 4.769 giây xuống 18 giây trên một RTX 5090 — nhanh hơn khoảng 265 lần trong cấu hình này.
Trong thử nghiệm với video Wan 2.1 T2V 14B dài 81 khung hình ở 720p, thời gian tạo giảm từ 4.769 giây xuống 18 giây trên một RTX 5090 — nhanh hơn khoảng 265 lần trong cấu hình này. SparkDiffusion ghép attention thưa RoLA, chưng cất CrossDistill để giảm số bước tạo video và kernel hợp nhất FP8 nhằm giảm chi phí tính toán.
“Bẫy độ thưa cao” là hiện tượng loss khi huấn luyện vẫn giảm nhưng chất lượng video cuối cùng không cải thiện, thậm chí có thể suy giảm.