Wan Animate 2 là hệ thống hoạt hình nhân vật mở của Alibaba Tongyi Lab, biến một ảnh tham chiếu thành nhân vật chuyển động theo video dẫn. Kiến trúc Diffusion Transformer mới tiếp nhận trực tiếp latent hình ảnh của video, không qua bước trích xuất khung xương hay nén đặc trưng chuyển động.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 là hệ thống hoạt hình nhân vật mở do Tongyi Lab thuộc Alibaba phát triển. Người dùng cung cấp một hình ảnh tham chiếu của nhân vật cùng video dẫn chuyển động; mô hình sẽ khiến nhân vật tái hiện động tác, biểu cảm và nhịp chuyển động trong video, đồng thời cố gắng duy trì danh tính và diện mạo ban đầu. Điểm đáng chú ý nhất nằm ở cách mô hình tiếp nhận chuyển động: thay vì biến video thành một bộ khung xương hoặc một đặc trưng chuyển động đã nén, Wan-Animate-2 đưa trực tiếp thông tin latent của video vào một Diffusion Transformer (DiT) được thiết kế lại. 1
Alibaba công bố mã, trọng số và công cụ suy luận của Wan-Animate-2 theo giấy phép Apache-2.0 vào tháng 8/2026, biến đây thành một hệ thống mà nhà phát triển có thể tự kiểm tra, lưu trữ và tích hợp thay vì chỉ sử dụng qua một nền tảng đóng. 1
2
Trong quy trình hoạt hình dựa trên pose, video dẫn thường phải đi qua bước phát hiện điểm mốc cơ thể rồi dựng thành bộ xương. Chỉ cần nhận diện sai bàn tay, khuỷu tay, khuôn mặt hoặc tương tác giữa các nhân vật, lỗi có thể lan sang đoạn video cuối. Việc nén chuyển động thành một biểu diễn trung gian cũng có nguy cơ làm mất những chi tiết tinh tế về bàn tay, ngón tay, biểu cảm và tiếp xúc giữa các vật thể. 1
Wan-Animate-2 xử lý video dẫn trong một kiến trúc DiT hai nhánh. Nhánh tham chiếu/chuyển động sạch được căn chỉnh với nhánh khử nhiễu, để mô hình giữ lại nhiều tín hiệu không-thời gian hơn trong quá trình tạo video. Theo bài báo, cách tiếp cận này giúp cải thiện độ trung thực của chuyển động, tính nhất quán theo thời gian và khả năng bảo toàn danh tính nhân vật. 1
Nói cách khác, video gốc không chỉ cung cấp một bộ lệnh “tay phải đưa lên, chân trái bước tới”. Nó còn mang theo hình dạng, tốc độ, nhịp điệu, quan hệ không gian và những biến đổi nhỏ mà một bộ xương đơn giản có thể bỏ sót.
Các tác giả cho biết mô hình cho kết quả tốt hơn ở chuyển động bàn tay, đồng thời giảm hiện tượng tay chân méo, biến dạng hoặc bị thiếu. Lý giải của họ là những động lực thị giác chi tiết được giữ lại thay vì bị ép qua một biểu diễn xương trung gian. 1
Phạm vi thử nghiệm cũng bao gồm nhiều phong cách nhân vật, hình thể khác nhau, cảnh có nhiều người và các dạng chuyển động đa dạng. Điều này không có nghĩa mọi video đầu vào đều cho kết quả hoàn hảo, nhưng cho thấy hệ thống có phạm vi hoạt động rộng hơn các pipeline phụ thuộc hoàn toàn vào pose. 1
Wan-Animate-2 cũng được giới thiệu với khả năng hoạt hình nhiều nhân vật trong cùng cảnh, trong đó từng nhân vật vẫn giữ danh tính và chuyển động riêng. 3
8
Một tính năng khác là điều khiển góc nhìn camera bằng văn bản. Nhóm nghiên cứu sử dụng một Viewpoint LoRA được huấn luyện với dữ liệu đa góc nhìn tổng hợp từ Unreal Engine. Cách này giúp tách góc máy đầu ra khỏi góc quay trong video dẫn. 1
Về thực tế, người dùng có thể yêu cầu một góc nhìn khác mà không cần quay lại toàn bộ màn trình diễn và không phải huấn luyện lại mô hình hoạt hình nền. Đây là điểm quan trọng với các cảnh cần nhiều góc máy, khung hình không tiêu chuẩn hoặc muốn tạo cảm giác quay phim thay vì chỉ sao chép nguyên góc của video tham chiếu. 1
3
Khả năng streaming thời gian thực chủ yếu thuộc về phiên bản chưng cất Wan-Animate-2-Lite, không phải mô hình Base đầy đủ. Bài báo mô tả một quy trình tăng tốc gồm ba giai đoạn: tiền huấn luyện teacher-forcing, xây dựng bộ đệm lỗi và chưng cất Self-Forcing với lan truyền ngược theo từng đoạn. Quy trình này cho phép mô hình tạo video theo kiểu tự hồi quy và truyền từng chunk thay vì chờ hoàn tất toàn bộ clip. 1
Kết quả được báo cáo là 24 khung hình/giây ở độ phân giải 400×720 trên bốn GPU H100. Đây là một cột mốc đáng chú ý cho hệ thống mở, nhưng không nên hiểu thành “video 720p ở 24 fps trên một máy tính cá nhân thông thường”. Chi phí phần cứng và bộ nhớ vẫn là rào cản lớn khi tự chạy mô hình. 1
8
Bài báo cùng các bài đưa tin về dự án cho biết Wan-Animate-2 có kết quả cạnh tranh với Dreamina của ByteDance và KLING MotionControl của Kuaishou trong các so sánh định tính và nghiên cứu người dùng. Một số nguồn bên ngoài mô tả kết quả là tương đương với các công cụ thương mại nói trên. 1
3
Tuy nhiên, đây vẫn chủ yếu là đánh giá do nhóm phát triển công bố, chưa phải một chuẩn benchmark độc lập, thống nhất và có thể tái lập trên mọi loại dữ liệu. Vì vậy, cụm từ “SOTA thương mại” nên được xem là một tuyên bố mạnh nhưng còn cần kiểm chứng thêm trong các quy trình sản xuất thực tế, đặc biệt với cảnh phức tạp và dữ liệu ngoài những ví dụ được tuyển chọn.
Khi trọng số, mã nguồn và công cụ suy luận được phát hành theo Apache-2.0, nhà phát triển có thể tự lưu trữ, nghiên cứu, điều chỉnh và đưa hệ thống vào pipeline của riêng mình. Họ không nhất thiết phải phụ thuộc vào API đám mây, giới hạn nền tảng hay phí tính theo giây. 1
2
Điều này giải quyết một nút thắt lâu nay của video AI: tạo một đoạn clip riêng lẻ đã trở nên dễ hơn, nhưng duy trì danh tính nhân vật, bàn tay, tương tác, hướng camera và độ trễ thấp trong cả quy trình sản xuất vẫn khó. Nếu Wan-Animate-2 hoạt động ổn định ngoài các bản trình diễn được chọn lọc, nó có thể giúp biến hoạt hình nhân vật có kiểm soát thành một thành phần dùng được trong sản phẩm, trò chơi, avatar trực tiếp và hậu kỳ video.
Tuy vậy, tốc độ tiếp nhận sẽ phụ thuộc vào nhiều yếu tố ngoài việc “mở mã nguồn”: các node cho ComfyUI và công cụ cộng đồng có đủ ổn định hay không, khả năng suy luận tiết kiệm bộ nhớ, quy trình masking/compositing, mức độ nhất quán của nhân vật, phiên bản chạy được trên GPU tiêu dùng, khả năng tái lập kết quả và vấn đề giấy phép đối với dữ liệu huấn luyện.
Hai sản phẩm nằm ở hai đầu khác nhau của quy trình. Wan-Animate-2 tập trung vào biểu diễn và điều khiển nhân vật: lấy một nhân vật tham chiếu rồi cho nhân vật đó thực hiện chuyển động từ video dẫn. Wan3.0 tập trung vào đầu vào doanh nghiệp: Alibaba cho biết mô hình có thể tạo video dài tối đa 30 giây từ tài liệu, bảng tính, slide và trang web, bên cạnh các đầu vào đa phương thức thông thường. 2
Kết hợp về mặt ý tưởng, chúng gợi ra một quy trình từ tài liệu kinh doanh đến video có nhân vật hoạt hình. Nhưng đây vẫn là hai hệ thống được triển khai riêng; sự tồn tại của cả hai chưa phải bằng chứng cho một bộ công cụ sản xuất khép kín, tích hợp end-to-end của Alibaba. 2
Wan-Animate-2 cho thấy các phòng thí nghiệm Trung Quốc đã đưa công nghệ video mở đến gần hơn với năng lực của những nền tảng thương mại đóng. Lợi thế lớn nhất của nó là khả năng kiểm soát và tự triển khai, còn điểm yếu trước mắt là yêu cầu phần cứng, độ phức tạp tích hợp và câu hỏi liệu chất lượng có giữ được trên dữ liệu thực tế hay không.
Trong thời gian tới, dấu hiệu quan trọng sẽ là tốc độ cộng đồng xây dựng workflow, plugin và phiên bản nhẹ hơn. Nếu các công cụ này giải quyết được bộ nhớ, hậu kỳ, đồng bộ nhân vật và GPU phổ thông, Wan-Animate-2 có cơ hội trở thành một lớp hạ tầng mở đáng kể cho hoạt hình AI—thay vì chỉ là một bản demo nghiên cứu ấn tượng.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Wan Animate 2 là hệ thống hoạt hình nhân vật mở của Alibaba Tongyi Lab, biến một ảnh tham chiếu thành nhân vật chuyển động theo video dẫn.
Wan Animate 2 là hệ thống hoạt hình nhân vật mở của Alibaba Tongyi Lab, biến một ảnh tham chiếu thành nhân vật chuyển động theo video dẫn. Kiến trúc Diffusion Transformer mới tiếp nhận trực tiếp latent hình ảnh của video, không qua bước trích xuất khung xương hay nén đặc trưng chuyển động.
Phiên bản Wan Animate 2 Lite được báo cáo đạt 24 khung hình/giây ở độ phân giải 400×720 trên bốn GPU H100; đây không phải mức hiệu năng dành cho phần cứng phổ thông.