Wan Animate 2 to otwarty system Tongyi Lab firmy Alibaba, który ożywia postać referencyjną na podstawie nagrania sterującego, starając się zachować jej tożsamość. Model pomija klasyczną ekstrakcję szkieletu pozy i kompresję cech ruchu: surowe informacje wizualne z nagrania trafiają bezpośrednio do przeprojektowanego...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 to otwarty system Alibaby do animacji postaci. Użytkownik dostarcza obraz lub inną referencję bohatera oraz nagranie sterujące, a model przenosi na postać ruch, ekspresję i zachowanie z wideo, starając się jednocześnie zachować jej wygląd i tożsamość. Za projekt odpowiada Tongyi Lab, wcześniej kojarzony z marką Tongyi Wanxiang.
Najważniejsza zmiana względem typowych potoków animacji polega na tym, że ruch nie jest najpierw sprowadzany do szkieletu pozy ani do skompresowanego wektora cech. Wan-Animate-2 analizuje nagranie sterujące bezpośrednio wewnątrz przeprojektowanego modelu Diffusion Transformer. 1
W klasycznym podejściu system najpierw wykrywa punkty charakterystyczne ciała, a następnie buduje z nich uproszczony opis pozy. Taki etap może jednak wprowadzać błędy detekcji, gubić subtelności ruchu i prowadzić do rozjechania tożsamości postaci. Z kolei kompresja ruchu może usuwać szczegóły istotne dla dłoni, twarzy, ubioru czy kontaktu z innymi obiektami.
Wan-Animate-2 korzysta z wizualnych reprezentacji latentnych nagrania sterującego. W jego dwugałęziowej architekturze DiT czysta gałąź referencyjno-ruchowa jest dopasowywana do zaszumionej gałęzi odpowiedzialnej za odszumianie. Dzięki temu model zachowuje więcej informacji czasoprzestrzennych, co ma poprawiać spójność ruchu i wyglądu postaci między kolejnymi klatkami. 1
W praktyce przekłada się to — według autorów — na lepszą artykulację dłoni oraz mniejszą liczbę zniekształconych albo znikających kończyn. Wyniki obejmują też różne style postaci, sylwetki, sceny z wieloma osobami i bardziej zróżnicowane ruchy. Nie jest to oczywiście gwarancja poprawnego działania dla każdego nagrania, ale zakres zastosowań ma być szerszy niż w systemach opartych wyłącznie na pozie szkieletowej. 1
Wan-Animate-2 obsługuje także wiele postaci w jednej scenie, z zachowaniem ich odrębnych tożsamości i ruchu. Kolejną funkcją jest tekstowe sterowanie punktem widzenia kamery.
Służy do tego Viewpoint LoRA, trenowana z użyciem syntetycznych danych wielowidokowych wygenerowanych w Unreal Engine. Mechanizm ma oddzielać perspektywę wyjściowej kamery od ujęcia z nagrania sterującego. W efekcie użytkownik może poprosić o inny kąt widzenia bez nagrywania nowego występu i bez ponownego trenowania bazowego modelu animacji. 1
To ważne rozróżnienie: nagranie dostarcza aktorskiego ruchu, natomiast tekst może dodatkowo określić, jak ten ruch ma zostać pokazany. System ma również działać z niestandardowymi proporcjami obrazu i różnymi typami sylwetek, choć rzeczywista jakość w takich przypadkach będzie zależeć od konkretnego materiału wejściowego.
Deklarowane generowanie w czasie rzeczywistym dotyczy przede wszystkim odchudzonego, destylowanego wariantu Wan-Animate-2-Lite, a nie pełnego modelu Base. Opisana w pracy ścieżka przyspieszania obejmuje trzy etapy: wstępne trenowanie z wymuszaniem nauczyciela, bufor błędów oraz destylację Self-Forcing z propagacją wsteczną wykonywaną dla fragmentów sekwencji. Pozwala to na autoregresyjne generowanie i strumieniowanie kolejnych części wideo. 1
Raportowany wynik to 24 klatki na sekundę w rozdzielczości 400×720 na czterech kartach H100. To istotna demonstracja możliwości, ale nie należy interpretować jej jako „24 kl./s w 720p na zwykłym lokalnym komputerze”. Wymagania sprzętowe pozostają jednym z głównych ograniczeń praktycznego wdrożenia. 1
8
W porównaniach jakościowych i badaniach preferencji użytkowników autorzy raportują wyniki konkurencyjne wobec zamkniętych narzędzi, takich jak Dreamina firmy ByteDance oraz KLING MotionControl firmy Kuaishou. Doniesienia branżowe opisują te rezultaty jako zbliżone do poziomu komercyjnych liderów. 1
3
Trzeba jednak zachować ostrożność wobec określenia „komercyjne SOTA”, czyli najwyższy poziom osiągany przez rozwiązania komercyjne. Są to przede wszystkim oceny raportowane przez twórców i porównania przedstawione w pracy, a nie niezależny, ustandaryzowany benchmark przeprowadzony przez zewnętrzną organizację. Najuczciwiej traktować je jako mocną, lecz nadal wstępną deklarację przewagi lub parytetu jakościowego.
Alibaba udostępniła wagi modelu, kod i narzędzia do wnioskowania na licencji Apache-2.0. Deweloperzy mogą więc analizować system, uruchamiać go na własnej infrastrukturze, modyfikować i integrować z innymi potokami produkcyjnymi, zamiast korzystać wyłącznie z zamkniętej usługi chmurowej. 1
2
To może mieć znaczenie dla całego rynku wideo generowanego przez AI. Samo tworzenie pojedynczych efektownych klipów jest dziś łatwiejsze niż utrzymanie tej samej postaci przez dłuższą sekwencję, poprawne odwzorowanie dłoni i interakcji, kontrolowanie kamery oraz uzyskanie niskich opóźnień. Właśnie sterowalna animacja postaci pozostaje praktycznym ogniwem łączącym demonstrację modelu z użytecznym procesem produkcyjnym.
Otwarte wagi nie rozwiązują jednak wszystkich problemów. Koszt pamięci i obliczeń, licencjonowanie danych treningowych, powtarzalność wyników, maskowanie i kompozycja obrazu oraz łatwość integracji będą decydować o tym, czy model stanie się narzędziem produkcyjnym, a nie tylko ciekawym eksperymentem.
Oba projekty dotyczą różnych końców procesu. Wan-Animate-2 koncentruje się na sterowaniu postacią i jej występem: bierze nagranie ruchu i przenosi je na bohatera. Wan3.0 odpowiada raczej za wejście biznesowe i kreatywne — według Alibaby potrafi tworzyć filmy o długości do 30 sekund na podstawie dokumentów, arkuszy kalkulacyjnych, prezentacji i stron internetowych, a także tradycyjnych danych multimodalnych. 2
Można wyobrazić sobie ciąg od materiału firmowego do animowanego wideo, ale nie oznacza to, że Alibaba udostępniła jeden zintegrowany, kompleksowy pakiet produkcyjny. Wan3.0 jest odrębnie wdrażanym, zamkniętym rozwiązaniem, natomiast Wan-Animate-2 ma charakter otwartego frameworka do animacji postaci.
Najważniejszy test dopiero się zaczyna: czy społeczność szybko przygotuje stabilne węzły i integracje, oszczędne tryby wnioskowania, narzędzia do masek i kompozycji, workflowy utrzymywania spójności bohatera oraz wersje działające na kartach konsumenckich.
Jeśli jakość utrzyma się poza starannie dobranymi przykładami, licencja Apache-2.0 może znacząco przyspieszyć adopcję. Ostatecznie o tempie rozpowszechniania technologii chińskich laboratoriów zdecydują nie tylko deklarowane wyniki, lecz także cena sprzętu, reprodukowalność, kwestie prawne i jakość narzędzi, które powstaną wokół modelu.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Wan Animate 2 to otwarty system Tongyi Lab firmy Alibaba, który ożywia postać referencyjną na podstawie nagrania sterującego, starając się zachować jej tożsamość.
Wan Animate 2 to otwarty system Tongyi Lab firmy Alibaba, który ożywia postać referencyjną na podstawie nagrania sterującego, starając się zachować jej tożsamość. Model pomija klasyczną ekstrakcję szkieletu pozy i kompresję cech ruchu: surowe informacje wizualne z nagrania trafiają bezpośrednio do przeprojektowanego Diffusion Transformera.
Wan Animate 2 ma lepiej odwzorowywać dłonie, mimikę i interakcje, ograniczać deformacje kończyn oraz obsługiwać różne typy postaci i sceny wieloosobowe.