Wan Animate 2 animerer en referansefigur basert på en såkalt driving video, samtidig som figurens identitet skal bevares. Modellen sender videodata direkte inn i en redesignet Diffusion Transformer, i stedet for først å hente ut et bevegelsesskjelett eller komprimere bevegelsen.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 er et åpent system fra Alibabas Tongyi Lab for animasjon av digitale figurer. Utgangspunktet kan være et referansebilde eller en referansefigur, mens en annen video fungerer som «driving video» – altså opptaket som leverer bevegelsene. Målet er å overføre kroppsspråk, ansiktsuttrykk og handling til figuren uten at den mister utseendet eller identiteten sin. 1
Det mest interessante er ikke bare selve resultatet, men hvordan modellen behandler bevegelse. Tradisjonelle arbeidsflyter henter ofte først ut kroppspunkter og bygger et digitalt skjelett. Andre systemer reduserer videoen til en komprimert bevegelsesrepresentasjon før genereringen starter. Wan-Animate-2 forsøker i stedet å behandle informasjonen direkte i en redesignet Diffusion Transformer, eller DiT. 1
I arkitekturen brukes en togrenet DiT. Den ene grenen fungerer som en ren referanse- og bevegelsesgren, mens den andre arbeider med den støyfylte videoen som skal avstøyes og genereres. Ved å justere disse grenene mot hverandre kan modellen hente ut både figurens utseende og de tidslige detaljene i bevegelsen. 1
Dette kan redusere problemer som oppstår når en separat posemodell gjør feil. Et feilplassert landemerke kan for eksempel gi en unaturlig armstilling, mens en komprimert bevegelsesbeskrivelse kan miste små, men viktige detaljer i fingre, ansikt eller kontakt mellom personer. Alibabas forskere mener den direkte videobehandlingen gir bedre bevegelsesfidelitet og mer stabil identitet fra bilde til bilde. 1
Hender og armer er blant de vanskeligste delene av AI-generert video. De endrer form raskt, består av mange små ledd og kan lett bli forvrengt når modellen må tolke bevegelsen gjennom et grovt skjelett. Ifølge forskerne gir Wan-Animate-2 bedre håndartikulasjon og færre manglende eller deformerte lemmer fordi de detaljerte visuelle bevegelsene beholdes lenger i prosessen. 1
Modellen er også testet på ulike figurstiler, kroppsformer, bevegelser og scener med flere personer. Det betyr ikke at alle typer innhold fungerer feilfritt, men peker mot et bredere bruksområde enn løsninger som i stor grad er avhengige av én standardisert menneskelig positur. 1
En annen funksjon er tekststyrt kontroll over synsvinkelen. Alibaba beskriver en Viewpoint LoRA som er trent ved hjelp av syntetiske flerkameradata fra Unreal Engine. Den skal gjøre det mulig å skille kameravinkelen i den ferdige videoen fra vinkelen i opptaket som leverer bevegelsen. 1
I praksis kan brukeren dermed be om en annen vinkel uten å filme inn hele bevegelsen på nytt eller trene grunnmodellen på nytt. Systemet støtter ifølge rapporteringen også scener med flere figurer og ulike kameraoppsett, men hvor robust dette er i krevende produksjoner må fortsatt prøves ut i praksis. 1
3
Sanntidsytelsen gjelder først og fremst den destillerte Wan-Animate-2-Lite, ikke nødvendigvis den større Base-modellen. I artikkelen beskrives en prosess i tre trinn: forhåndstrening med teacher forcing, bruk av en feillogg og Self-Forcing-destillering med tilbakepropagering i videobiter. Dette gjør autoregressiv strømming mulig, der videoen genereres fortløpende i mindre segmenter. 1
Den rapporterte ytelsen er 24 bilder i sekundet ved 400 × 720 piksler på fire H100-GPU-er. Det er et viktig teknisk resultat, særlig for digitale avatarer og interaktive figurer, men det bør ikke tolkes som at modellen leverer 720p-video med 24 bilder i sekundet på en vanlig hjemmemaskin. 1
8
Alibabas paper og tilhørende sammenligninger rapporterer resultater på nivå med proprietære verktøy som ByteDances Dreamina og Kuaishous KLING MotionControl. Brukerundersøkelser og kvalitative tester beskrives som konkurransedyktige, og flere omtaler bruker formuleringen «kommersiell SOTA» – altså resultater på høyeste kommersielle nivå. 1
3
Her er det likevel grunn til å være presis. Evalueringene er i hovedsak utviklerens egne tester og brukerundersøkelser, ikke uavhengige og standardiserte benchmarker. Påstandene er derfor lovende, men bør foreløpig leses som sterke, interne resultater – ikke som et endelig bevis på at modellen er best i alle situasjoner. 1
3
Alibaba har gjort modellvekter, kode og verktøy for inferens tilgjengelig under Apache 2.0-lisensen. Det gjør at utviklere kan inspisere systemet, kjøre det på egen infrastruktur, tilpasse det og bygge det inn i egne produksjonsflyter, i stedet for å være avhengige av en lukket skytjeneste og betaling per generert sekund. 1
2
Dette treffer et konkret problem i AI-video: Det er blitt stadig enklere å lage enkeltstående videoklipp, men langt vanskeligere å holde en figur konsekvent gjennom en hel scene. Identitet, hender, samspill mellom figurer, kameraretning og lav forsinkelse har vært praktiske flaskehalser for alt fra virtuelle verter til spill, reklame og filmproduksjon. En åpen modell kan gjøre det lettere for andre utviklere å forbedre nettopp disse delene.
Wan-Animate-2 dekker først og fremst den kreative kontrollen over figurens opptreden: Hvordan en figur beveger seg, hvem den er, hvordan flere figurer samhandler og hvordan scenen filmes.
Wan3.0 er rettet mot den andre enden av arbeidsflyten. Alibaba sier at modellen kan lage videoer på opptil 30 sekunder fra blant annet dokumenter, regneark, presentasjoner og nettsider, i tillegg til mer vanlige multimodale inndata. 2
Det kan i teorien gi en arbeidsflyt der forretningsmateriale først blir til et videoutkast, før Wan-Animate-2 brukes til å kontrollere en figur eller en animert opptreden. Men modellene er separat distribuert, så dette er en mulig kombinasjon av verktøy – ikke dokumentasjon på at Alibaba allerede tilbyr én samlet, ende-til-ende produksjonsplattform. 2
Den neste testen blir ikke bare hvor imponerende demoene ser ut. Det avgjørende er om miljøet rundt modellen raskt får på plass stabile noder og integrasjoner, minneeffektiv inferens, gode verktøy for maskering og compositing, bedre arbeidsflyter for figurkonsistens og varianter som fungerer på rimeligere GPU-er.
Åpen lisens gjør rask utbredelse mulig, men maskinvarekostnader, treningsdataenes lisensiering, reproduserbarhet og kvaliteten på integrasjonene vil avgjøre tempoet. Wan-Animate-2 viser at kinesiske laboratorier nå kan levere åpen videoteknologi som hevder å konkurrere med lukkede tjenester. Om den blir en ny standard, vil avhenge av hvor raskt utviklerfellesskapet klarer å gjøre teknologien praktisk – ikke bare imponerende på papiret.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Wan Animate 2 animerer en referansefigur basert på en såkalt driving video, samtidig som figurens identitet skal bevares.
Wan Animate 2 animerer en referansefigur basert på en såkalt driving video, samtidig som figurens identitet skal bevares. Modellen sender videodata direkte inn i en redesignet Diffusion Transformer, i stedet for først å hente ut et bevegelsesskjelett eller komprimere bevegelsen.
Den lette Lite versjonen er rapportert å strømme med 24 bilder i sekundet i 400 × 720 oppløsning på fire H100 GPU er.