Wan Animate 2 animerer en referencefigur ud fra en styrende video og forsøger samtidig at bevare figurens identitet. Modellen behandler videoens visuelle latenter direkte i en redesignet Diffusion Transformer i stedet for først at udlede et kropsskelet.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 er Alibabas Tongyi Labs open source-system til karakteranimation. Det kan animere en figur ud fra en reference og en styrende video, samtidig med at figurens udseende og identitet bevares. Modellen blev offentliggjort i august 2026 med modelvægte, kode og inferensværktøjer under Apache 2.0-licensen. 1
2
Det centrale ved Wan-Animate-2 er ikke blot, at den kan få en figur til at bevæge sig. Det er måden, bevægelsen føres ind i modellen på.
Mange karakteranimationssystemer bruger en mellemstation: Først udtrækker de kropspunkter eller et skelet fra den styrende video, hvorefter modellen forsøger at overføre denne pose til en anden figur. Andre systemer komprimerer bevægelsen til et særskilt feature-format.
Wan-Animate-2 springer disse trin over. Den sender i stedet den styrende videos visuelle latenter direkte ind i en redesignet Diffusion Transformer, eller DiT. Arkitekturen bruger to grene: en ren reference- og bevægelsesgren, der holdes ved tidspunktet t=0, og en støjfyldt gren, som står for selve afstøjningen. De to grene forbindes blandt andet gennem tidsjusteret RoPE og opmærksomhedsmekanismer, der kan genbruge information om referencefigurens udseende og videoens bevægelse. 1
5
Fordelen er, at modellen ikke først skal stole på et potentielt upræcist poseudtræk. Skeletbaserede workflows kan miste information eller introducere fejl, mens komprimerede bevægelsesfeatures kan udviske små, men vigtige detaljer i hænder, ansigter og fysisk samspil. Ifølge forskerne giver den direkte tilgang bedre rumlig og tidsmæssig sammenhæng samt mere stabil identitet. 1
Hænder og lemmer har længe været blandt de sværeste elementer i genereret video. Alibabas paper tilskriver Wan-Animate-2's bedre håndbevægelser og færre forvrængede eller manglende lemmer, at de fine visuelle bevægelsesdata ikke presses gennem et skelet som mellemled. 1
Evalueringerne omfatter forskellige figurstile, kropsformer, bevægelser og scener med flere personer. Det peger på et bredere anvendelsesområde end systemer, der primært er afhængige af en bestemt pose- eller kropsrepræsentation. Det betyder dog ikke, at modellen vil håndtere alle input fejlfrit, eller at resultaterne automatisk holder uden for de udvalgte eksempler i evalueringen. 1
En anden nyhed er tekststyret kontrol af kameraets synsvinkel. En såkaldt Viewpoint LoRA er trænet med syntetiske multiview-data fra Unreal Engine. Den skal gøre det muligt at adskille den ønskede outputvinkel fra kamerabevægelsen i den styrende video. 1
I praksis kan en bruger derfor bede om en anden kameravinkel uden at optage en ny performance eller træne grundmodellen igen. Systemet er også beskrevet som egnet til animation med flere figurer, hvor hver figur kan bevare sin egen identitet og bevægelse. 1
3
Wan-Animate-2's realtidstal kræver en vigtig præcisering. Det er primært den destillerede Wan-Animate-2-Lite – ikke Base-modellen – der er udviklet til streaming i realtid.
Paperet beskriver en accelerationsproces i tre dele: fortræningsfasen med teacher forcing, en fejlbuffert og Self-Forcing-distillation med chunk-baseret backpropagation. Det gør autoregressiv generering i bidder mulig, så videoen kan vises løbende i stedet for først at blive færdiggjort som én samlet sekvens. 1
Den rapporterede hastighed er 24 billeder i sekundet ved 400×720 på fire H100-GPU'er. Det er en væsentlig teknisk demonstration, men bør ikke læses som 24 billeder i sekundet i 720p på en almindelig hjemmecomputer eller et standard-GPU-setup. 1
8
Alibabas paper sammenligner systemet kvalitativt med kommercielle værktøjer som ByteDances Dreamina og Kuaishous KLING MotionControl. Forskerne rapporterer også brugerundersøgelser, hvor resultaterne er konkurrencedygtige med disse lukkede tjenester, mens omtale af projektet beskriver en form for paritet. 1
3
Det er dog udviklernes egne evalueringer – ikke en uafhængig og standardiseret benchmark. Derfor bør formuleringer som ”kommerciel SOTA” forstås som et stærkt, men foreløbigt krav. Den praktiske kvalitet vil også afhænge af inputvideoer, hardware, parametre og hvor godt systemet fungerer uden for kuraterede tests.
Når vægte, kode og inferensværktøjer udgives under Apache 2.0, kan udviklere undersøge, tilpasse, selvhoste og integrere teknologien i egne workflows i stedet for at være afhængige af en lukket cloudtjeneste. 1
2
Det er særligt relevant, fordi karakteranimation stadig er et praktisk svagt led i AI-video. Det er én ting at generere et enkelt klip. Det er noget andet at holde en figurs identitet stabil gennem flere scener, få hænder og interaktioner til at fungere, styre kameraet og samtidig holde latenstiden lav.
Den åbne udgivelse kan derfor gøre Wan-Animate-2 til et vigtigt byggesten i lokale og kommercielle produktionspipelines. Hvor hurtigt det sker, afhænger dog af, om community-værktøjer hurtigt får stabile noder, hukommelseseffektiv inferens, masking og compositing, bedre workflows til figurkonsistens samt varianter, der kan køre på forbruger-GPU'er.
Wan-Animate-2 fokuserer på performance- og figurkontrol: Hvordan får man en bestemt figur til at følge en bevægelse og stadig se ud som sig selv?
Wan3.0 fokuserer i højere grad på input-siden i en virksomheds workflow. Alibaba oplyser, at modellen kan skabe videoer på op til 30 sekunder ud fra blandt andet dokumenter, regneark, præsentationer og websider samt mere traditionelle multimodale input. 2
Sammen peger de to systemer på en mulig kæde fra virksomhedens kildemateriale til animeret video. Men de er fortsat separat distribuerede produkter, så kombinationen er ikke i sig selv dokumentation for en samlet, integreret produktionssuite.
Den langsigtede prøve bliver, om Wan-Animate-2's rapporterede kvalitet kan reproduceres i virkelige projekter. Hardwareomkostninger, licenser omkring træningsdata, reproducerbarhed og kvaliteten af integrationerne vil i sidste ende afgøre, hvor hurtigt kinesiske AI-laboratoriers nu konkurrencedygtige videoteknologi bliver en standard i open source-økosystemet.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Wan Animate 2 animerer en referencefigur ud fra en styrende video og forsøger samtidig at bevare figurens identitet.
Wan Animate 2 animerer en referencefigur ud fra en styrende video og forsøger samtidig at bevare figurens identitet. Modellen behandler videoens visuelle latenter direkte i en redesignet Diffusion Transformer i stedet for først at udlede et kropsskelet.
Den destillerede Wan Animate 2 Lite kan ifølge paperet streame med 24 billeder i sekundet ved 400×720 på fire H100 GPU'er.