Wan Animate 2 animuje referenční postavu podle řídicího videa a snaží se zachovat její identitu. Model neposílá pohyb přes kostru ani komprimovaný pohybový popis; video zpracovává přímo v upraveném Diffusion Transformeru.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Alibaba v srpnu 2026 zveřejnila Wan-Animate-2, otevřený systém pro animaci postav z řídicího videa. Uživatel dodá obrázek nebo jinou referenci postavy a video, v němž někdo předvádí požadovaný pohyb. Model pak přenese výkon na postavu a zároveň se snaží zachovat její vzhled a identitu. 1
2
Největší změna se skrývá v tom, co se děje mezi vstupem a výsledným videem. Starší animační postupy často nejprve extrahují záběru kostru člověka – například klouby, klíčové body nebo jinou zjednodušenou reprezentaci pohybu. Wan-Animate-2 tento mezikrok vynechává: řídicí video posílá přímo do přepracovaného Diffusion Transformeru, tedy difuzního transformátoru, který se učí generovat video postupným odstraňováním šumu. 1
Kosterní model je praktický, ale zároveň může být zdrojem chyb. Špatně nalezený loket nebo prst se promítne do celé animace. Komprese pohybu navíc může odstranit jemné informace o mimice, rukou, kontaktu mezi postavami nebo o přesném časování gesta.
Wan-Animate-2 pracuje s vizuálními latentními informacemi z celého řídicího videa. Jeho dvouvětvová architektura DiT odděluje čistou referenční a pohybovou větev od větve, která během generování odšumuje výstup. Pomocí časového zarovnání a mechanismů pozornosti se tyto informace propojují přímo v modelu. Výsledkem má být věrnější pohyb, stabilnější časová kontinuita a menší odchylování identity postavy. 1
5
Praktický přínos je nejvíce vidět u rukou a končetin. Autoři uvádějí lepší artikulaci prstů a méně deformovaných či chybějících končetin, protože jemné pohybové detaily nemusí projít přes zjednodušenou kostru. Výsledky zahrnují různé styly postav, tělesné proporce, vícepostavové scény i nestandardní pohyby. Neznamená to, že každý vstup bude bezchybný, ale systém má širší rozsah než typické řešení založené pouze na póze. 1
Wan-Animate-2 má zvládat několik postav v jedné scéně a udržet jejich odlišnou identitu i pohyb. Další novinkou je textové řízení pohledu kamery. Viewpoint LoRA byla trénována na syntetických víceúhlových datech vytvořených v Unreal Engine. Uživatel tak může při generování požádat například o jiný boční nebo čelní záběr, aniž by musel nahrávat nové řídicí vystoupení nebo znovu trénovat základní model. 1
3
Tato funkce odděluje pohyb předváděný v řídicím videu od výsledného kamerového pohledu. Právě to je důležité pro produkční použití: stejný výkon lze teoreticky využít pro více kompozic a záběrů, místo aby se každý úhel natáčel zvlášť.
Označení „v reálném čase“ se týká především odlehčené, destilované varianty Wan-Animate-2-Lite, nikoli plného modelu Base. Technický článek popisuje třístupňový postup zrychlení: předtrénování s učitelským nucením, používání zásobníku chyb a destilaci Self-Forcing s gradientem počítaným po blocích. To umožňuje autoregresivní streamování výstupu po částech. 1
Uváděný výsledek činí 24 snímků za sekundu při rozlišení 400 × 720 na čtyřech GPU Nvidia H100. Jde o významný posun pro živé avatary a interaktivní aplikace, nikoli však o příslib 720p streamování na běžné domácí grafické kartě. Požadavky na hardware zůstávají jedním z hlavních praktických omezení. 1
8
Článek a související uživatelské studie uvádějí výsledky srovnatelné s proprietárními nástroji Dreamina od ByteDance a KLING MotionControl od Kuaishou. Ve veřejném pokrytí se proto objevuje tvrzení, že Wan-Animate-2 dosahuje komerčního „SOTA“, tedy špičkové úrovně. 1
3
Je ale důležité zachovat odstup. Jde především o hodnocení autorů, kvalitativní porovnání a uživatelské studie, nikoli o nezávislý, standardizovaný benchmark provedený třetí stranou. Přesnější formulace proto zní, že model podle dostupných zpráv konkuruje předním komerčním systémům; definitivní pořadí ukáže až širší testování mimo pečlivě vybrané ukázky. 1
3
Alibaba zveřejnila váhy, kód a nástroje pro inference pod licencí Apache 2.0. Vývojáři mohou systém kontrolovat, provozovat na vlastním hardwaru, upravovat ho a zapojit do vlastních produkčních řetězců, aniž by byli odkázáni pouze na uzavřenou cloudovou službu nebo platbu za každou sekundu videa. 1
2
Právě ovladatelná animace postav byla dlouho slabým místem generativního videa. Vytvořit působivý krátký záběr je jedna věc; udržet v delší scéně stejnou identitu, ruce, interakce, směr pohledu kamery a nízkou latenci je věc druhá. Wan-Animate-2 se snaží tuto mezeru zmenšit tím, že spojuje věrný přenos výkonu s možností lokálního nasazení. 1
2
Otevřený model však automaticky neznamená snadné použití. O adopci rozhodne, zda komunitní nástroje rychle nabídnou úspornější inference, masking a kompozici, konzistentní pracovní postupy pro postavy, kvalitní uzly pro ComfyUI a varianty použitelné na spotřebitelských GPU. Důležité budou také reprodukovatelnost výsledků, náklady na hardware a otázky licencování tréninkových dat.
Wan-Animate-2 řeší především výkon a ovládání postav. Wan3.0 míří na opačný konec workflow: Alibaba uvádí, že dokáže vytvářet až třicetisekundová videa z dokumentů, tabulek, prezentací a webových stránek vedle běžných multimodálních vstupů. 2
V kombinaci tyto technologie naznačují cestu od firemních podkladů k animovanému videu. Nejde však o jeden integrovaný produkční balík. Wan3.0 je samostatně nasazovaný produkt, zatímco Wan-Animate-2 je otevřený animační framework. Skutečné propojení by vyžadovalo další nástroje pro převod obsahu dokumentu na scénář, postavy, záběry a následnou kompozici.
Wan-Animate-2 tak není jen další model pro přenos pohybu. Jeho význam spočívá v kombinaci přímého zpracování videa, širší kontroly nad scénou, snahy o streamování v reálném čase a otevřené dostupnosti. Teprve komunita a nezávislé testy ukážou, zda se z této technické demonstrace stane skutečně použitelný základ otevřeného ekosystému pro AI video.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Wan Animate 2 animuje referenční postavu podle řídicího videa a snaží se zachovat její identitu.
Wan Animate 2 animuje referenční postavu podle řídicího videa a snaží se zachovat její identitu. Model neposílá pohyb přes kostru ani komprimovaný pohybový popis; video zpracovává přímo v upraveném Diffusion Transformeru.
Odlehčená verze Wan Animate 2 Lite dosahuje podle autorů 24 snímků za sekundu při rozlišení 400 × 720 na čtyřech GPU H100.