Wan Animate 2 anime un personnage de référence à partir d’une vidéo de mouvement tout en préservant son identité, sans convertir au préalable la scène en squelette de pose. Son Diffusion Transformer traite directement les informations visuelles de la vidéo, ce qui doit aider à conserver les détails des mains, du vis...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 est un système d’animation de personnages développé par Tongyi Lab, le laboratoire d’Alibaba à l’origine de la famille Wan. Il suffit de fournir une image ou une référence de personnage ainsi qu’une vidéo « conductrice » : le modèle reprend les mouvements et les expressions de cette vidéo pour animer le personnage, tout en essayant de conserver son apparence et son identité. 1
La nouveauté centrale ne tient donc pas seulement à la qualité des images. Elle concerne la manière dont le mouvement est représenté et transmis au modèle.
Les systèmes d’animation classiques passent souvent par une étape intermédiaire : ils extraient les articulations d’une personne sous la forme d’un squelette, de points de repère ou d’une représentation compressée du mouvement. Cette approche simplifie le problème, mais elle peut aussi introduire des erreurs dès l’extraction ou faire disparaître des détails importants.
Wan-Animate-2 supprime cette étape. Son architecture de type Diffusion Transformer — ou DiT — reçoit directement les informations latentes de la vidéo de mouvement. Elle repose sur deux branches : une branche de référence, maintenue dans un état propre, fournit des informations d’apparence et de mouvement à la branche chargée du débruitage. Cette organisation permet au modèle de mieux aligner l’identité du personnage et la dynamique de la scène au fil des images. 1
L’intérêt est concret : le modèle n’est pas obligé de reconstruire des gestes fins à partir de quelques articulations abstraites. Il peut exploiter davantage d’indices visuels et temporels présents dans la vidéo originale.
Les mains, les doigts et les membres restent parmi les points faibles de la génération vidéo. Une pose mal détectée ou une représentation trop compressée peut produire des doigts fusionnés, des bras déformés ou des membres qui disparaissent entre deux images.
Selon les auteurs, le fait de conserver les dynamiques visuelles détaillées de la vidéo aide Wan-Animate-2 à améliorer l’articulation des mains et à réduire les déformations ou les absences de membres. Les démonstrations et évaluations couvrent également plusieurs styles de personnages, morphologies, scènes réunissant plusieurs personnes et types de mouvements. Cela suggère un champ d’utilisation plus large que celui de systèmes strictement conditionnés par la pose, sans garantir pour autant un résultat parfait avec chaque vidéo d’entrée. 1
Wan-Animate-2 ne se limite pas à un personnage isolé. Le framework vise aussi les scènes où plusieurs personnages apparaissent simultanément, chacun devant conserver sa propre identité et suivre son propre mouvement. 1
3
Autre fonction notable : le contrôle du point de vue. Alibaba présente une Viewpoint LoRA conditionnée par le texte, entraînée à l’aide de données multi-vues synthétiques produites dans Unreal Engine. En pratique, l’utilisateur peut demander un autre angle de caméra à l’inférence, sans filmer une nouvelle performance ni réentraîner le modèle d’animation de base. 1
Cette dissociation entre le mouvement de la vidéo source et le cadrage final est importante pour la mise en scène. Elle évite de considérer la vidéo conductrice comme un moule dont la caméra serait obligatoirement copiée à l’identique.
Il faut toutefois distinguer les deux versions. La génération en temps réel est principalement attribuée à Wan-Animate-2-Lite, une variante distillée et allégée, plutôt qu’au modèle Base complet.
Le document de recherche décrit une accélération en trois étapes : un préentraînement avec teacher forcing, la constitution d’un tampon d’erreurs, puis une distillation Self-Forcing avec rétropropagation par blocs (chunk-wise backpropagation). Cette méthode permet une génération autorégressive par segments et un affichage progressif du résultat. 1
La performance annoncée est de 24 images par seconde en 400 × 720 sur quatre GPU H100. C’est un jalon significatif pour un outil ouvert, notamment pour les avatars et les applications interactives. Mais il ne faut pas l’interpréter comme une génération vidéo 720p à 24 images par seconde sur une carte graphique grand public ou un ordinateur portable. 1
8
Les comparaisons qualitatives et les études auprès d’utilisateurs présentées par les auteurs indiquent des résultats compétitifs avec des outils propriétaires comme Dreamina de ByteDance et KLING MotionControl de Kuaishou. Plusieurs articles parlent même de performances comparables ou à parité avec ces services. 1
3
Cette nuance est essentielle : il s’agit principalement d’évaluations rapportées par les développeurs et non d’un benchmark indépendant, normalisé et reproduit par un tiers. L’expression « état de l’art commercial » doit donc être comprise comme une revendication solide, mais encore provisoire. La qualité observée sur des exemples sélectionnés devra être confirmée sur des vidéos variées, des mouvements difficiles et des usages de production réels.
Wan-Animate-2 a été publié avec ses poids, son code et ses outils d’inférence sous licence Apache 2.0, une licence permissive qui facilite l’étude, l’auto-hébergement, l’adaptation et l’intégration dans des logiciels tiers. 1
2
Pour les développeurs, l’enjeu dépasse la simple possibilité de télécharger un modèle. L’animation contrôlable de personnages — continuité de l’identité, fidélité des mains, interactions entre personnages, direction de la caméra et faible latence — constitue l’un des maillons encore fragiles entre la génération de clips isolés et la fabrication de vidéos réellement exploitables.
Un modèle ouvert peut aussi accélérer l’apparition de nœuds pour ComfyUI, de modules de masquage et de compositing, de workflows de cohérence des personnages, d’optimisations de mémoire et de versions adaptées aux GPU grand public. La vitesse d’adoption dépendra toutefois du coût matériel, de la reproductibilité des résultats, des questions de licence liées aux données d’entraînement et de la qualité des intégrations communautaires.
Wan-Animate-2 et Wan3.0 répondent à deux problèmes différents. Le premier se concentre sur la performance d’un personnage et son contrôle à l’image. Le second vise surtout l’entrée de production pour les entreprises : Alibaba indique que Wan3.0 peut générer des vidéos allant jusqu’à 30 secondes à partir de documents, de tableurs, de présentations et de pages web, en plus des entrées multimodales plus habituelles. 2
On peut imaginer une chaîne allant d’un document commercial ou d’un scénario à une vidéo animée, mais il serait excessif d’y voir déjà une suite de production intégrée de bout en bout. Wan3.0 est un produit déployé séparément, tandis que Wan-Animate-2 est un framework ouvert consacré au transfert de performance et à l’animation de personnages.
La sortie de Wan-Animate-2 montre surtout que les laboratoires chinois ne se contentent plus de proposer des modèles vidéo fermés ou des démonstrations ponctuelles : ils mettent aussi à disposition des briques ouvertes capables de rivaliser, au moins dans certaines évaluations, avec des services commerciaux établis.
La question décisive sera désormais celle de l’écosystème. Si les outils open source ajoutent rapidement des workflows fiables pour les masques, le montage, la cohérence d’un personnage sur une séquence longue et l’inférence sur du matériel moins coûteux, Wan-Animate-2 pourrait contribuer à faire de l’animation de personnages une brique standard de la vidéo générative. Dans le cas contraire, ses performances resteront surtout accessibles aux équipes disposant de moyens de calcul importants.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Wan Animate 2 anime un personnage de référence à partir d’une vidéo de mouvement tout en préservant son identité, sans convertir au préalable la scène en squelette de pose.
Wan Animate 2 anime un personnage de référence à partir d’une vidéo de mouvement tout en préservant son identité, sans convertir au préalable la scène en squelette de pose. Son Diffusion Transformer traite directement les informations visuelles de la vidéo, ce qui doit aider à conserver les détails des mains, du visage, des interactions et des mouvements complexes.
La version allégée Wan Animate 2 Lite atteint 24 images par seconde en 400 × 720 sur quatre GPU H100 : une performance en temps réel, mais pas sur un ordinateur grand public ordinaire.