Wan Animate 2 anima un personaje de referencia a partir de un vídeo guía y aprende el movimiento directamente dentro de un Diffusion Transformer, sin convertirlo antes en un esqueleto de poses. El enfoque busca reducir errores en manos y extremidades, conservar la identidad y funcionar con distintos estilos, cuerpos...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 es el sistema abierto de animación de personajes de Alibaba Tongyi Lab. Su función central es sencilla de describir: recibe una imagen o personaje de referencia y un vídeo guía —en el que alguien realiza una actuación— para transferir el movimiento al personaje, procurando mantener su identidad visual. La diferencia técnica está en cómo interpreta ese movimiento: en lugar de extraer primero un esqueleto corporal o resumir la actuación en unas pocas características de movimiento, procesa directamente la información visual del vídeo dentro de un Diffusion Transformer rediseñado. 1
Los sistemas basados en poses suelen depender de una cadena de detección de puntos corporales. Si el modelo localiza mal una mano, una articulación o una parte del rostro, ese error puede propagarse a la animación final. Además, comprimir el movimiento antes de generarlo puede eliminar detalles sutiles de las manos, las expresiones faciales o la interacción entre personajes.
Wan-Animate-2 intenta evitar esa pérdida. Su arquitectura DiT de doble rama mantiene una rama de referencia y movimiento limpia, alineada con la rama de eliminación de ruido, para conservar señales espaciotemporales más detalladas. En términos prácticos, el modelo puede utilizar más información del vídeo original en vez de trabajar únicamente con una interpretación abstracta de la pose. 1
Según los autores, conservar esas dinámicas visuales de grano fino mejora la articulación de las manos y reduce deformaciones o extremidades ausentes. Las pruebas también abarcan distintos estilos de personaje, tipos de cuerpo, movimientos, escenas con varias personas y composiciones menos convencionales. Eso apunta a un rango de uso más amplio que el de muchos sistemas condicionados por poses, aunque no garantiza resultados perfectos con cualquier vídeo de entrada. 1
El soporte para varios personajes permite animar a más de una figura en una misma escena, manteniendo sus identidades y movimientos diferenciados. La ventaja potencial es importante para secuencias de diálogo, coreografías o escenas con interacción, donde los errores de identidad y de contacto suelen hacerse especialmente visibles.
Otra de las novedades es el control del punto de vista. Una Viewpoint LoRA condicionada por texto, entrenada con datos sintéticos de múltiples vistas generados en Unreal Engine, separa el ángulo de cámara de la actuación contenida en el vídeo fuente. Así, el usuario puede pedir otro encuadre o perspectiva durante la inferencia sin grabar una nueva actuación ni volver a entrenar el modelo base. 1
Esto no significa que el sistema convierta automáticamente cualquier plano en una producción cinematográfica terminada: la calidad dependerá de la referencia, la escena y la capacidad de la infraestructura para reconstruir las partes que no aparecen en el vídeo original. Pero sí acerca el control de cámara a un flujo de trabajo más flexible.
La generación en tiempo real corresponde principalmente a Wan-Animate-2-Lite, la variante destilada, y no al modelo Base completo. El artículo describe un proceso de aceleración en tres etapas: preentrenamiento con teacher forcing, un búfer de errores y destilación Self-Forcing con retropropagación por fragmentos. El resultado permite generar y transmitir la animación de forma autoregresiva, por bloques. 1
La cifra comunicada es de 24 fotogramas por segundo a 400×720 usando cuatro GPU H100. Es una demostración relevante de streaming, pero no debe interpretarse como 24 fps en 720p sobre un ordenador doméstico corriente. El coste de memoria, la cantidad de GPU y la configuración concreta siguen siendo factores decisivos. 1
8
Las comparaciones cualitativas y los estudios con usuarios del artículo presentan resultados competitivos con herramientas propietarias como Dreamina, de ByteDance, y KLING MotionControl, de Kuaishou. Algunos informes externos describen esa relación como una paridad con soluciones comerciales. 1
3
Conviene matizar el lenguaje de “SOTA” —state of the art, o estado del arte—. Se trata de evaluaciones comunicadas por los desarrolladores y no de una prueba independiente y estandarizada que cubra todos los escenarios. Por tanto, la afirmación de rendimiento comercial de primer nivel es prometedora, pero todavía debe comprobarse con más reproducciones y comparativas externas.
Alibaba publicó los pesos, el código y las herramientas de inferencia bajo la licencia Apache 2.0, lo que permite a los desarrolladores inspeccionar el sistema, ejecutarlo en su propia infraestructura, adaptarlo e integrarlo en flujos de producción. 1
2
Esa disponibilidad ataca uno de los cuellos de botella de la generación de vídeo: producir clips aislados resulta cada vez más sencillo, pero mantener durante una secuencia la identidad del personaje, sus manos, sus interacciones, la dirección de cámara y una latencia baja sigue siendo mucho más difícil. Un modelo abierto puede acelerar la creación de nodos, flujos de trabajo de consistencia, máscaras y composición, además de facilitar la experimentación sin depender de una API cerrada o de un pago por segundo.
La adopción, sin embargo, no está garantizada. La comunidad tendrá que resolver el consumo de memoria, la inferencia eficiente, la compatibilidad con GPU de consumo y la integración con herramientas como ComfyUI. También será importante comprobar si la calidad observada en ejemplos seleccionados se mantiene con entradas desordenadas, personajes poco habituales y escenas complejas.
Wan-Animate-2 se ocupa del extremo de actuación y control del personaje. Wan3.0 apunta al extremo de entrada empresarial: Alibaba afirma que puede generar vídeos de hasta 30 segundos a partir de documentos, hojas de cálculo, presentaciones y páginas web, además de entradas multimodales más convencionales. 2
Juntos, ambos desarrollos sugieren un recorrido interesante: convertir material empresarial en una pieza audiovisual y después controlar personajes dentro de esa producción. Pero no deben confundirse con una única suite integrada de principio a fin. Wan3.0 es un producto desplegado por separado, mientras que Wan-Animate-2 es el componente abierto centrado en la animación de personajes.
La cuestión decisiva será si los desarrolladores convierten rápidamente esta capacidad en herramientas utilizables: nodos sólidos, composición, edición de máscaras, consistencia de personajes, variantes para hardware más asequible y resultados reproducibles. La licencia permisiva facilita ese proceso; el coste del hardware, la licencia de los datos de entrenamiento, la reproducibilidad y la calidad de las integraciones determinarán la velocidad con la que la tecnología de los laboratorios chinos pase de ser competitiva a convertirse en una base habitual del ecosistema abierto de vídeo.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Wan Animate 2 anima un personaje de referencia a partir de un vídeo guía y aprende el movimiento directamente dentro de un Diffusion Transformer, sin convertirlo antes en un esqueleto de poses.
Wan Animate 2 anima un personaje de referencia a partir de un vídeo guía y aprende el movimiento directamente dentro de un Diffusion Transformer, sin convertirlo antes en un esqueleto de poses. El enfoque busca reducir errores en manos y extremidades, conservar la identidad y funcionar con distintos estilos, cuerpos y escenas con varios personajes.
La variante destilada Wan Animate 2 Lite alcanza 24 fotogramas por segundo a 400×720 en cuatro GPU H100; esa cifra no equivale a rendimiento en hardware doméstico convencional.