Wan Animate 2是阿里巴巴通义实验室的开源角色动画系统:用户提供角色参考图和一段驱动视频,模型可在保留角色身份的同时复现动作与表情。其核心变化是将动作学习放入端到端扩散Transformer,而不是先转换成骨骼姿态或压缩动作特征。[1] 直接处理驱动视频的视觉潜变量,有助于保留手部、面部表情和人物互动中的细节,减少姿态提取误差、身份漂移以及肢体扭曲或缺失。[1] 系统支持多角色场景、不同体型和角色风格,并可通过文本控制生成视角;用户无需重新拍摄驱动表演,也不必为改变镜头角度重新训练基础模型。[1][3]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2是阿里巴巴通义实验室推出的开源角色动画框架。它的典型用法是:输入一张角色参考图,再提供一段人物表演或动作视频作为“驱动视频”,模型便尝试让参考角色完成相应动作,同时保持面部、服装和整体身份特征的连续性。1
它真正值得关注的地方,不只是生成速度,而是动作信息的进入方式发生了变化:模型不再依赖传统的骨骼姿态提取,也不先把动作压缩为中间运动特征,而是让驱动视频的视觉潜变量直接进入重新设计的扩散Transformer(Diffusion Transformer,简称DiT)。1
传统的姿态驱动流程通常要先从视频中识别关键点、骨骼或其他动作表示,再让生成模型根据这些中间结果制作角色动画。这样的管线更容易解释和控制,但也会带来两个问题:
Wan-Animate-2采用双分支DiT:一条参考/动作分支保持干净的驱动信息,另一条分支负责噪声去除,二者在模型内部对齐。按照论文的设计,这种方式能够保留更细密的时空线索,从而改善动作连贯性和角色身份一致性。1
这也是它试图改善“AI角色动画常见瑕疵”的关键所在。论文将更自然的手部动作,以及更少的肢体扭曲、缺失现象,归因于模型保留了原始视频中的细粒度视觉动态,而不是强行把动作压缩到骨骼中间表示里。1
Wan-Animate-2并不局限于单一人物或标准人体。论文和相关发布信息涵盖了不同角色风格、体型、动作以及多人场景。不过,这些结果代表模型在测试和示例中的能力范围,并不能保证任何输入都能稳定生成同样的效果。1
镜头控制是另一个实用升级。系统加入了文本条件Viewpoint LoRA,并使用虚拟多视角数据进行训练。推理时,用户可以用文字要求输出新的摄像机视角,使角色表演与镜头方向相对分离。也就是说,改变视角不必重新收集一段驱动表演,也不必重新训练基础动画模型。1
这为角色替换、虚拟人、游戏预演和短视频制作提供了更灵活的工作方式:同一段表演素材可以尝试不同的观察角度,而不必把每个镜头都重新拍一遍。
实时能力主要属于蒸馏版 Wan-Animate-2-Lite,而不是应该与之混同的完整Base模型。论文介绍了一条包含教师强制预训练、误差缓冲区和Self-Forcing蒸馏的加速路径,并通过分块反向传播支持自回归式的视频块流式生成。1
论文报告的具体结果是:在4块H100 GPU上,Wan-Animate-2-Lite可在400×720分辨率下达到24帧/秒。1
8这个数据说明它已经接近实时角色动画的工程门槛,但不能解读为“普通家用显卡也能以720p、24帧/秒运行”。实际体验仍会受到显存、推理设置、输入长度和部署优化等因素影响。
论文中的定性对比和用户研究显示,Wan-Animate-2的结果可与Dreamina、KLING MotionControl等闭源商业工具竞争,部分公开报道则直接使用了“相当”或“持平”的表述。1
3
不过,“商业SOTA”目前更适合作为强有力但仍待验证的判断,而不是已经被独立基准完全确立的结论。现有证据主要来自开发团队论文中的实验、对比图和用户研究,以及基于这些材料的行业报道,并非所有模型都在统一数据集、统一硬件和统一评测协议下接受独立测试。1
3
因此,真正重要的后续观察点是:模型在非精选样例、复杂遮挡、快速动作和长视频中是否仍能保持稳定;社区复现时是否能得到接近论文的质量;以及部署成本是否足以支持实际生产。
Wan-Animate-2以Apache-2.0许可公开模型权重、代码和推理工具。对开发者而言,这意味着角色动画不再只能通过封闭平台或按量计费的API获得,还可以被检查、自行托管、修改,并嵌入已有的内容生产流程。1
2
这一步的意义在于,AI视频行业的瓶颈往往不再是“能不能生成一个短片”,而是能否持续、可控地生成一个角色:身份要稳定,手和四肢要自然,人物之间要能互动,镜头要能按要求变化,延迟还要足够低。开源模型若能把这些能力交给开发者,便有机会把一次性的演示推进到可重复的制作管线。
但“公开代码”不等于“低门槛运行”。硬件成本、训练数据的许可问题、复现难度,以及与ComfyUI等下游工具的集成质量,都会影响它能否真正普及。社区是否能迅速补齐显存优化、遮罩与合成、角色一致性工作流和消费级GPU版本,同样是决定采用速度的关键。
Wan-Animate-2解决的是工作流中的“表演与角色控制”部分:让参考角色跟随驱动视频完成动作,并保留身份和细节。
Wan3.0则更偏向“企业输入”一端。阿里巴巴表示,Wan3.0不仅能接收传统的文本、图像、音频和视频输入,还可以读取文档、电子表格、演示文稿和网页,并生成最长30秒的视频。2
二者放在一起,确实让人看到一条从业务资料到动画输出的可能路径:企业资料负责提供内容,角色动画模型负责呈现和表演。但目前它们是分别部署的产品,不能据此断言阿里巴巴已经提供了一个整合完成的端到端制作套件。2
Wan-Animate-2的发布降低了使用和研究门槛,也把竞争从“谁拥有最好的封闭演示”进一步推向“谁能建立最好用的开放工作流”。接下来,社区工具能否快速跟进,可能比单次榜单成绩更能说明它的实际影响力。
如果开发者能够围绕它构建稳定节点、低显存推理、精确遮罩、多角色管理、镜头合成和消费级硬件适配,Wan-Animate-2就可能成为开源角色视频制作的重要基础组件。反之,如果高质量结果只能在昂贵硬件和精选素材上实现,它的影响力仍可能主要停留在研究展示层面。
换句话说,Wan-Animate-2已经展示了中国AI实验室在角色视频控制方面与商业系统竞争的潜力;但它能否成为默认的开源技术栈,最终取决于可复现性、成本和整合体验,而不只是论文中的效果图和24帧/秒这一指标。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Wan Animate 2是阿里巴巴通义实验室的开源角色动画系统:用户提供角色参考图和一段驱动视频,模型可在保留角色身份的同时复现动作与表情。其核心变化是将动作学习放入端到端扩散Transformer,而不是先转换成骨骼姿态或压缩动作特征。[1]
Wan Animate 2是阿里巴巴通义实验室的开源角色动画系统:用户提供角色参考图和一段驱动视频,模型可在保留角色身份的同时复现动作与表情。其核心变化是将动作学习放入端到端扩散Transformer,而不是先转换成骨骼姿态或压缩动作特征。[1] 直接处理驱动视频的视觉潜变量,有助于保留手部、面部表情和人物互动中的细节,减少姿态提取误差、身份漂移以及肢体扭曲或缺失。[1]
系统支持多角色场景、不同体型和角色风格,并可通过文本控制生成视角;用户无需重新拍摄驱动表演,也不必为改变镜头角度重新训练基础模型。[1][3]