Wan Animate 2 係阿里巴巴 Tongyi Lab 開源嘅角色動畫系統:用一段驅動影片帶動參考角色,同時盡量保留角色身份。 模型唔再先抽取骨骼姿勢,亦唔將動作壓縮成中間特徵,而係將驅動影片嘅視覺 latent 直接交畀重新設計嘅 Diffusion Transformer 處理。[1] 官方論文指呢種設計有助保留手部、面部表情同角色互動等細節,減少身份飄移、肢體變形或缺失等問題。[1]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
簡單講,Wan-Animate-2 係阿里巴巴 Tongyi Lab 推出嘅開放式角色動畫系統。使用者提供一張角色參考圖,再加一段「驅動影片」——例如真人表演或者另一個角色嘅動作片段——模型就可以將當中嘅動作同表情套落參考角色身上,同時維持角色本身嘅外觀同身份。1
佢最關鍵嘅改變,唔係單純將模型做得更大,而係改變咗讀取動作嘅方法:傳統流程通常會先從影片抽取人體關鍵點、骨骼姿勢,或者將動作壓縮成一組 motion features;Wan-Animate-2 就直接將驅動影片送入重新設計嘅 Diffusion Transformer,嘗試由模型端到端學習動作同角色之間嘅關係。1
骨骼姿勢係一種方便嘅中間表示,但亦可能帶來兩類問題:第一,關鍵點抽取錯咗,後面嘅動畫就會一齊偏;第二,將原始影片壓縮成骨骼或者低維動作特徵時,手指、面部細節、衣物變化同角色互動等資訊可能會流失。
Wan-Animate-2 以雙分支 DiT 處理驅動影片嘅視覺 latent:一邊係乾淨嘅參考/動作分支,另一邊係進行去噪嘅分支,兩者互相對齊。論文認為,保留較完整嘅時空視覺訊號,可以提升動作流暢度同身份一致性,亦減少傳統姿勢管線常見嘅 landmark 錯誤同身份漂移。1
換句話講,模型唔係只問「骨骼去咗邊度」,而係直接參考影片入面角色係點樣郁、點樣屈手、點樣做表情,以及身體各部分點樣一齊互動。
研究團隊將較自然嘅手部關節動作,以及較少出現扭曲、缺失肢體,歸因於模型保留咗更細緻嘅視覺動態,而唔係將所有動作迫入骨骼中間層。1
測試亦涵蓋唔同角色風格、身形、多角色場景同多種動作。呢個唔等於任何輸入都一定完美,但至少代表系統嘅適用範圍唔只限於標準人體姿勢,對非典型身形或者較複雜互動亦有更大操作空間。1
Wan-Animate-2 另一個重點係文字控制視角。研究團隊以 Unreal Engine 生成嘅多視角合成資料訓練 Viewpoint LoRA,將輸出鏡頭方向同原本嘅驅動影片分開處理。1
因此,使用者可以喺推理時用文字要求另一個攝影機角度,而唔需要重新拍一段表演影片,亦唔需要重新訓練基本動畫模型。對需要同一段角色表演配合唔同景別、鏡位或者多鏡頭剪接嘅工作流程,呢種控制會比單純複製原片視角實用得多。1
3
要先分清楚 Base 同 Lite 兩個版本。論文所講嘅即時生成,主要係經蒸餾嘅 Wan-Animate-2-Lite,唔係完整 Base 模型本身。1
8
論文描述咗一條三階段加速路線,包括 teacher-forcing 預訓練、error buffer,同埋配合 chunk-wise backpropagation 嘅 Self-Forcing 蒸餾,令模型可以用自回歸方式逐段串流輸出。1
公開報告嘅成績係:喺 4 張 H100 GPU 上,以 400×720 解像度達到每秒 24 幀。呢個對直播虛擬角色或者互動式動畫係一項重要能力,但唔應該解讀成「普通本地硬件都可以 720p、24fps 即時生成」。硬件門檻仍然相當高。1
8
論文嘅質化比較同用戶研究,報告 Wan-Animate-2 嘅表現可以同 Dreamina、KLING MotionControl 等閉源商業工具競爭;部分公開報道更形容佢達到相若水平。1
3
不過,呢啲主要係開發團隊及相關報告所呈現嘅評估,未必等同獨立、統一標準嘅第三方 benchmark。因此,「商業 SOTA」可以理解為一個有力但仍然需要外部驗證嘅主張,而唔係已經完全定論。1
3
Wan-Animate-2 以 Apache-2.0 釋出權重、程式碼同推理工具,令角色動畫唔再只係封閉平台入面嘅一項功能。開發者可以檢視模型、自行部署、按需要修改,再將佢嵌入製作管線;相關開放工具亦有機會接入 ComfyUI、Diffusers 或其他生產環境。1
2
8
AI 影片生成過去一個實際樽頸,就係「生成到單一片段」同「控制一個角色完成可用表演」之間仍有距離。角色身份要保持一致,手部要自然,互動要合理,鏡頭要可以指定,輸出仲要夠快——呢幾樣同時做到,往往比生成一個孤立畫面困難。Wan-Animate-2 將呢部分能力開放畀社群測試,有機會加快由示範片段走向真正製作流程。1
2
兩者處理嘅係工作流程兩端,唔應該當成同一個整合產品。
兩者放埋一齊,的確令人聯想到由商業資料開始,再去到角色化、動畫化輸出嘅工作流程;但 Wan3.0 係獨立部署嘅產品,唔代表現時已經存在一套由文件到角色動畫嘅完整端到端生產套件。2
Wan-Animate-2 能否成為常用開源方案,唔只睇論文示範片。接落來更值得觀察嘅係社群會唔會快速補齊以下部分:穩定節點、慳記憶體推理、遮罩同合成、角色一致性工作流,以及適合消費級 GPU 嘅版本。
同時,模型喺精心挑選嘅案例之外,對不同影片質素、身形、鏡頭運動同複雜互動嘅表現亦需要更多獨立測試。Apache-2.0 降低咗採用門檻,但硬件成本、訓練資料授權、結果可重現性同實際整合質素,先會決定中國 AI 實驗室目前具競爭力嘅影片技術,幾快可以變成開源製作堆疊嘅主流選擇。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Wan Animate 2 係阿里巴巴 Tongyi Lab 開源嘅角色動畫系統:用一段驅動影片帶動參考角色,同時盡量保留角色身份。
Wan Animate 2 係阿里巴巴 Tongyi Lab 開源嘅角色動畫系統:用一段驅動影片帶動參考角色,同時盡量保留角色身份。 模型唔再先抽取骨骼姿勢,亦唔將動作壓縮成中間特徵,而係將驅動影片嘅視覺 latent 直接交畀重新設計嘅 Diffusion Transformer 處理。[1]
官方論文指呢種設計有助保留手部、面部表情同角色互動等細節,減少身份飄移、肢體變形或缺失等問題。[1]