Wan Animate 2 是阿里巴巴 Tongyi Lab 的開源角色動畫系統,可用一段驅動影片帶動參考角色,同時維持角色身分與外觀。 模型跳過傳統的骨架姿態擷取與動作特徵壓縮,直接處理驅動影片的視覺潛在資訊,有助於保留手部、臉部與角色互動的細節。[1] 即時串流主要來自蒸餾版 Wan Animate 2 Lite;官方論文報告其在 4 張 H100 GPU 上,以 400×720 解析度達到 24 fps。[1][8]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 是阿里巴巴 Tongyi Lab(通義實驗室)的開源角色動畫框架。它的基本工作方式是:使用一張角色參考圖或參考角色,搭配一段真人或其他角色的「驅動影片」,讓輸出角色重現影片中的動作與表情,同時盡量保留原角色的身分、外觀與服裝特徵。1
這類技術的難點不只是讓角色「動起來」,而是要在連續影格中維持臉部、手部、四肢、服裝和角色互動的穩定性。Wan-Animate-2 的主要突破,在於不再先把影片轉換成骨架姿態或壓縮後的動作特徵,而是讓模型直接從驅動影片學習動態資訊。1
傳統的姿態控制流程通常會先擷取人體關鍵點或骨架,再把這些中間結果交給生成模型。這種做法便於控制,但也可能帶來關鍵點偵測錯誤、動作資訊遺失,以及角色身分逐漸漂移等問題。若動作進一步被壓縮成低維度特徵,手指、臉部表情、細微肢體變化和多人互動等細節也可能被捨棄。1
Wan-Animate-2 將驅動影片的視覺潛在資訊直接送入重新設計的 Diffusion Transformer(DiT,擴散 Transformer)。其雙分支架構包含一條保持乾淨參考與動態資訊的分支,並與負責去噪生成的分支對齊,讓模型能在較完整的時空脈絡中處理外觀與動作。1
換句話說,模型不是只接收「手臂應該彎曲到哪裡」這種抽象指令,而是直接參考影片裡手部、臉部與身體在連續畫面中的視覺變化。這也是研究團隊認為它能提升動作保真度、時間一致性與角色身分保持能力的原因。1
研究團隊表示,保留更細緻的視覺動態後,Wan-Animate-2 在手部關節表現上更自然,也較少出現四肢扭曲、缺失或不完整的情況。1
論文展示的範圍也涵蓋不同角色風格、身形、多人物場景與多種動作。這並不代表模型對任何輸入都能完美處理,但相較於高度依賴骨架中間表示的系統,它的適用範圍更廣,尤其適合需要保留角色特色、細部表情與互動關係的動畫工作。1
Wan-Animate-2 另一項重要功能是文字控制視角。研究團隊使用以 Unreal Engine 製作的合成多視角資料訓練 Viewpoint LoRA,讓輸出影片的攝影機視點能與原始驅動影片分開控制。1
因此,使用者可以在推論時要求不同的鏡頭角度,而不必重新拍攝一段新的表演,也不必重新訓練基礎動畫模型。這讓角色動作控制與鏡頭調度不再完全綁定,有利於製作多機位畫面、角色展示與互動場景。1
3
Wan-Animate-2 的「即時」能力主要來自蒸餾版 Wan-Animate-2-Lite,而不是完整的 Base 模型。論文描述的加速流程包括教師強制預訓練、錯誤緩衝區,以及結合分塊反向傳播的 Self-Forcing 蒸餾,藉此支援自回歸式的分塊串流生成。1
官方報告的即時表現為:在 4 張 H100 GPU 上,以 400×720 解析度達到每秒 24 幀。這確實是開源角色動畫的重要進展,但不能解讀成一般使用者只靠家用電腦就能以 720p、24 fps 即時生成。1
8
實際部署時,顯示卡記憶體、推論最佳化、影片長度、批次設定與工作流程整合,都會影響速度。因此,「可即時串流」與「適合消費級硬體即時運作」是兩個不同的判斷。
論文中的質化比較與使用者研究顯示,Wan-Animate-2 的結果可與 Dreamina 和 KLING MotionControl 等封閉式商用工具競爭;部分公開報導則使用「達到同等水準」或「商用 SOTA」來形容。1
3
不過,這些結果主要來自開發團隊公布的評估與比較,並非獨立機構執行的標準化基準測試。因此,「商用 SOTA」目前更適合作為一項強而有力、但仍待外部驗證的主張,而不是已經完全確立的產業結論。1
3
Wan-Animate-2 於 2026 年 8 月公開權重、程式碼與推論工具,並採用 Apache-2.0 授權;相關模型與工具也透過公開平台提供下載。1
2 這使角色動畫不再只是封閉平台中的訂閱功能,開發者可以檢視模型、自行部署、進行調整,或將它嵌入既有的製作管線。
對 AI 影片產業而言,角色動畫一直是從「生成單一片段」走向「製作可用影片」的重要瓶頸。角色能否在多個鏡頭中維持身分、手部是否自然、多人互動是否穩定、鏡頭能否獨立控制,以及生成延遲是否足夠低,往往比單一畫面的視覺效果更直接影響實際製作效率。1
2
本地可部署的模型也讓團隊能更容易建立遮罩、合成、角色一致性與即時互動等客製化流程,而不必把所有素材上傳至封閉式雲端服務。不過,硬體成本、訓練資料授權、結果可重現性與商業使用條款,仍會影響企業是否真正採用。
兩者解決的是工作流程中的不同問題。Wan-Animate-2 著重於「表演與角色控制」:如何讓一個角色跟隨驅動影片完成動作、表情與互動。Wan3.0 則更偏向「企業素材輸入」:阿里巴巴表示,它除了傳統的文字、圖片、音訊與影片,也能從文件、試算表、簡報和網頁內容生成最長 30 秒的影片。2
從概念上看,兩者可能形成一條從商業資料到動畫內容的路徑:Wan3.0 讀取企劃簡報或產品資料,Wan-Animate-2 再負責可控的角色演出。但目前兩者是分開部署的產品,不能據此宣稱阿里巴巴已提供整合完成的端到端製作套件。2
Wan-Animate-2 能否真正成為開源角色動畫的重要基礎,不只取決於論文展示的畫面品質,也取決於社群能否快速補齊實務工具,包括穩定的節點整合、節省記憶體的推論方案、遮罩與合成、角色一致性工作流,以及適用於消費級 GPU 的版本。
同時,模型在精選展示案例之外是否仍能維持表現,也需要更多獨立測試。寬鬆授權降低了採用門檻,但硬體費用、資料授權、重現難度與工具整合品質,才會決定中國 AI 影片模型的競爭力能否進一步轉化為廣泛使用的開源技術堆疊。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Wan Animate 2 是阿里巴巴 Tongyi Lab 的開源角色動畫系統,可用一段驅動影片帶動參考角色,同時維持角色身分與外觀。
Wan Animate 2 是阿里巴巴 Tongyi Lab 的開源角色動畫系統,可用一段驅動影片帶動參考角色,同時維持角色身分與外觀。 模型跳過傳統的骨架姿態擷取與動作特徵壓縮,直接處理驅動影片的視覺潛在資訊,有助於保留手部、臉部與角色互動的細節。[1]
即時串流主要來自蒸餾版 Wan Animate 2 Lite;官方論文報告其在 4 張 H100 GPU 上,以 400×720 解析度達到 24 fps。[1][8]