Wan Animate 2は、参照画像のキャラクターを駆動動画の動きに合わせてアニメーション化しながら、キャラクターの外見やアイデンティティを維持するAlibaba Tongyi Labのオープンなシステムです。 骨格やランドマークを先に抽出せず、駆動動画の視覚的な潜在情報を再設計したDiffusion Transformerへ直接入力することで、手・顔・体の細かな時間的変化を保持します。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2は、1枚のキャラクター画像などを参照素材として、別の人物やキャラクターが演じる「駆動動画」の動きを反映させるキャラクターアニメーションシステムです。動きを移し替えながら、顔立ちや衣装など、元キャラクターのアイデンティティを保つことを目指します。AlibabaのTongyi Lab(旧Tongyi Wanxiangチーム)が2026年8月に公開しました。1
2
最大の特徴は、動きをいったん人間の骨格や圧縮済みのモーション特徴へ変換しないことです。Wan-Animate-2は、駆動動画そのものの視覚的な潜在情報を、再設計したDiffusion Transformer(DiT)に直接読み込ませます。1
従来型のポーズ制御では、まず動画から関節やランドマークを抽出し、その情報をもとにキャラクターを動かします。しかし、この途中処理で関節の位置を誤認すると、手足の形が崩れたり、動きに対してキャラクターの同一性が揺らいだりする可能性があります。また、モーションを圧縮した中間表現に変換すると、手指、表情、人物同士の接触といった細部が失われることもあります。1
Wan-Animate-2では、クリーンな参照・モーション側のブランチと、ノイズ除去を行うブランチを組み合わせるデュアルブランチDiTを採用しています。これにより、駆動動画に含まれる細かな時空間情報をより直接的に利用し、動きの連続性とキャラクターの一貫性を高める設計です。1
論文では、こうした設計によって手の動きがより自然になり、手足の欠損や大きな変形が減ったと説明しています。異なるキャラクターデザイン、体型、複数人のシーン、さまざまな動きにも対応する結果が示されていますが、あらゆる入力で同じ品質を保証するものではありません。1
Wan-Animate-2は、キャラクターの動きだけでなく、出力映像のカメラ視点も制御できます。テキスト条件付きのViewpoint LoRAを、Unreal Engineで作成した合成マルチビュー映像を使って学習し、駆動動画の演技と出力側のカメラ位置を切り分けます。1
そのため、推論時に別のカメラアングルを指示しても、新しい演技動画を撮影したり、基盤モデルを再学習したりせずに視点を変更できるとされています。複数キャラクターや複数カメラへの対応も、Wan-Animate-2の主要な拡張点です。1
3
リアルタイム性を担うのは、主にフルサイズのBaseモデルではなく、蒸留版のWan-Animate-2-Liteです。論文では、教師強制による事前学習、エラーバッファー、チャンク単位の逆伝播を用いたSelf-Forcing蒸留という3段階の高速化手法を説明しています。これにより、映像を小さなチャンクごとに自己回帰的に生成してストリーミングできます。1
報告されている性能は、4基のH100 GPUを使った400×720解像度で24fpsです。1
8 これはオープンなキャラクターアニメーション基盤として重要な到達点ですが、「一般的な家庭用GPUで720p・24fpsが動く」という意味ではありません。実運用ではGPUメモリ、生成設定、動画の長さ、周辺処理の負荷が大きく影響します。
論文の定性的比較とユーザー調査では、ByteDanceのDreaminaやKuaishouのKLING MotionControlといった商用ツールに対して競争力のある結果が報告されています。外部報道でも、商用サービスとの同等性を示す説明が見られます。1
3
ただし、これらは開発者側が実施した評価であり、独立した標準ベンチマークによる検証とは異なります。そのため、「商用SOTA(最先端)」という表現は、強い可能性を示す主張ではあるものの、現時点では確定的な業界評価として受け取るより、今後の再現検証を待つべきでしょう。1
3
Wan-Animate-2では、モデルの重み、コード、推論スクリプト、関連ツールがApache-2.0ライセンスで公開されています。1
2 開発者はクラウドAPIだけに依存せず、自分の環境でモデルを検証し、ワークフローに組み込み、用途に合わせて改変できます。
キャラクターアニメーションは、単発の短い映像を生成する段階から、制作に使える連続映像へ進む際の難所でした。キャラクターの同一性、手や顔の表現、人物同士の相互作用、カメラ方向、低遅延処理を同時に扱う必要があるためです。ローカルで利用できる基盤が登場すれば、研究用の実験だけでなく、マスキングや合成、ゲーム、ライブアバター、映像制作向けの自動化にも組み込みやすくなります。1
2
Wan-Animate-2が担うのは、制作工程のうち「演技をキャラクターへ移し、動きや視点を制御する」側です。一方、Wan3.0は、文書、表計算シート、スライド、ウェブページなどを含む企業向けの入力から、最大30秒の動画を生成するモデルとしてAlibabaが展開しています。2
両者を組み合わせれば、企画書や商品資料などの業務素材から映像を作り、そこへ制御可能なキャラクター演技を加えるという流れが想像できます。ただし、Wan3.0は別途提供される製品であり、両者が統合された一つのエンドツーエンド制作スイートであることを示すものではありません。2
Wan-Animate-2がオープンな標準基盤として広がるかどうかは、論文のデモ品質だけでは決まりません。今後は、次のような周辺実装が重要になります。
オープンなライセンスは導入のハードルを下げますが、必要なハードウェアのコスト、学習データに関するライセンス、結果の再現性、既存制作ツールとの統合品質は別の課題として残ります。Wan-Animate-2が、中国の研究機関が開発する競争力のある動画技術を、実際に使えるオープンソース基盤へ変えられるかは、今後のコミュニティと実運用で決まることになります。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Wan Animate 2は、参照画像のキャラクターを駆動動画の動きに合わせてアニメーション化しながら、キャラクターの外見やアイデンティティを維持するAlibaba Tongyi Labのオープンなシステムです。
Wan Animate 2は、参照画像のキャラクターを駆動動画の動きに合わせてアニメーション化しながら、キャラクターの外見やアイデンティティを維持するAlibaba Tongyi Labのオープンなシステムです。 骨格やランドマークを先に抽出せず、駆動動画の視覚的な潜在情報を再設計したDiffusion Transformerへ直接入力することで、手・顔・体の細かな時間的変化を保持します。
軽量版Wan Animate 2 Liteは、4基のH100 GPUを使った400×720解像度で24fpsのリアルタイム生成を報告しています。ただし、一般的なPCで同じ性能が出ることを意味するものではありません。