Wan Animate 2는 참조 캐릭터 이미지와 구동 영상을 바탕으로 캐릭터의 정체성을 유지한 채 움직임과 표정을 생성하는 오픈 캐릭터 애니메이션 시스템이다. 기존처럼 먼저 포즈 스켈레톤을 추출하거나 동작 특징을 압축하지 않고, 구동 영상의 시각적 잠재 정보를 재설계한 Diffusion Transformer에 직접 입력한다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2는 알리바바 Tongyi Lab이 공개한 캐릭터 애니메이션 시스템이다. 참조 이미지 속 캐릭터에 사람이 연기하는 구동 영상(driving video)의 움직임과 표정을 입히면서도 얼굴, 의상, 체형 등 캐릭터의 정체성을 유지하는 것이 핵심 기능이다. 2026년 8월 공개된 이 모델의 가장 큰 변화는 움직임을 먼저 포즈 데이터로 변환하지 않는다는 점이다. 1
일반적인 캐릭터 애니메이션 파이프라인은 영상에서 관절 위치나 랜드마크를 추출해 스켈레톤을 만들고, 이를 다시 캐릭터에 적용한다. 이 과정은 관절 검출 오류, 손가락 정보 손실, 얼굴과 신체의 불일치, 캐릭터 정체성의 흔들림을 낳을 수 있다. Wan-Animate-2는 이 중간 단계를 건너뛰고 구동 영상 자체의 시각 정보를 모델이 학습하도록 설계됐다. 1
모델의 중심에는 재설계된 이중 브랜치 Diffusion Transformer(DiT)가 있다. 한쪽 브랜치는 깨끗한 참조·동작 정보를 유지하고, 다른 쪽은 노이즈가 섞인 영상을 디노이징한다. 두 브랜치를 정렬해 처리함으로써 움직임뿐 아니라 영상 속 시간적·공간적 세부 정보도 생성 과정에 반영한다. 1
이 방식이 중요한 이유는 동작을 단순한 관절 좌표나 압축 특징으로 바꾸는 순간 사라질 수 있는 정보가 많기 때문이다. 손가락의 미세한 굽힘, 얼굴 근육의 변화, 팔다리와 소품의 상호작용 같은 요소가 대표적이다. 연구진은 원본 영상의 세밀한 동적 정보를 보존한 결과 손 표현이 개선되고, 팔다리가 일그러지거나 사라지는 현상이 줄었다고 설명한다. 1
다만 이는 모든 입력에서 완벽한 결과를 보장한다는 뜻은 아니다. 논문이 제시한 실험은 서로 다른 캐릭터 스타일과 체형, 여러 사람이 함께 등장하는 장면, 다양한 동작을 포함해 기존 포즈 조건 방식보다 넓은 적용 범위를 보여주는 데 초점이 맞춰져 있다. 1
Wan-Animate-2는 캐릭터의 움직임을 옮기는 데 그치지 않고 출력 영상의 카메라 시점도 제어한다. 합성 멀티뷰 데이터를 활용해 학습한 텍스트 조건부 Viewpoint LoRA를 통해 사용자는 구동 영상과 다른 카메라 각도를 요청할 수 있다. 1
따라서 새로운 각도에 맞춰 출연자가 다시 연기하거나 기본 애니메이션 모델을 재학습할 필요가 없다. 한 장면을 정면, 측면, 사선 등 여러 시점으로 확장하려는 제작 워크플로에서 특히 유용한 기능이다. 시스템은 여러 캐릭터가 한 장면에 등장하는 경우도 지원하며, 각 캐릭터의 정체성과 움직임을 구분해 처리하는 것을 목표로 한다. 1
3
Wan-Animate-2의 실시간 생성 성능은 전체 Base 모델보다 경량 증류 버전인 Wan-Animate-2-Lite에 해당한다. 논문은 교사 강제 사전 학습, 오류 버퍼, 청크 단위 역전파를 포함한 Self-Forcing 증류 과정을 거쳐 자동회귀 방식의 청크 스트리밍을 구현했다고 설명한다. 1
보고된 성능은 H100 GPU 4장으로 400×720 해상도에서 초당 24프레임이다. 이는 실시간 캐릭터 애니메이션에 의미 있는 수치지만, 일반적인 개인용 컴퓨터에서 720p 영상을 초당 24프레임으로 생성할 수 있다는 의미는 아니다. 실제 사용 가능성은 GPU 메모리, 최적화 수준, 영상 길이와 입력 조건에 따라 크게 달라질 수 있다. 1
8
논문과 관련 공개 자료는 Wan-Animate-2가 바이트댄스의 Dreamina, 콰이쇼우의 KLING MotionControl 같은 상용 도구와 비교해 경쟁력 있는 결과를 보였다고 보고한다. 일부 보도는 양쪽 성능이 비슷한 수준이라고 표현한다. 1
3
그러나 현재 근거는 개발사가 제시한 정성적 비교와 사용자 연구에 기반한다. 독립 기관이 동일한 데이터와 평가 기준으로 실시한 표준화 벤치마크와는 다르다. 따라서 ‘상용 최고 수준(SOTA)’이라는 표현은 유망한 개발사 측 주장으로 이해하는 편이 정확하며, 다양한 실제 입력에서의 재현성은 추가 검증이 필요하다. 1
3
알리바바는 Wan-Animate-2의 모델 가중치와 코드, 추론 도구를 Apache-2.0 라이선스로 공개했다. 개발자는 폐쇄형 서비스의 API에만 의존하지 않고 모델을 직접 내려받아 검사하고, 자체 서버에 배포하고, 다른 제작 도구나 상용 파이프라인에 맞게 수정할 수 있다. 1
2
AI 영상 제작에서 짧은 클립 하나를 만드는 일과 반복 사용 가능한 캐릭터를 제작하는 일 사이에는 큰 간극이 있었다. 캐릭터의 얼굴과 의상을 장면마다 유지하고, 손과 팔다리를 자연스럽게 표현하며, 여러 인물의 상호작용과 카메라 방향까지 통제해야 하기 때문이다. Wan-Animate-2 같은 모델은 바로 이 ‘캐릭터 성능 제어’ 문제를 오픈 생태계로 가져온다. 1
2
앞으로는 ComfyUI 같은 워크플로 도구에 노드가 얼마나 빠르게 추가되는지, 메모리 절약형 추론과 마스킹·합성 기능이 얼마나 안정적으로 지원되는지가 중요하다. 소비자용 GPU에서 실행 가능한 변형 모델과 캐릭터 일관성 관리 도구의 등장 여부도 실제 확산 속도를 좌우할 전망이다.
Wan-Animate-2가 영상 제작의 ‘연기와 캐릭터 제어’ 단계에 초점을 맞춘다면, Wan3.0은 기업이 가진 자료를 영상 제작의 입력으로 바꾸는 데 초점을 둔다. 알리바바에 따르면 Wan3.0은 일반적인 텍스트·이미지·음성·영상 입력뿐 아니라 문서, 스프레드시트, 프레젠테이션, 웹페이지를 바탕으로 최대 30초 분량의 영상을 만들 수 있다. 2
두 기술이 결합되면 기업 문서나 기획 자료에서 출발해 캐릭터가 등장하는 영상까지 이어지는 제작 흐름을 상상할 수 있다. 다만 Wan3.0은 별도로 제공되는 제품이며, 두 모델이 하나의 통합된 엔드투엔드 제작 제품군으로 배포됐다는 의미는 아니다. 2
결국 Wan-Animate-2의 채택을 결정할 요소는 공개 자체보다 생태계의 완성도다. 하드웨어 비용, 학습 데이터의 라이선스 문제, 결과 재현성, 실제 현업 도구와의 통합 수준이 관건이다. 공개 라이선스는 중국 연구소의 경쟁력 있는 영상 기술이 빠르게 확산될 수 있는 길을 열었지만, 그것이 곧바로 오픈소스 표준이 된다는 보증은 아니다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Wan Animate 2는 참조 캐릭터 이미지와 구동 영상을 바탕으로 캐릭터의 정체성을 유지한 채 움직임과 표정을 생성하는 오픈 캐릭터 애니메이션 시스템이다.
Wan Animate 2는 참조 캐릭터 이미지와 구동 영상을 바탕으로 캐릭터의 정체성을 유지한 채 움직임과 표정을 생성하는 오픈 캐릭터 애니메이션 시스템이다. 기존처럼 먼저 포즈 스켈레톤을 추출하거나 동작 특징을 압축하지 않고, 구동 영상의 시각적 잠재 정보를 재설계한 Diffusion Transformer에 직접 입력한다.
증류 모델인 Wan Animate 2 Lite는 H100 GPU 4장 기준 400×720 해상도에서 초당 24프레임 스트리밍 성능을 보고했다. [1][8]