Wan Animate 2 — открытая система Alibaba Tongyi Lab, которая переносит движения из управляющего видео на персонажа образец, стараясь сохранить его внешность и индивидуальность. Модель не извлекает промежуточный скелет и не сжимает движение в отдельное представление: видео поступает непосредственно в переработанный D...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 — это открытый фреймворк Alibaba Tongyi Lab для анимации персонажей. На вход подаются изображение или другой референс персонажа и управляющее видео с движениями человека либо другого объекта. Модель переносит мимику, жесты и динамику на героя, одновременно стараясь сохранить его лицо, одежду и общую идентичность. 1
Главное отличие от многих прежних пайплайнов — отказ от обязательного промежуточного скелета. Вместо того чтобы сначала извлекать ключевые точки тела, а затем восстанавливать по ним движение, Wan-Animate-2 передаёт визуальную информацию управляющего видео непосредственно в переработанный Diffusion Transformer. 1
В классической схеме ошибка может появиться уже на этапе поиска суставов и landmarks: система неверно распознаёт кисть, лицо или положение конечности, а последующие этапы лишь распространяют эту ошибку. Сжатое представление движения также способно потерять мелкие детали — например, артикуляцию пальцев, выражение лица или взаимодействие нескольких персонажей.
Wan-Animate-2 использует двухветочную архитектуру DiT. Чистая reference/motion-ветка передаёт ключи и значения, связанные с внешностью и движением, в ветку денойзинга, которая работает с зашумлённым видео. Такой подход позволяет сохранить более тонкие пространственно-временные признаки и, по утверждению авторов, улучшает согласованность движения и идентичности персонажа. 1
Разработчики связывают улучшение движений рук и уменьшение числа артефактов — искривлённых или исчезающих конечностей — с тем, что мелкая визуальная динамика не проходит через жёсткое скелетное представление. В опубликованных результатах также рассматриваются разные стили персонажей, телосложение, многоперсонажные сцены и разнообразные движения. Это расширяет область применения системы, но не означает, что каждый входной ролик будет обработан безошибочно. 1
Модель рассчитана не только на стандартный одиночный персонаж в обычном формате кадра. Заявленные сценарии включают нескольких героев в одной сцене и нестандартные соотношения сторон, что важно для вертикальных роликов, аватаров и интерактивных приложений. 1
3
Отдельная функция — текстовое управление точкой зрения камеры. Для этого используется Viewpoint LoRA, обученная на синтетических мног ракурсных данных из Unreal Engine. Она отделяет желаемый ракурс результата от камеры исходного управляющего видео.
На практике это означает, что пользователь может попросить показать персонажа сбоку или под другим углом, не снимая новую актёрскую сцену и не переобучая основную модель. Речь идёт именно о заявленной возможности управления ракурсом, а не о гарантии идеального восстановления любого вида персонажа в каждом кадре. 1
Здесь важно не смешивать возможности двух версий. Потоковая генерация в реальном времени относится прежде всего к облегчённой и дистиллированной Wan-Animate-2-Lite, а не к полной Base-модели.
В статье описан трёхэтапный путь ускорения:
Эта схема позволяет генерировать видео авторегрессионными чанками — небольшими последовательностями кадров, которые выдаются по мере работы модели. Alibaba сообщает о скорости 24 кадра/с при разрешении 400×720 на четырёх GPU H100. Это серьёзный показатель для потоковой анимации, но его нельзя трактовать как «720p и 24 кадра/с на обычном домашнем компьютере». 1
8
В статье и пользовательских исследованиях авторы сравнивают систему с закрытыми инструментами, включая Dreamina от ByteDance и KLING MotionControl от Kuaishou. Результаты заявлены как конкурентоспособные, а в публичных материалах встречается формулировка о сопоставимости с коммерческими лидерами. 1
3
При этом это в первую очередь оценки разработчиков и качественные сравнения, а не независимый стандартизированный бенчмарк. Поэтому формулировку «коммерческий SOTA» стоит воспринимать как сильную, но пока предварительную заявку. Реальная проверка — работа модели на разнообразных пользовательских сценах, а не только на отобранных демонстрациях.
Alibaba выпустила веса, код и инструменты инференса под лицензией Apache 2.0. Для разработчиков это означает возможность изучать модель, запускать её локально или на собственных серверах, адаптировать под свои задачи и встраивать в производственные цепочки без обязательной зависимости от закрытого облачного API. 1
2
Это особенно важно потому, что управляемая анимация персонажа долго оставалась слабым звеном генеративного видео. Одно дело — получить отдельный красивый клип. Другое — сохранить одного и того же героя между сценами, аккуратно передать движения рук и взаимодействия, контролировать камеру и выдавать результат с небольшой задержкой. Wan-Animate-2 пытается закрыть именно этот разрыв.
Однако открытая модель не отменяет практических ограничений. Для широкого распространения понадобятся экономичный инференс, устойчивые узлы и плагины, маскирование и композитинг, инструменты поддержания постоянства персонажа, а также варианты для потребительских GPU. Не менее важны воспроизводимость результатов, условия использования обучающих данных и качество интеграций.
Wan-Animate-2 решает задачу управления исполнением и персонажем: как перенести выступление на героя и сохранить контроль над сценой. Wan3.0 находится на другой стороне производственного процесса — он ориентирован на исходные материалы для бизнеса. Alibaba заявляет, что модель может создавать видео длительностью до 30 секунд на основе документов, таблиц, презентаций и веб-страниц наряду с обычными мультимодальными входами. 2
Вместе эти направления показывают возможную цепочку: от корпоративного материала к видеосценарию и далее к анимированному персонажу. Но это пока не единый подтверждённый сквозной продукт: Wan3.0 распространяется отдельно, а его возможности не являются доказательством готового интегрированного производственного комплекса. 2
Ключевым тестом станет не только качество демо, но и скорость, с которой сообщество создаст вокруг Wan-Animate-2 удобную экосистему. Важны будут поддержка ComfyUI и других инструментов, снижение требований к памяти, удобное управление масками и персонажами, стабильная многоперсонажная анимация и запуск на более доступном оборудовании.
Открытая лицензия создаёт условия для быстрого распространения технологии. Но станет ли Wan-Animate-2 основой нового открытого стека для анимации, зависит от того, подтвердятся ли заявленные результаты на реальных задачах и удастся ли сообществу превратить исследовательский фреймворк в надёжный рабочий инструмент.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Wan Animate 2 — открытая система Alibaba Tongyi Lab, которая переносит движения из управляющего видео на персонажа образец, стараясь сохранить его внешность и индивидуальность.
Wan Animate 2 — открытая система Alibaba Tongyi Lab, которая переносит движения из управляющего видео на персонажа образец, стараясь сохранить его внешность и индивидуальность. Модель не извлекает промежуточный скелет и не сжимает движение в отдельное представление: видео поступает непосредственно в переработанный Diffusion Transformer.
Реальная потоковая генерация заявлена прежде всего для облегчённой Wan Animate 2 Lite: 24 кадра/с при разрешении 400×720 на четырёх GPU H100.