Wan Animate 2 מנפיש דמות מתוך תמונת ייחוס וסרטון מניע, תוך ניסיון לשמר את הזהות, המראה וההבעות שלה. במקום לחלץ שלד תנוחה או לדחוס את התנועה לייצוג ביניים, המודל מעבד את המידע החזותי של הסרטון ישירות בתוך Diffusion Transformer.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 הוא מערכת קוד פתוח של מעבדת Tongyi Lab באליבאבא, שנועדה להנפיש דמות מתוך סרטון מניע — למשל סרטון של אדם שמבצע תנועה — תוך שמירה על הזהות והמראה של דמות הייחוס. החידוש המרכזי אינו רק באיכות הווידאו, אלא באופן שבו המודל מייצג תנועה: היא נלמדת מקצה לקצה בתוך Diffusion Transformer שעוצב מחדש, במקום לעבור תחילה דרך שלד גוף או ייצוג תנועה דחוס. 1
במערכות מסורתיות יותר, הסרטון המניע עובר תחילה חילוץ של נקודות מפתח או שלד תנוחה. כל שגיאה בשלב הזה עלולה להפוך לעיוות בתוצאה: ידיים לא נכונות, גפיים חסרות או דמות שמתחילה להתרחק מהמראה המקורי שלה. גם דחיסת התנועה לייצוג ביניים עלולה למחוק פרטים עדינים של כפות הידיים, הבעות הפנים ומגע בין דמויות.
Wan-Animate-2 מזין את המידע החזותי הגולמי של הסרטון ישירות למודל. הארכיטקטורה משתמשת ב-DiT דו-ענפי: ענף אחד שומר את מידע הייחוס והתנועה הנקייה, בעוד הענף האחר מבצע את תהליך הדיפוזיה והדה-נויזינג. כך המודל יכול לשמר רמזים מרחביים וזמניים עדינים יותר, ולשפר את העקביות לאורך הסרטון ואת שימור הזהות. 1
לפי המאמר, השארת פרטי התנועה בתוך הייצוג החזותי — במקום לכפות אותם דרך שלד — מסייעת לאנימציה מדויקת יותר של ידיים ולהפחתת עיוותים או היעלמות של גפיים. הניסויים כוללים סגנונות דמות, מבני גוף, סצנות מרובות משתתפים ותנועות מגוונות. אין בכך הבטחה שכל קלט יצליח, אך מדובר בטווח פעולה רחב יותר מזה שמאפיין בדרך כלל מערכות המותנות בשלד תנוחה. 1
המערכת תומכת גם בהנפשה של כמה דמויות באותה סצנה, תוך ניסיון לשמור לכל אחת על זהות ועל תנועה נפרדות. בנוסף, היא מיועדת להתמודד עם יחסי גובה־רוחב שאינם סטנדרטיים ועם מגוון טיפוסי גוף, נקודות שבהן מערכות וידאו גנרטיביות נוטות להיכשל כאשר הן נדרשות לעבור מהדגמות מבוקרות לשימוש אמיתי.
אחת התוספות הבולטות היא Viewpoint LoRA המותנה בטקסט. היא אומנה באמצעות נתוני multi-view סינתטיים שנוצרו ב-Unreal Engine, ומטרתה להפריד בין זווית המצלמה הרצויה לבין סרטון הביצוע המקורי.
בפועל, המשתמש יכול לבקש זווית צילום אחרת בזמן ההסקה — למשל צילום מהצד או מזווית גבוהה — בלי לצלם מחדש את הביצוע ובלי לאמן מחדש את מודל האנימציה הבסיסי. 1
חשוב להבחין בין שני המודלים. קצב ההפקה בזמן אמת מיוחס בעיקר לגרסה המזוקקת Wan-Animate-2-Lite, ולא בהכרח לגרסת ה-Base המלאה.
המאמר מתאר תהליך האצה בן שלושה שלבים: אימון מקדים ב-teacher forcing, שימוש ב-error buffer, ולאחר מכן זיקוק Self-Forcing עם backpropagation לפי מקטעים. התהליך מאפשר יצירת מקטעים אוטורגרסיבית והזרמתם בזמן שהווידאו ממשיך להיווצר.
התוצאה המדווחת היא 24 פריימים בשנייה ברזולוציה של 400×720 על ארבעה מעבדי H100. זהו הישג משמעותי עבור מערכת פתוחה, אבל אין לקרוא לו בטעות "720p בקצב 24 פריימים לשנייה על כל מחשב": הדרישה לחומרה מקצועית עדיין גבוהה. 1
8
המאמר מציג השוואות איכותניות ומחקרי משתמשים שבהם Wan-Animate-2 מתחרה במערכות מסחריות סגורות כמו Dreamina של ByteDance ו-KLING MotionControl של Kuaishou. דיווחים חיצוניים תיארו את התוצאות כשוות ערך או קרובות לשוויון. 1
3
עם זאת, מדובר בעיקר בהערכות שדווחו על ידי המפתחים ובהשוואות שאינן בהכרח מבחן בלתי תלוי, אחיד וסטנדרטי. לכן נכון יותר להתייחס לטענת ה-SOTA המסחרית כהישג מבטיח וחזק — אך עדיין כטענה שדורשת אימות רחב יותר מחוץ לדוגמאות שנבחרו.
כאשר המשקולות, הקוד וכלי ההסקה זמינים ברישיון Apache-2.0, מפתחים יכולים לבדוק את המערכת, להריץ אותה בעצמם, להתאים אותה ולשלב אותה בצינורות עבודה קיימים — בלי להסתמך בהכרח על API סגור או על חיוב לפי שניית וידאו. 1
2
המשמעות המעשית רחבה יותר מעוד מודל שמייצר קליפ מרשים. באנימציית דמויות, האתגר הוא לשמור לאורך זמן על זהות הדמות, תנועות ידיים, אינטראקציות, כיוון מצלמה והשהיה נמוכה. אלה בדיוק המרכיבים שמפרידים בין יצירת סרטון בודד לבין הפקת וידאו שאפשר לערוך, להפעיל ולשלב במוצר.
Wan-Animate-2 מטפל בצד של ביצוע ושליטה בדמות. Wan3.0 מטפל בצד של חומר המקור הארגוני: לפי Alibaba, הוא יכול ליצור סרטונים באורך של עד 30 שניות ממסמכים, גיליונות אלקטרוניים, מצגות ודפי אינטרנט, לצד קלטים מולטימודליים רגילים. 2
יחד, שני הכיוונים מצביעים על מסלול אפשרי מחומר עסקי גולמי ועד פלט וידאו מונפש. אבל אין להסיק מכך שמדובר בחבילת הפקה משולבת מקצה לקצה: Wan3.0 הוא מוצר שנפרס בנפרד, ואינו הוכחה לאינטגרציה מלאה עם Wan-Animate-2. 2
המדד החשוב לא יהיה רק סרטון הדגמה, אלא קצב ההתפתחות סביב המודל. אימוץ מהיר ידרוש כלי קהילה יציבים, צמתים ל-ComfyUI ולמערכות דומות, הסקה חסכונית בזיכרון, מסכות וקומפוזיטינג, תהליכי עבודה לשמירת עקביות דמות וגרסאות שמתאימות למעבדי GPU צרכניים.
במקביל, יהיה צורך לבדוק אם האיכות נשמרת גם בקלטים פחות מבוקרים. עלויות החומרה, רישוי נתוני האימון, יכולת השחזור ואיכות האינטגרציה יקבעו אם הטכנולוגיה הפתוחה של מעבדות סיניות תהפוך במהירות לשכבת ברירת המחדל של אנימציית דמויות — או תישאר בעיקר הדגמה מרשימה למפתחים בעלי תשתית חזקה.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Wan Animate 2 מנפיש דמות מתוך תמונת ייחוס וסרטון מניע, תוך ניסיון לשמר את הזהות, המראה וההבעות שלה.
Wan Animate 2 מנפיש דמות מתוך תמונת ייחוס וסרטון מניע, תוך ניסיון לשמר את הזהות, המראה וההבעות שלה. במקום לחלץ שלד תנוחה או לדחוס את התנועה לייצוג ביניים, המודל מעבד את המידע החזותי של הסרטון ישירות בתוך Diffusion Transformer.
הגישה נועדה לשמר פרטים עדינים של כפות הידיים, הפנים והאינטראקציות, ולהפחית עיוותים בגפיים ואובדן זהות.