Wan Animate 2 هو نظام مفتوح لتحريك شخصية مرجعية اعتمادًا على فيديو أداء أو حركة، مع الحفاظ على ملامحها وهويتها. بدل تحويل الحركة أولًا إلى هيكل عظمي أو تمثيل حركي مضغوط، يعالج النموذج المعلومات البصرية الكامنة في فيديو القيادة مباشرة داخل بنية Diffusion Transformer.
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 هو نظام مفتوح لتحريك الشخصيات طوّرته Tongyi Lab التابعة لمجموعة علي بابا. فكرته الأساسية بسيطة نسبيًا: يقدّم المستخدم صورة أو مرجعًا لشخصية، إلى جانب فيديو يقود الحركة، فيحاول النموذج نقل الأداء إلى الشخصية مع الحفاظ على هويتها ومظهرها.
أعلنت Tongyi Lab إتاحة النموذج وأدوات الاستدلال والوثائق في أغسطس 2026، مع إصدار الأوزان بموجب ترخيص Apache 2.0، ما يتيح للباحثين والمطورين فحصه وتشغيله وتعديله ودمجه في مسارات إنتاجهم بدل الاعتماد على خدمة مغلقة فقط. 1
2
تعتمد كثير من أنظمة تحريك الشخصيات على خطوة وسيطة: استخراج نقاط الجسم أو «هيكل عظمي» من فيديو القيادة، ثم استخدام هذه البيانات لتوجيه نموذج التوليد. وقد تؤدي أخطاء استخراج النقاط إلى حركة غير دقيقة أو فقدان هوية الشخصية. كما يمكن للتمثيلات الحركية المضغوطة أن تتجاهل تفاصيل دقيقة في الأصابع وتعابير الوجه والتفاعل بين الشخصيات.
أما Wan-Animate-2 فيتجاوز هذه المرحلة. إذ يمرر المعلومات البصرية الكامنة في فيديو القيادة مباشرة إلى بنية معاد تصميمها من Diffusion Transformer، أو DiT، ضمن تصميم ثنائي الفروع. ويحتوي أحد الفرعين على معلومات المرجع والحركة النظيفة، بينما يعمل الآخر على عملية إزالة الضوضاء التوليدية، مع محاذاة المعلومات بينهما. ووفقًا للورقة، يساعد ذلك على الاحتفاظ بإشارات مكانية وزمنية أدق وتحسين اتساق الهوية والحركة بين الإطارات. 1
ترجع الورقة البحثية تحسن مفاصل اليدين وانخفاض حالات تشوه الأطراف أو اختفائها إلى عدم إجبار الحركة على المرور عبر تمثيل هيكلي مبسط. فبدل الاكتفاء بمواقع المفاصل، يستطيع النموذج الاستفادة من التفاصيل المرئية الموجودة في الفيديو نفسه.
وتعرض النتائج شخصيات بأنماط وأشكال أجسام مختلفة، ومشاهد تضم أكثر من شخصية، وحركات متنوعة. لكن ذلك لا يعني أن النموذج سيعطي نتيجة مثالية مع كل مدخل؛ بل يشير إلى نطاق تشغيل أوسع من الأنظمة التي تعتمد على وضعيات هيكلية محددة مسبقًا. 1
يضيف Wan-Animate-2 أيضًا طبقة Viewpoint LoRA مشروطة بالنص للتحكم في منظور الكاميرا. دُرّبت هذه الطبقة باستخدام بيانات متعددة المناظير مولدة اصطناعيًا في محرك Unreal Engine.
النتيجة العملية هي فصل زاوية التصوير المطلوبة عن فيديو الأداء الأصلي: يمكن للمستخدم طلب منظور آخر أثناء الاستدلال، من دون تصوير أداء جديد أو إعادة تدريب نموذج التحريك الأساسي. كما تشير التقارير إلى دعم المشاهد متعددة الشخصيات وتغيير المناظير، مع بقاء حركة كل شخصية وهويتها منفصلتين نسبيًا. 1
3
ينبغي التمييز بين النموذج الأساسي Wan-Animate-2 Base والإصدار المقطّر Wan-Animate-2-Lite. فالأداء الآني المعلن يرتبط أساسًا بإصدار Lite، وليس بالضرورة بالنموذج الأساسي الكامل.
تصف الورقة مسار تسريع من ثلاث مراحل يضم التدريب بأسلوب إجبار المعلم، وذاكرة للأخطاء، ثم تقطير Self-Forcing مع إجراء الانتشار العكسي على شكل مقاطع زمنية. ويتيح هذا المسار توليد المقاطع بصورة ذاتية الانحدار وبثها تدريجيًا بدل انتظار اكتمال الفيديو كله. 1
الرقم المعلن هو 24 إطارًا في الثانية بدقة 400×720 باستخدام أربع وحدات H100. وهذا إنجاز مهم في سياق خوادم الذكاء الاصطناعي، لكنه لا يعني تشغيل فيديو بدقة 720p وبسرعة 24 إطارًا في الثانية على بطاقة رسومية استهلاكية عادية. 1
8
تورد الورقة مقارنات نوعية ودراسات مستخدمين تقول إن النتائج تنافس أدوات تجارية مغلقة مثل Dreamina وKLING MotionControl، فيما وصفت تقارير عامة الأداء بأنه قريب من مستوى هذه الخدمات أو مماثل له. 1
3
لكن من المهم قراءة عبارة «الأفضل تجاريًا» بحذر. فهذه التقييمات مقدمة من المطورين أو مبنية على تجارب مرتبطة بالمشروع، وليست معيارًا مستقلًا وموحدًا يشمل جميع النماذج والظروف. لذلك تبدو النتيجة قوية، لكنها تظل ادعاءً أوليًا يحتاج إلى اختبارات خارجية على مدخلات متنوعة وغير منتقاة.
تكمن أهمية الإصدار المفتوح في أنه ينقل تحريك الشخصيات من ميزة داخل منصات مغلقة إلى مكوّن يمكن للمطورين تشغيله ذاتيًا وفحصه وتكييفه ودمجه في أدوات الإنتاج. وقد تظهر حوله تكاملات مع بيئات مثل ComfyUI وغيرها، لكن جودة هذه التكاملات وكفاءتها ستظل عاملًا مستقلًا عن جودة النموذج نفسه. 1
2
لطالما كان الحفاظ على هوية الشخصية، وحركة اليدين، والتفاعل بين الشخصيات، وتوجيه الكاميرا، وزمن الاستجابة، من أصعب حلقات إنتاج فيديو قابل للاستخدام. فإنتاج لقطة منفردة بالذكاء الاصطناعي يختلف عن تحريك شخصية باستمرارية يمكن البناء عليها في إعلان أو لعبة أو مشهد قصصي. إذا أثبت Wan-Animate-2 قدرته خارج العروض المختارة، فقد يساعد الإصدار المفتوح في سد هذه الفجوة.
يعالج Wan-Animate-2 جانب الأداء والتحكم في الشخصية من سير العمل، بينما يركز Wan3.0 على جانب مدخلات المؤسسات والمحتوى. وتقول علي بابا إن Wan3.0 يستطيع إنشاء فيديوهات تصل مدتها إلى 30 ثانية انطلاقًا من مستندات وجداول بيانات وعروض تقديمية وصفحات ويب، إلى جانب المدخلات متعددة الوسائط المعتادة. 2
قد يبدو الجمع بين القدرتين مسارًا من مادة تجارية أو مستند أعمال إلى فيديو متحرك، لكن لا يوجد في المصادر ما يثبت أنهما يشكلان حاليًا حزمة إنتاج واحدة متكاملة. Wan3.0 منتج منفصل، كما أن توفر Wan-Animate-2 مفتوحًا لا يعني أن Wan3.0 مفتوح الأوزان بالطريقة نفسها.
لن تتوقف عملية التبني على جودة النموذج في العروض التجريبية وحدها. وستكون المؤشرات الأهم هي سرعة بناء أدوات المجتمع حوله، بما في ذلك:
يمنح ترخيص Apache 2.0 المطورين مساحة واسعة للتجربة والدمج، لكن تكلفة العتاد، وترخيص بيانات التدريب، وقابلية إعادة الإنتاج، وجودة التكامل مع أدوات ما بعد الإنتاج، ستحدد مدى سرعة تحول تقنيات الفيديو المفتوحة التي تطورها المختبرات الصينية إلى خيار أساسي في منظومة الذكاء الاصطناعي المرئي.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
Wan Animate 2 هو نظام مفتوح لتحريك شخصية مرجعية اعتمادًا على فيديو أداء أو حركة، مع الحفاظ على ملامحها وهويتها.
Wan Animate 2 هو نظام مفتوح لتحريك شخصية مرجعية اعتمادًا على فيديو أداء أو حركة، مع الحفاظ على ملامحها وهويتها. بدل تحويل الحركة أولًا إلى هيكل عظمي أو تمثيل حركي مضغوط، يعالج النموذج المعلومات البصرية الكامنة في فيديو القيادة مباشرة داخل بنية Diffusion Transformer.
تقول الورقة البحثية إن هذا التصميم يحسن تفاصيل اليدين والوجه ويقلل تشوه الأطراف، كما يدعم الشخصيات المتعددة وتغيير زاوية الكاميرا عبر أوامر نصية.