Wan Animate 2 คือระบบแอนิเมชันตัวละครแบบโอเพนซอร์สของ Tongyi Lab ที่นำการเคลื่อนไหวจากวิดีโอหนึ่งไปใช้กับภาพตัวละครอ้างอิง โดยพยายามรักษาเอกลักษณ์ของตัวละครไว้ จุดเด่นคือการป้อนข้อมูลวิดีโอขับเคลื่อนเข้า Diffusion Transformer โดยตรง ไม่ต้องผ่านการสกัดโครงกระดูกหรือการบีบอัดฟีเจอร์การเคลื่อนไหว ซึ่งช่วยเก็บรายละเอียด...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Wan-Animate-2 คือระบบแอนิเมชันตัวละครแบบโอเพนซอร์สจาก Tongyi Lab ของ Alibaba ซึ่งเปิดตัวในเดือนสิงหาคม 2026 ระบบสามารถนำภาพตัวละครอ้างอิงมาเคลื่อนไหวตามวิดีโอขับเคลื่อน (driving video) พร้อมพยายามคงใบหน้า รูปลักษณ์ และอัตลักษณ์ของตัวละครไว้ 1
การเปิดตัวครั้งนี้ทำให้โมเดล น้ำหนักโมเดล สคริปต์อินเฟอเรนซ์ และเอกสารทางเทคนิคถูกเผยแพร่ภายใต้สัญญาอนุญาต Apache-2.0 ซึ่งเปิดทางให้นักพัฒนานำไปตรวจสอบ รันบนเครื่องของตนเอง และต่อยอดเข้ากับเวิร์กโฟลว์การผลิตได้มากกว่าบริการวิดีโอแบบปิด 2
ระบบแอนิเมชันจำนวนหนึ่งจะเริ่มจากการตรวจจับจุดสำคัญของร่างกาย แล้วแปลงเป็นโครงกระดูกหรือฟีเจอร์การเคลื่อนไหวแบบย่อ ก่อนส่งต่อให้โมเดลสร้างภาพ วิธีนี้อาจเกิดข้อผิดพลาดตั้งแต่ขั้นตอนตรวจจับ รวมถึงทำให้รายละเอียดเล็ก ๆ ของมือ ใบหน้า การสัมผัส หรือปฏิสัมพันธ์ระหว่างตัวละครสูญหายไป
Wan-Animate-2 เลี่ยงขั้นตอนตัวกลางดังกล่าว โดยป้อนข้อมูลแฝงจากวิดีโอขับเคลื่อนเข้า Diffusion Transformer (DiT) ที่ออกแบบใหม่โดยตรง สถาปัตยกรรมแบบสองสาขาแยกข้อมูลอ้างอิงและการเคลื่อนไหวออกจากกระบวนการลดสัญญาณรบกวน จากนั้นจัดแนวข้อมูลทั้งสองเพื่อให้โมเดลใช้สัญญาณเชิงภาพและเวลาได้ละเอียดขึ้น 1
ในทางปฏิบัติ แนวทางนี้ช่วยลดการพึ่งพาจุดข้อต่อที่ตรวจจับได้ไม่แม่น และช่วยรักษาความต่อเนื่องของตัวละครระหว่างเฟรม เป้าหมายสำคัญคือการลดปัญหาตัวตนของตัวละครเปลี่ยนไปเรื่อย ๆ รวมถึงแขนขาบิดเบี้ยวหรือหายไป
ทีมวิจัยระบุว่าการเก็บข้อมูลการเคลื่อนไหวที่ละเอียดจากวิดีโอโดยตรงช่วยให้โมเดลสร้างท่ามือและการเคลื่อนไหวของแขนขาได้เป็นธรรมชาติมากขึ้น ผลการทดลองยังครอบคลุมตัวละครหลายสไตล์ รูปร่างที่หลากหลาย ฉากที่มีหลายคน และท่าทางหลายประเภท 1
อย่างไรก็ตาม นี่ไม่ได้หมายความว่าผลลัพธ์จะสมบูรณ์กับทุกวิดีโอ อินพุตที่ซับซ้อน การบังกันของตัวละคร การเคลื่อนไหวเร็ว หรือวิดีโอที่มีคุณภาพต่ำยังเป็นปัจจัยที่อาจทำให้คุณภาพลดลง จุดสำคัญคือระบบมีขอบเขตการใช้งานที่กว้างกว่าวิธีซึ่งบังคับให้การเคลื่อนไหวผ่านโครงกระดูกเพียงอย่างเดียว
อีกความสามารถหนึ่งคือการควบคุมจุดชมภาพหรือมุมกล้องด้วยข้อความผ่าน Viewpoint LoRA ซึ่งฝึกด้วยข้อมูลหลายมุมมองสังเคราะห์จาก Unreal Engine 1
นั่นหมายความว่า ผู้ใช้สามารถขอให้ระบบเรนเดอร์ตัวละครจากมุมใหม่ได้ โดยไม่จำเป็นต้องถ่ายการแสดงต้นฉบับใหม่หรือฝึกโมเดลแอนิเมชันหลักซ้ำ ระบบยังถูกนำเสนอว่าสามารถทำงานกับหลายตัวละครในฉากเดียว รวมถึงอัตราส่วนภาพที่ไม่ได้จำกัดอยู่เพียงรูปแบบมาตรฐาน 1
3
คำกล่าวเรื่องการสร้างแบบเรียลไทม์เกี่ยวข้องกับรุ่นกลั่นขนาดเล็ก Wan-Animate-2-Lite เป็นหลัก ไม่ใช่ความเร็วของโมเดล Base เต็มรูปแบบ กระดาษวิจัยอธิบายกระบวนการเร่งความเร็วสามช่วง ได้แก่ การฝึกแบบ teacher forcing การใช้ error buffer และการกลั่นแบบ Self-Forcing ร่วมกับการย้อนการเรียนรู้เป็นช่วง ๆ หรือ chunk-wise backpropagation วิธีนี้ทำให้โมเดลสามารถสร้างวิดีโอแบบออโตรีเกรสซีฟและส่งผลลัพธ์ออกมาเป็นชิ้น ๆ ได้ 1
ตัวเลขที่รายงานคือ 24 เฟรมต่อวินาทีที่ความละเอียด 400×720 บน GPU H100 จำนวน 4 ตัว 1
8 จึงเป็นความสามารถที่สำคัญสำหรับอวตารสดหรือการผลิตแบบโต้ตอบ แต่ไม่ควรเข้าใจว่าเป็นการสร้างวิดีโอ 720p ที่ 24 เฟรมต่อวินาทีบนฮาร์ดแวร์ระดับผู้ใช้ทั่วไป
งานวิจัยและการรายงานผลจากผู้พัฒนาอ้างว่า Wan-Animate-2 ให้ผลเชิงคุณภาพและผลจากการศึกษาผู้ใช้ที่แข่งขันกับเครื่องมือเชิงพาณิชย์อย่าง Dreamina ของ ByteDance และ KLING MotionControl ของ Kuaishou โดยสื่อบางแห่งอธิบายว่าอยู่ในระดับใกล้เคียงกัน 1
3
แต่คำกล่าวอ้างระดับ “commercial SOTA” ควรอ่านอย่างระมัดระวัง เพราะผลดังกล่าวมาจากการประเมินของทีมพัฒนาและการเปรียบเทียบที่นำเสนอในงาน ไม่ใช่การทดสอบมาตรฐานอิสระที่ทุกฝ่ายยอมรับร่วมกัน ดังนั้น Wan-Animate-2 มีสัญญาณที่น่าสนใจมาก แต่การยืนยันประสิทธิภาพในสถานการณ์จริงยังต้องอาศัยการทดสอบจากชุมชนและนักวิจัยภายนอก
การแอนิเมตตัวละครให้ใช้งานได้จริงไม่ได้มีแค่การทำให้ภาพเคลื่อนไหว แต่ต้องรักษาอัตลักษณ์ ใบหน้า มือ การปฏิสัมพันธ์ มุมกล้อง และความต่อเนื่องของตัวละครในหลายเฟรม ปัญหาเหล่านี้เป็นจุดคอขวดสำคัญระหว่างการสร้างคลิปสั้นที่ดูดี กับการผลิตวิดีโอที่นำไปใช้ต่อได้จริง 1
2
การเปิดซอร์สโค้ด น้ำหนักโมเดล และเครื่องมืออินเฟอเรนซ์ภายใต้ Apache-2.0 ช่วยให้นักพัฒนาสามารถตรวจสอบระบบ โฮสต์เอง ปรับแต่ง และฝังโมเดลไว้ในกระบวนการผลิตโดยไม่ต้องพึ่งแพลตฟอร์มคลาวด์หรือจ่ายค่าบริการต่อวินาทีเสมอไป แน่นอนว่าการใช้งานจริงยังขึ้นอยู่กับหน่วยความจำ GPU ความเร็วอินเฟอเรนซ์ ความสามารถในการทำมาสก์และคอมโพสิต ตลอดจนเงื่อนไขด้านข้อมูลฝึกและลิขสิทธิ์
ทั้งสองระบบอยู่ในสายผลิตภัณฑ์วิดีโอของ Alibaba แต่ทำหน้าที่คนละส่วน
เมื่อนำมามองร่วมกัน ทั้งสองความสามารถชี้ให้เห็นเส้นทางตั้งแต่เอกสารธุรกิจไปจนถึงวิดีโอที่มีตัวละครเคลื่อนไหว แต่ Wan3.0 เป็นผลิตภัณฑ์ที่ให้บริการแยกต่างหาก ไม่ใช่หลักฐานว่าขณะนี้มีชุดเครื่องมือผลิตวิดีโอแบบครบวงจรที่เชื่อมสองระบบเข้าด้วยกันแล้ว 2
ตัวชี้วัดสำคัญหลังจากนี้คือความเร็วที่เครื่องมือชุมชนจะเพิ่มโหนดสำหรับแพลตฟอร์มอย่าง ComfyUI ระบบอินเฟอเรนซ์ที่ประหยัดหน่วยความจำ การมาสก์และคอมโพสิต เวิร์กโฟลว์รักษาความต่อเนื่องของตัวละคร และรุ่นที่ทำงานได้บน GPU ระดับผู้บริโภค
ขณะเดียวกัน คุณภาพที่เห็นในตัวอย่างคัดสรรจะต้องพิสูจน์ให้ได้เมื่อเจอกับอินพุตหลากหลายจริง การเปิดตัวแบบผ่อนปรนช่วยให้การนำไปต่อยอดเกิดขึ้นได้เร็ว แต่ต้นทุนฮาร์ดแวร์ ความสามารถในการทำซ้ำผลลัพธ์ เงื่อนไขใบอนุญาตของข้อมูลฝึก และคุณภาพการผสานเข้ากับเครื่องมืออื่น จะเป็นตัวกำหนดว่าเทคโนโลยีวิดีโอจากห้องวิจัยจีนจะกลายเป็นสแตกโอเพนซอร์สมาตรฐานได้เร็วเพียงใด
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Wan Animate 2 คือระบบแอนิเมชันตัวละครแบบโอเพนซอร์สของ Tongyi Lab ที่นำการเคลื่อนไหวจากวิดีโอหนึ่งไปใช้กับภาพตัวละครอ้างอิง โดยพยายามรักษาเอกลักษณ์ของตัวละครไว้
Wan Animate 2 คือระบบแอนิเมชันตัวละครแบบโอเพนซอร์สของ Tongyi Lab ที่นำการเคลื่อนไหวจากวิดีโอหนึ่งไปใช้กับภาพตัวละครอ้างอิง โดยพยายามรักษาเอกลักษณ์ของตัวละครไว้ จุดเด่นคือการป้อนข้อมูลวิดีโอขับเคลื่อนเข้า Diffusion Transformer โดยตรง ไม่ต้องผ่านการสกัดโครงกระดูกหรือการบีบอัดฟีเจอร์การเคลื่อนไหว ซึ่งช่วยเก็บรายละเอียดมือ ใบหน้า และการเคลื่อนไหวระหว่างตัวละครได้มากขึ้น
รุ่น Wan Animate 2 Lite รายงานการสร้างแบบสตรีมที่ 24 เฟรมต่อวินาที ความละเอียด 400×720 บน GPU H100 จำนวน 4 ตัว จึงไม่ควรตีความว่าเป็นความเร็วที่ทำได้บนคอมพิวเตอร์ทั่วไป