Wan Animate 2 animoi viitehahmon ohjausvideon liikkeiden perusteella ja pyrkii säilyttämään hahmon identiteetin. Mallin keskeinen ratkaisu on syöttää ohjausvideo suoraan uudistettuun Diffusion Transformeriin ilman erillistä luurankoposeerausta tai liikkeen pakkaamista.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s open source Wan Animate 2, released by the Tongyi Wanxiang team in August 2026, and how does its end to end diffusion Tran. Article summary: Wan Animate 2 is Alibaba Tongyi Lab’s open character animation system: it animates a reference character from a driving video, while retaining the character’s identity.. Topic tags: general web, prompt engineering, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbna
Alibaba Tongyi Labin Wan-Animate-2 on avoimesti julkaistu hahmoanimaatiojärjestelmä. Se ottaa syötteeksi viitehahmon ja ohjausvideon: videon henkilö tai liike toimii esiintyjänä, jonka eleitä, ilmeitä ja liikettä malli siirtää hahmolle pyrkien samalla säilyttämään tämän ulkonäön ja identiteetin. Malli julkaistiin elokuussa 2026, ja sen painot, päättelytyökalut sekä dokumentaatio ovat saatavilla Apache 2.0 -lisenssillä. 1
2
Perinteisessä hahmoanimaation työnkulussa ohjausvideosta voidaan ensin tunnistaa luurankoposeeraus, nivelpisteet tai jokin pakattu liike-esitys. Tämä välivaihe voi kuitenkin tuoda mukaan tunnistusvirheitä ja häivyttää yksityiskohtia, joita tarvitaan esimerkiksi käsien, kasvojen ja hahmojen välisten vuorovaikutusten uskottavaan toistamiseen.
Wan-Animate-2 ohittaa tämän vaiheen. Se syöttää ohjausvideon visuaaliset latentit suoraan uudistettuun Diffusion Transformeriin eli DiT-arkkitehtuuriin. Mallin kaksiosaisessa rakenteessa puhdas viite- ja liikehaara välittää tietoa kohinaiseen kuvanmuodostushaaraan. Näin malli voi hyödyntää ohjausvideon hienojakoisia tila- ja aikavihjeitä sen sijaan, että liike puristettaisiin ensin yksinkertaisemmaksi luurangoksi tai ominaisuusvektoriksi. 1
Tutkijoiden mukaan suora videokäsittely parantaa käsien artikulaatiota ja vähentää vääristyneitä tai puuttuvia raajoja. Selitys on käytännöllinen: käden asento, sormien liike, kasvojen pienet muutokset ja hahmojen välinen kontakti voivat kadota, jos ohjausvideo pelkistetään liian aikaisin nivelpisteiksi.
Tuloksissa tarkastellaan myös erilaisia hahmotyylejä ja vartalonmuotoja, usean henkilön kohtauksia sekä monipuolisia liikkeitä. Tämä ei tietenkään takaa onnistunutta lopputulosta jokaisella syötteellä, mutta viittaa laajempaan käyttöalueeseen kuin järjestelmillä, jotka ovat vahvasti sidoksissa poseeraus- tai luurankoesitykseen. 1
Wan-Animate-2:n yksi kiinnostava lisäominaisuus on tekstiohjattu näkökulman hallinta. Viewpoint LoRA -moduuli on koulutettu synteettisellä monikameradatalla, joka on tuotettu Unreal Enginellä. Tavoitteena on erottaa lopullinen kamerakulma ohjausvideon alkuperäisestä kuvakulmasta.
Käytännössä käyttäjä voi pyytää esimerkiksi sivuttaista tai muuta uutta näkymää ilman uuden esiintymisen kuvaamista tai perusmallin uudelleenkouluttamista. Järjestelmä tukee lisäksi useita hahmoja samassa kohtauksessa ja erilaisia kuvasuhteita. 1
3
Reaaliaikaisuus koskee ennen kaikkea tislaamalla kevennettyä Wan-Animate-2-Lite-versiota, ei automaattisesti täysimittaista Base-mallia. Tutkimuspaperissa kuvattu nopeutus koostuu kolmivaiheisesta prosessista: teacher forcing -esikoulutuksesta, virhepuskuriin perustuvasta vaiheesta ja Self-Forcing-tislauksesta, jossa mallia optimoidaan videolohko kerrallaan. Tämän avulla järjestelmä voi tuottaa videota autoregressiivisesti lohkoina ja aloittaa suoratoiston ennen koko videon valmistumista. 1
Raportoitu tulos on 24 kuvaa sekunnissa 400 × 720 pikselin tarkkuudella neljällä H100-grafiikkasuorittimella. Se on merkittävä tekninen saavutus, mutta sitä ei pidä tulkita lupaukseksi 24 kuvan sekuntinopeudesta 720p-tarkkuudella tavallisella kotikoneella. 1
8
Paperin laadulliset vertailut ja käyttäjätutkimukset esittävät Wan-Animate-2:n olevan kilpailukykyinen suljettujen Dreamina- ja KLING MotionControl -palvelujen kanssa. Julkisessa uutisoinnissa tuloksia on kuvattu jopa tasavertaisiksi. 1
3
Väitteisiin kannattaa silti suhtautua sopivalla varauksella. Kyse on pääosin kehittäjien omista testeistä ja arvioinneista, ei riippumattomasta, standardoidusta vertailusta. Ilmaus ”kaupallisen tason huippu” on siten vahva mutta vielä alustava arvio. Todellinen kuva mallin laadusta muodostuu vasta, kun yhteisö testaa sitä laajasti erilaisilla videoilla, hahmoilla ja laitteistoilla.
Avoin julkaisu muuttaa hahmoanimaation asemaa. Kun painot, koodi ja päättelytyökalut ovat saatavilla Apache 2.0 -lisenssillä, kehittäjät voivat tarkastella mallia, ajaa sitä omassa ympäristössään, mukauttaa sitä ja liittää sen tuotantoputkiin ilman, että jokainen video riippuu suljetusta pilvipalvelusta. 1
2
Tämä on tärkeää, koska hahmojen hallittu liikuttaminen on ollut yksi generatiivisen videon käytännön pullonkauloista. Yksittäisen näyttävän videoleikkeen tuottaminen on eri asia kuin hahmon identiteetin, käsien, vuorovaikutusten, kameran suunnan ja liikkeen jatkuvuuden säilyttäminen kohtauksesta toiseen. Wan-Animate-2 pyrkii vastaamaan juuri tähän ongelmaan.
Adoptio riippuu kuitenkin muustakin kuin mallin painojen julkaisemisesta. Ratkaisevaa on, syntyykö yhteisölle nopeasti toimivia ComfyUI- ja muita integraatioita, muistitehokasta päättelyä, maskaus- ja kompositointityökaluja, hahmon jatkuvuutta tukevia työnkulkuja sekä kuluttajille sopivia grafiikkasuoritinversioita. Lisäksi on nähtävä, säilyvätkö paperissa raportoidut tulokset kuratoitujen esimerkkien ulkopuolella. Laitteistokustannukset, koulutusdatan lisensointi, toistettavuus ja integraatioiden laatu ratkaisevat, kuinka nopeasti kiinalaisten laboratorioiden kilpailukykyinen videoteknologia vakiintuu avoimen lähdekoodin työkalupinoksi.
Wan-Animate-2 ratkaisee tuotantoketjun hahmon ja esiintymisen hallintaan liittyvää päätä. Wan3.0 puolestaan keskittyy yritysten lähtöaineistoon: Alibaba kertoo sen pystyvän tuottamaan enintään 30 sekunnin videoita muun muassa asiakirjoista, taulukkolaskentatiedostoista, esityksistä ja verkkosivuista perinteisten multimodaalisten syötteiden lisäksi. 2
Yhdessä nämä kehityssuunnat vihjaavat työnkulkuun, jossa yrityksen aineistosta voidaan edetä kohti animoitua videota. Wan-Animate-2 ja Wan3.0 ovat kuitenkin erikseen käytettäviä ratkaisuja, eivät todiste yhdestä integroidusta päästä päähän -tuotantojärjestelmästä. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Wan Animate 2 animoi viitehahmon ohjausvideon liikkeiden perusteella ja pyrkii säilyttämään hahmon identiteetin.
Wan Animate 2 animoi viitehahmon ohjausvideon liikkeiden perusteella ja pyrkii säilyttämään hahmon identiteetin. Mallin keskeinen ratkaisu on syöttää ohjausvideo suoraan uudistettuun Diffusion Transformeriin ilman erillistä luurankoposeerausta tai liikkeen pakkaamista.
Wan Animate 2 Lite yltää ilmoitettuun 24 kuvan sekuntinopeuteen 400 × 720 pikselin tarkkuudella neljällä H100 grafiikkasuorittimella.