Yu Kaicheng siirtyi AutoML tutkimuksesta Alibaba DAMO Academyn kautta autonomisen ajamisen havaintojärjestelmiin. Vuonna 2023 perustettu Westlake Universityn AutoLab tutki aluksi generatiivisia autonomisen ajamisen maailmanmalleja, mutta vaihtoi vuoden 2024 lopulla pikselien tuottamisesta konseptipohjaiseen latentti...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Yu Kaichengin urassa kiinnostavinta ei ole se, että hän olisi hylännyt konenäön, datan tai skaalautuvat mallit. Hänen johtopäätöksensä on pikemminkin tämä: kun tekoäly osaa jo tuottaa uskottavan näköisiä havaintoja, jokaisen pikselin ennustaminen ei välttämättä ole paras välietappi toiminnan ohjaamiseen.
Awomon vaihtoehto on rakentaa ennustamisen kohteeksi jäsennelty tila, joka sisältää fyysisen maailman keskeiset käsitteet – esineet, niiden tilat, sijainnit, suhteet, toiminnot ja syy-seurausmuutokset. Tällöin järjestelmä voisi suunnitella toimintaansa latentissa tilassa sen sijaan, että se renderöisi jatkuvasti kokonaisia videokuvia. 1
10
Yu (于开丞) kouluttautui automaattisen koneoppimisen eli AutoML:n parissa. Myöhemmin hän liittyi Alibaba DAMO Academyyn Alibaba Star -ohjelman kautta ja siirtyi autonomisen ajamisen havaintojärjestelmiin. Hänen tunnettu BEVFusion-työnsä yhdisti kameran ja lidarin tuottaman tiedon yhteiseen lintuperspektiivinäkymään eli bird’s-eye view -esitykseen. Näin erilaiset sensorit voitiin käsitellä samassa fyysisessä viitekehyksessä. Työtä on kuvattu laajasti siteeratuksi monisensorifuusion kontribuutioksi. 10
Vuonna 2023 Yu siirtyi Westlake Universityyn ja perusti yliopiston AutoLab-ryhmän. Aluksi tutkimus keskittyi generatiivisiin autonomisen ajamisen maailmanmalleihin: järjestelmiin, jotka tuottavat tulevia näkymiä ja simuloivat ympäristön muutoksia. Ryhmä saavutti myöhemmin voiton ECCV-konferenssin autonomisen ajamisen kilpailusarjassa vuonna 2024 ja sijoittui Fail2Drive-listan kärkeen vuonna 2026, kertoo aiheesta julkaistu profiili. 10
Kokemus johti kuitenkin ristiriitaan. Videon tuottaminen voi tehdä näkymästä visuaalisesti realistisen, mutta se ei vielä kerro, että järjestelmä osaa päätellä, mitä tapahtuu tietyn toiminnon jälkeen. Jos kysymys on muodossa ”mitä muuttuu, jos toimin näin?”, kaikkien kuvan yksityiskohtien rekonstruointi voi olla kallis kiertotie tehtävän kannalta olennaiseen tilaan ja kausaalisuuteen. 1
10
Vuoden 2024 lopulla ryhmä siirtyi raporttien mukaan pikseligeneroinnista päästä päähän opittuun matemaattiseen latenttiin tilaan. Ajatuksena on pilkkoa ympäristö rajalliseksi joukoksi uudelleenkäytettäviä fyysisiä käsitteitä ja niiden välisiä suhteita. Näitä osia voidaan sen jälkeen yhdistellä seuraavan tilan ennustamiseksi – myös sellaisissa yhdistelmissä, joita harjoitusaineistossa ei ole esiintynyt kokonaisina. 1
”Implisiittinen” ei tässä tarkoita jäsentymätöntä. Awomon esittämän näkemyksen mukaan latenttiin tilaan pitäisi koodata esimerkiksi entiteetit, avaruudelliset suhteet, esineiden tilat, toiminnot ja kausaaliset siirtymät, ei vain tiivistettyä kuvavektoria. 1
11
Tavoitteena on kompositionaalinen yleistyminen. Jos järjestelmä on oppinut erikseen esimerkiksi esineen liikkeen, tarttumisen ja esteen väistämisen, sen pitäisi periaatteessa pystyä päättelemään myös uuden tilanteen, jossa nämä tapahtuvat samanaikaisesti. Sen ei tarvitsisi nähdä harjoitusesimerkkiä jokaisesta mahdollisesta kokonaisuudesta.
Tästä kumpuaa Yun epäily siitä, että pelkkä VLA-mallien – näön, kielen ja toiminnan yhdistävien mallien – datan tai demonstraatioiden lisääminen kohtaa fyysisessä älykkyydessä lopulta alenevan hyödyn. Lisää esimerkkejä voi auttaa, mutta se ei välttämättä ratkaise kaikkien uusien tilanteiden yhdistämistä. 1
Awomon idea kuuluu samaan laajaan latenttiin ennustamiseen perustuvaan suuntaukseen kuin Yann LeCunin JEPA. Molemmissa ajatuksena on ennustaa esitystä sen sijaan, että järjestelmä rekonstruoisi kaikki pikselit. 1
Awomon väittämä ero on semanttinen ja arkkitehtoninen. Yun mukaan JEPA jättää avoimeksi kysymyksen siitä, mitä latentit muuttujat tarkalleen sisältävät. Konseptuaalinen maailmanmalli puolestaan pyrkii määrittelemään latenttiin tilaan sommiteltavan ”sanaston” fyysisistä käsitteistä.
Tämä on kuitenkin tutkimushypoteesi, ei vielä itsenäisesti varmistettu etu. Käsitteiden eksplisiittinen jäsentäminen voi helpottaa tulkittavuutta ja yleistämistä, mutta väitteen todellinen arvo riippuu avoimista vertailuista ja toistettavista kokeista. 1
Awomo kertoi vuoden 2025 sisäisistä kokeista, joissa käsitteiden hajottaminen ja niiden välisten yhteyksien oppiminen paransivat monimutkaisten tehtävien onnistumista verrattuna imitointioppimisen ja vahvistusoppimisen vertailumenetelmiin. Samalla ennustamisen kustannuksen kerrottiin pienentyneen. 1
Julkisesti saatavilla olevista raporteista puuttuvat kuitenkin täydellinen koemenettely, mallien koot, tehtäväjakauma, numeeriset onnistumisprosentit, luottamusvälit, ablaatiot, koodi ja riippumaton toisto. Siksi väitetyn hyödyn suuruudesta ei ole vielä riittävää julkista näyttöä. 1
Yun käyttämä esimerkki on arkinen mutta vaativa: tekoälyn pitäisi pystyä ottamaan kiinni putoava kuppi samalla, kun se sulkee oven. Ideana on kuvata useita samanaikaisia tilanmuutoksia ja niiden kausaalisia rajoitteita yhdessä, ei vain valita lähintä aiemmasta demonstraatioaineistosta tuttua toimintamallia. Esimerkki kuvaa lähestymistavan tavoitetta, ei varmennettua vertailutulosta. 1
Tutkimus kaupallistettiin Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd. -yhtiönä, joka käyttää nimeä Awomo. Yhtiö rekisteröitiin Hangzhoun Xihun alueella 8. tammikuuta 2026. Yrityksen mukaan sen fyysisen tekoälyn teknologiaa on tarkoitus soveltaa autonomiseen ajamiseen, robotiikkaan, teollisuuslaitteisiin, älylaitteisiin ja simulaatiodatan tuottamiseen. 11
Raporttien mukaan yhtiön alkuperäinen ydin muodostui Yusta ja teknologiajohtaja Tongista, ja tiimi kasvoi Westlake Universityn AutoLabin ympärille. Kuvaus kollegoista ”jatkuvasti itsensä todistaneina neroina” on yhtiön tai haastattelun promootiokieltä, ei riippumattomasti mitattava henkilöstötilasto. 1
Awomo ilmoitti keränneensä siemen- ja enkelivaiheen rahoituskierroksilla yhteensä yli 100 miljoonaa Kiinan yuania. Sijoittajiksi nimettiin InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund ja Jinma Investment. 13
Elokuussa 2026 julkaistuissa tiedoissa Awomo-v0.1 esiteltiin konseptuaalisen maailmanmallin hankkeen ensimmäisenä julkisena versiona. Arvioinnissa viitattiin RoboTwin 2.0:aan, joka on simuloitu ympäristö ja vertailukehys robustille kahden käsivarren robottimanipulaatiolle. 1
3
Julkinen esittely tarjoaa hankkeelle ensimmäisen näkyvän arviointipaikan, mutta se ei yksin osoita siirtymistä oikeisiin robotteihin, turvallisuutta tai ylivoimaa kilpailijoihin nähden. Vahvempi arvio edellyttäisi julkaistuja vertailupisteitä, standardoituja verrokkeja ja tuloksia siitä, miten hyvin simulaatiossa opittu toiminta siirtyy todelliseen maailmaan.
Awomon tarina onkin tässä vaiheessa ennen kaikkea kertomus suunnanvaihdosta: tutkija, joka auttoi tekemään datavetoisesta sensorifuusiosta tehokkaampaa, yrittää nyt määritellä uudelleen, mitä tekoälyn pitäisi ennustaa. Pikselien sijaan vastaus voisi olla maailman rakenne – mutta sen toimivuus on vielä osoitettava avoimilla kokeilla.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Yu Kaicheng siirtyi AutoML tutkimuksesta Alibaba DAMO Academyn kautta autonomisen ajamisen havaintojärjestelmiin.
Yu Kaicheng siirtyi AutoML tutkimuksesta Alibaba DAMO Academyn kautta autonomisen ajamisen havaintojärjestelmiin. Vuonna 2023 perustettu Westlake Universityn AutoLab tutki aluksi generatiivisia autonomisen ajamisen maailmanmalleja, mutta vaihtoi vuoden 2024 lopulla pikselien tuottamisesta konseptipohjaiseen latenttiin malliin.
Awomon tavoitteena on mallintaa fyysisen maailman käsitteitä – kuten esineitä, tiloja, suhteita, toimintoja ja kausaalisia muutoksia – jotta tekoäly voisi yhdistellä niitä myös ennen näkemättömiksi tilanteiksi.