Yu Kaichengs skifte var ikke en avvisning av persepsjon eller store datamengder. Poenget hans er snarere at generering på pikselnivå er et lite effektivt mellomledd for styring når et system allerede kan lage plausible bilder og videosekvenser. Alternativet er å gjøre selve prediksjonstilstanden til en strukturert samling av fysiske konsepter – objekter, tilstander, relasjoner, handlinger og årsaksendringer – slik at en agent kan sette dem sammen på nytt og planlegge i et latent rom, uten hele tiden å måtte gjengi video.
1
10
Fra AutoML til verdensmodeller
- Yu (于开丞) startet med forskning på automatisk maskinlæring, før han ble med i Alibaba DAMO Academy gjennom talentprogrammet Alibaba Star og gikk over til persepsjon for selvkjørende biler. I BEVFusion ble informasjon fra kamera og lidar samlet i en felles fugleperspektiv-representasjon av det fysiske rommet. Arbeidet er senere omtalt som et mye sitert bidrag innen flerSensorsammensmelting.
10
- I 2023 begynte han ved Westlake University, der han etablerte AutoLab. Gruppen arbeidet først med generative verdensmodeller for autonom kjøring. Ifølge den samtidige profilen vant teamet en autonomikjøringskategori under ECCV i 2024 og toppet Fail2Drive-rangeringen i 2026.
10
- Lærdommen, slik Yu beskriver den, var at videogenerering gjorde visuell realisme mulig, men ikke nødvendigvis gjorde gjengivelse av hver piksel til riktig beregningsobjekt for prediksjon og beslutninger. Når det sentrale spørsmålet er «hva skjer hvis jeg gjør dette?», kan det å rekonstruere alle bildedetaljer bli en kostbar omvei rundt den tilstanden og kausaliteten oppgaven faktisk krever.
1
10
Hva er en «konseptverdensmodell»?
- Mot slutten av 2024 skal teamet ha gått fra pikselgenerering til et ende-til-ende-lært matematisk latent rom. Målet er å dele en scene opp i et begrenset antall gjenbrukbare fysiske konsepter og relasjoner, og deretter sette disse sammen til en prediksjon av neste tilstand – også i kombinasjoner som ikke finnes direkte i treningsdataene.
1
- «Implisitt» betyr dermed ikke nødvendigvis ustrukturert. Awomos påstand er at den latente tilstanden skal inneholde fysiske konsepter som entiteter, romlige relasjoner, objekttilstander, handlinger og kausale overganger, i stedet for bare å være en komprimert representasjon av et bilde.
1
11
- Den lovede gevinsten er komposisjonell generalisering: En agent som har lært relevante konsepter hver for seg, kan i prinsippet resonnere over en ny kombinasjon av dem uten å ha sett akkurat hele situasjonen i treningsmaterialet. Det er også bakgrunnen for at Yu mener mer VLA-data og stadig flere demonstrasjoner etter hvert vil gi avtakende utbytte innen fysisk intelligens.
1
Likner JEPA – men vil definere innholdet
- Tilnærmingen tilhører den samme brede familien av latent prediksjon som Yann LeCuns JEPA: Modellen skal forutsi en representasjon, ikke rekonstruere piksler.
1
- Awomos påståtte forskjell ligger i semantikken og arkitekturen. Yu mener JEPA ikke spesifiserer hva de latente variablene skal inneholde, mens forslaget om en konseptverdensmodell eksplisitt forsøker å bygge et sammensettbart vokabular av fysiske konsepter. Dette er imidlertid en forskningshypotese, ikke en fordel som er uavhengig etablert.
1
Hva viser dokumentasjonen – og hva viser den ikke?
- Awomo har rapportert interne eksperimenter fra 2025 der oppdeling og kobling av konsepter ga bedre resultater på komplekse oppgaver enn referansemodeller basert på imitasjonslæring og forsterkningslæring, samtidig som prediksjonskostnaden ble redusert.
1
- De offentlige rapportene som er tilgjengelige her, inneholder imidlertid ikke en fullstendig forsøksprotokoll, modellstørrelser, oppgavefordeling, konkrete suksessrater, konfidensintervaller, ablasjonsstudier, kode eller uavhengig replikasjon. Hvor stor fordelen faktisk er, er derfor utilstrekkelig dokumentert offentlig.
1
- Eksempelet med å gripe en kopp som faller, samtidig som man lukker en dør, illustrerer den ønskede effekten: Modellen skal kunne representere flere samtidige tilstandsendringer og deres kausale begrensninger samlet, i stedet for å velge mellom mønstre den har sett i et demonstrasjonskorpus. Eksempelet bør leses som Yus motivasjon for metoden, ikke som et verifisert resultat fra en standardisert test.
1
Selskapet, teamet og finansieringen
- Forskningen ble kommersialisert gjennom Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., med merkenavnet Awomo. Selskapet ble registrert i Xihu-distriktet i Hangzhou 8. januar 2026. Awomo sier at det utvikler teknologi for fysisk KI innen autonom kjøring, robotikk, industriutstyr, smartmaskinvare og generering av simuleringsdata.
11
- Omtalen beskriver den første kjernen som Yu og sjefsforsker Tong, før teamet vokste ut fra Westlake AutoLabs miljø. Beskrivelsen av kollegene som «små genier som stadig har bevist seg selv» er markedsføringsspråk, ikke en uavhengig målbar vurdering av personellet.
1
- Awomo har kunngjort samlet finansiering på over 100 millioner yuan i såkorn- og englerunder. Blant investorene som er nevnt, er InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund og Jinma Investment.
13
Første offentlige presentasjon
- Omtalen fra august 2026 presenterte Awomo-v0.1 som den første offentlige versjonen av arbeidet med konseptverdensmodellen, og viste til evaluering på RoboTwin 2.0. Dette er et simulert rammeverk for datagenerering og testing av robust tohånds robotmanipulering.
1
3
- Presentasjonen etablerer et tidlig offentlig evalueringspunkt, men dokumenterer ikke i seg selv generalisering til fysiske roboter, sikkerhet eller at løsningen er bedre enn ledende alternativer. En solid validering vil kreve offentliggjorte testresultater, standardiserte referansemodeller og resultater fra overføring til den virkelige verden.