Yu Kaichengs skifte er ikke et opgør med perception eller store datamængder, men med pixelgengivelse som mellemstation for styring: Hvis AI allerede kan skabe realistiske observationer, kan det være dyrt og unødvendig... Awomos alternativ er en implicit konceptverdensmodel, hvor systemet forsøger at repræsentere obj...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Yu Kaichengs teknologiske drejning kan bedst beskrives som en ændring af, hvad AI bør forudsige. Han afviser ikke perception, skalering eller store datamængder. Hans pointe er snarere, at pixel-for-pixel-generering kan være en ineffektiv mellemstation, når målet er at træffe beslutninger i den fysiske verden.
I stedet vil han have, at modellen forudsiger en struktureret tilstand bestående af fysiske begreber – eksempelvis objekter, deres tilstande, rumlige relationer, handlinger og kausale ændringer. På den måde skal en agent kunne kombinere begreber og planlægge i et latent rum uden hele tiden at skulle gengive en video af fremtiden. 1
10
Yu (于开丞) begyndte sin forskning inden for automatisk maskinlæring, AutoML. Efter sin ph.d. kom han til Alibaba DAMO Academy gennem talentprogrammet Alibaba Star og arbejdede med visuel perception til selvkørende biler.
Et af hans mest kendte bidrag er BEVFusion, som samler data fra LiDAR – en lasersensor, der måler omgivelsernes geometri – og kameraer i en fælles bird’s-eye-view-repræsentation. Det giver modellen et samlet fysisk perspektiv på omgivelserne og blev et bredt citeret arbejde inden for multisensorfusion.
I 2023 gik Yu til Westlake University, hvor han opbyggede Autonomous Intelligence Lab, også kaldet AutoLab. Teamet begyndte med generative verdensmodeller til autonom kørsel. Ifølge den samtidige omtale vandt gruppen en ECCV-konkurrence inden for autonom kørsel i 2024 og toppede senere Fail2Drive-ranglisten i 2026. 10
Det afgørende spørgsmål blev imidlertid ikke, om modellen kunne fremstille realistiske billeder og videoer. Det blev, om det overhovedet var den rigtige beregningsopgave. Hvis en agent skal svare på »Hvad sker der, hvis jeg udfører denne handling?«, kan det være en dyr omvej først at rekonstruere alle visuelle detaljer i scenen. 1
10
I slutningen af 2024 skiftede teamet ifølge rapporteringen fra pixelgenerering til en end-to-end-lært latent repræsentation. Ideen er at opdele en scene i et begrænset antal genanvendelige fysiske begreber og relationer og derefter sætte dem sammen igen for at forudsige den næste tilstand – også når den samlede kombination ikke tidligere har optrådt i træningsdataene. 1
»Implicit« betyder derfor ikke nødvendigvis ustruktureret. Awomos påstand er, at det latente rum bør indeholde noget mere meningsfuldt end en komprimeret billedrepræsentation. Det skal forsøge at rumme en model af entiteter, rumlige forhold, objekters tilstand, handlinger og overgange med årsagssammenhæng. 1
11
Den forventede gevinst er kompositionel generalisering. En agent, der har lært begreberne »kop«, »fald«, »lukke« og »dør« hver for sig, bør i princippet kunne håndtere en ny kombination af dem uden at have set præcis den samme situation i en demonstrationssamling.
Det er også baggrunden for Yus skepsis over for blot at skalere VLA-modeller – modeller, der kobler syn og sprog til handling – med endnu flere data og demonstrationer. Hans argument er, at den strategi på et tidspunkt giver mindre udbytte, hvis modellen ikke samtidig lærer de underliggende fysiske begreber og deres relationer. 1
Tilgangen ligger i samme brede familie som Yann LeCuns JEPA, eller Joint Embedding Predictive Architecture. I stedet for at rekonstruere pixels forsøger modellen at forudsige en repræsentation af den næste tilstand. 1
Awomos påståede forskel er først og fremmest semantisk og arkitektonisk. Yu mener, at JEPA-rammen ikke i sig selv afgør, hvad de latente variable konkret skal indeholde. Konceptverdensmodellen forsøger derimod eksplicit at definere et sammensætteligt »ordforråd« af fysiske begreber.
Det er dog vigtigt at skelne mellem en forskningshypotese og en dokumenteret fordel. De offentligt tilgængelige oplysninger viser endnu ikke uafhængigt, at Awomos valg af latent struktur giver bedre generalisering end JEPA eller andre konkurrerende metoder. 1
Awomo har rapporteret, at interne forsøg i 2025 viste højere succesrater på komplekse opgaver end baselines baseret på imitation learning og reinforcement learning, samtidig med at forudsigelsesomkostningen blev reduceret. Ifølge rapporteringen var det især mekanismerne til at nedbryde og forbinde koncepter, der gav forbedringen. 1
Men de offentlige beskrivelser indeholder ikke en komplet forsøgsprotokol. Der mangler blandt andet oplysninger om modelstørrelser, opgavefordeling, konkrete succesrater, konfidensintervaller, ablationer, offentlig kode og uafhængig reproduktion. Størrelsen på den påståede fordel er derfor utilstrækkeligt dokumenteret offentligt. 1
Eksemplet med at gribe en kop, der falder, samtidig med at man lukker en dør, illustrerer den ønskede egenskab: Modellen skal kunne håndtere flere samtidige tilstandsændringer og deres kausale begrænsninger i fællesskab. Eksemplet bør dog læses som Yus motivation for tilgangen – ikke som et verificeret benchmarkresultat. 1
Forskningen blev kommercialiseret gennem Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., der bruger brandet Awomo. Virksomheden blev registreret i Hangzhous Xihu-distrikt den 8. januar 2026. Den siger, at den arbejder med fysisk AI til autonom kørsel, robotter, industrielt udstyr, intelligent hardware og generering af simuleringsdata. 5
11
Ifølge rapporteringen bestod den første kerne af Yu og den videnskabelige chef Tong, hvorefter flere medlemmer fra Westlake AutoLab kom til. Beskrivelsen af kollegerne som »genier, der igen og igen har bevist deres værd«, er virksomhedens eller interviewets promoverende formulering – ikke en uafhængigt målbar egenskab ved teamet. 1
Awomo har oplyst, at virksomheden samlet har rejst mere end 100 millioner yuan i seed- og angel-runder. Blandt de nævnte investorer er InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund og Jinma Investment. 13
I omtalen fra august 2026 blev Awomo-v0.1 præsenteret som den første offentlige version af arbejdet med konceptverdensmodellen. Her blev også henvist til evaluering på RoboTwin 2.0, en simuleret ramme og et benchmark for robust manipulation med to robotarme. 1
3
Det giver projektet en tidlig offentlig evalueringsarena, men dokumenterer ikke i sig selv, at systemet generaliserer til fysiske robotter, er sikkert eller overgår de førende alternativer. En stærkere vurdering kræver offentliggjorte benchmarkresultater, standardiserede sammenligninger og resultater fra overførsel til den virkelige verden.
Yus karriere følger dermed en usædvanlig kurve: Først var han med til at gøre multisensorisk perception og datadrevne systemer mere effektive. Senere arbejdede hans team med generative verdensmodeller, der kunne fremstille realistiske observationer. Det var netop denne erfaring, der ifølge hans egen forklaring førte til spørgsmålet om, hvorvidt realistisk gengivelse var et mål i sig selv.
Awomos svar er en latent, konceptbaseret model af verden: mindre fokus på at »tegne« det næste øjeblik og mere fokus på at forudsige, hvordan objekter, handlinger og årsagssammenhænge ændrer sig. Om denne idé kan levere robust fysisk intelligens, er endnu åbent. Men den markerer et klart skifte fra at skalere gengivelsen af verden til at forsøge at strukturere dens regler.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Yu Kaichengs skifte er ikke et opgør med perception eller store datamængder, men med pixelgengivelse som mellemstation for styring: Hvis AI allerede kan skabe realistiske observationer, kan det være dyrt og unødvendig...
Yu Kaichengs skifte er ikke et opgør med perception eller store datamængder, men med pixelgengivelse som mellemstation for styring: Hvis AI allerede kan skabe realistiske observationer, kan det være dyrt og unødvendig... Awomos alternativ er en implicit konceptverdensmodel, hvor systemet forsøger at repræsentere objekter, tilstande, relationer, handlinger og kausale ændringer i et latent matematisk rum.
Tilgangen minder om Yann LeCuns JEPA, men Awomos særskilte påstand er, at det latente rum bør indeholde et sammensætteligt »ordforråd« af fysiske begreber.