Yu Kaichengs koerswijziging is geen afwijzing van perceptie of grootschalige data, maar van pixels als tussenstap voor voorspelling en controle. Awomo wil scènes ontleden in herbruikbare concepten zoals objecten, toestanden, relaties, acties en causale veranderingen.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Yu’s overstap betekent niet dat hij perceptie of grote hoeveelheden data heeft afgeschreven. Zijn conclusie is specifieker: zodra een model geloofwaardige waarnemingen kan synthetiseren, wordt het voorspellen van elk afzonderlijk pixel detail mogelijk een dure omweg voor besturing. Zijn alternatief is om de voorspellende toestand zelf gestructureerd te maken: een inventaris van objecten, toestanden, relaties, acties en causale veranderingen. Een agent zou die bouwstenen vervolgens in een latente ruimte kunnen combineren en gebruiken voor planning, zonder telkens een volledige video te hoeven renderen. 1
10
Yu Kaicheng (于开丞) begon zijn onderzoekscarrière in automatische machine learning, of AutoML: systemen die zelf leren welke algoritmen en instellingen het beste werken. Daarna trad hij via het Alibaba Star-programma toe tot Alibaba’s onderzoeksinstituut DAMO Academy, waar hij zich richtte op visuele perceptie voor autonoom rijden.
Een van zijn bekendste bijdragen is BEVFusion. Die methode brengt informatie van camera’s en LiDAR — sensoren die met laserpulsen afstanden en vormen meten — samen in één gedeelde vogelperspectiefweergave, een zogenoemde bird’s-eye view. Daarmee worden geometrische en semantische informatie in dezelfde fysieke representatie verwerkt. Het werk werd later beschreven als een veel geciteerde bijdrage aan multisensorfusie. 10
In 2023 ging Yu naar Westlake University, waar hij het Autonomous Intelligence Lab, AutoLab, vormde. Het team begon daar met generatieve wereldmodellen voor autonoom rijden. Volgens berichtgeving won het in 2024 een ECCV-onderdeel voor autonoom rijden en stond het in 2026 bovenaan de Fail2Drive-ranking. 10
Juist die ervaring bracht een ongemakkelijke vraag naar voren. Als een systeem al begrijpt wat er in een omgeving gebeurt en kan voorspellen wat een actie veroorzaakt, waarom zou het dan alle beeldinformatie opnieuw moeten tekenen? In Yu’s redenering is het antwoord op de vraag ‘wat gebeurt er als ik handel?’ belangrijker dan een perfecte reconstructie van de hele scène. 1
10
Eind 2024 verschoof het team naar een impliciete aanpak. In plaats van pixels te genereren, leert het model een abstracte, wiskundige latente ruimte waarin de toestand van de fysieke wereld wordt beschreven. Het doel is om een scène te ontleden in een eindige verzameling herbruikbare concepten en relaties, en die vervolgens samen te voegen tot een voorspelde volgende toestand — ook wanneer die combinatie niet letterlijk in de trainingsdata voorkwam. 1
‘Impliciet’ betekent in deze context dus niet dat de representatie willekeurig of ongestructureerd is. Awomo stelt dat de latente toestand juist concepten moet bevatten zoals entiteiten, ruimtelijke relaties, de toestand van objecten, acties en causale overgangen. Dat gaat verder dan een compacte versie van een afbeelding. 1
11
De beloofde winst is compositorische generalisatie: een systeem dat afzonderlijke concepten heeft geleerd, zou nieuwe combinaties daarvan moeten kunnen begrijpen zonder voor elke volledige situatie aparte voorbeelden nodig te hebben. Daarom denkt Yu dat alleen meer VLA-data en extra demonstraties — VLA staat voor vision-language-action — op termijn tegen een plafond aanlopen bij fysieke intelligentie. 1
Een eenvoudig voorbeeld maakt de ambitie duidelijk. Een robot moet een vallende beker opvangen en tegelijk een deur sluiten. Volgens Yu moet het model dan verschillende gelijktijdige toestandsveranderingen en hun causale beperkingen gezamenlijk kunnen bijhouden, in plaats van een actie te kiezen die alleen lijkt op een eerder gezien demonstratiepatroon. Dat voorbeeld is een illustratie van de onderzoekshypothese, geen bewezen benchmarkresultaat. 1
De voorgestelde aanpak behoort tot dezelfde brede familie als Yann LeCuns JEPA, de Joint Embedding Predictive Architecture. Ook daar voorspelt het model een representatie van de volgende toestand in plaats van ieder pixel opnieuw te reconstrueren. 1
Awomo claimt het verschil vooral op semantisch en architectonisch niveau te maken. Volgens Yu laat JEPA open wat de variabelen in de latente ruimte precies moeten voorstellen. Het conceptwereldmodel wil daar een expliciete, samenstelbare woordenschat van fysieke concepten tegenover zetten. Dat is een duidelijke onderzoekshypothese, maar nog geen onafhankelijk vastgesteld voordeel. 1
Awomo meldde interne experimenten uit 2025 waarin het ontleden en associëren van concepten de prestaties op complexe taken verbeterde ten opzichte van baselines voor imitation learning en reinforcement learning. Tegelijk zou de voorspellingskosten lager zijn geworden. 1
De openbare berichtgeving bevat echter geen volledig experimenteel protocol, modelgroottes, taakverdeling, exacte succespercentages, betrouwbaarheidsintervallen, ablaties, broncode of onafhankelijke replicatie. De omvang van het geclaimde voordeel is daarom publiek nog onvoldoende onderbouwd. 1
Ook de eerste publieke presentatie van Awomo-v0.1 moet in dat licht worden gelezen. De berichtgeving uit augustus 2026 verwees naar evaluatie op RoboTwin 2.0, een simulatie- en benchmarkkader voor robuuste manipulatie met twee robotarmen. Dat biedt een eerste publiek evaluatiepunt, maar bewijst op zichzelf nog geen generalisatie naar echte robots, veiligheid of superioriteit ten opzichte van toonaangevende alternatieven. Daarvoor zijn transparante scores, gestandaardiseerde baselines en resultaten bij de overgang van simulatie naar de echte wereld nodig. 1
3
Het onderzoek werd ondergebracht in Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., met Awomo als merknaam. Het bedrijf werd op 8 januari 2026 geregistreerd in het district Xihu in Hangzhou. Awomo zegt fysieke AI te ontwikkelen voor onder meer autonoom rijden, robotica, industriële apparatuur, slimme hardware en het genereren van simulatiegegevens. 11
Volgens berichtgeving bestond de eerste kern uit Yu en chief scientist Tong, waarna het team werd uitgebreid vanuit AutoLab. De omschrijving van medewerkers als ‘talenten die zichzelf consequent hebben bewezen’ is promotionele taal en geen onafhankelijk controleerbare maatstaf voor de kwaliteit van het personeel. 1
Awomo maakte bekend dat de seed- en angelrondes samen meer dan 100 miljoen yuan hebben opgebracht. Als investeerders werden InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund en Jinma Investment genoemd. 13
De inzet is daarmee groter dan een nieuwe methode voor autonome voertuigen. Awomo positioneert het conceptwereldmodel als een algemene basislaag voor fysieke intelligentie: een model dat niet alleen ziet wat er gebeurt, maar ook probeert te representeren hoe objecten, acties en oorzaken samenhangen. Of die compacte conceptuele wereld uiteindelijk betrouwbaarder en efficiënter blijkt dan pixelgerichte modellen, zal afhangen van reproduceerbare experimenten en prestaties buiten de simulatie.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Yu Kaichengs koerswijziging is geen afwijzing van perceptie of grootschalige data, maar van pixels als tussenstap voor voorspelling en controle.
Yu Kaichengs koerswijziging is geen afwijzing van perceptie of grootschalige data, maar van pixels als tussenstap voor voorspelling en controle. Awomo wil scènes ontleden in herbruikbare concepten zoals objecten, toestanden, relaties, acties en causale veranderingen.
De aanpak lijkt op Yann LeCuns JEPA doordat het model latente representaties voorspelt in plaats van pixels te reconstrueren; Awomo wil echter expliciet vastleggen wat er in die latente ruimte zit.