Yu Kaichengs perspektivskifte handlar inte om att avvisa stora datamängder, utan om att pixel för pixel generering kan vara en dyr omväg när målet är att fatta beslut och styra handlingar. Awomos konceptuella världsmodell försöker representera objekt, tillstånd, relationer, handlingar och orsakssamband i ett sammans...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Yu Kaichengs väg från AutoML och avancerad perception till en kritisk hållning mot datadriven skalning är mindre dramatisk än den först kan verka. Han har inte vänt ryggen åt perception, stora datamängder eller generativa modeller. Slutsatsen är snarare att fotorealistisk bild- och videogenerering inte nödvändigtvis är rätt mellanled när en AI ska förstå konsekvenserna av en handling.
Hans alternativ är att göra själva förutsägelsestaten strukturerad: en intern beskrivning av objekt, tillstånd, relationer, handlingar och kausala förändringar. Då ska en agent kunna kombinera kända byggstenar och planera i ett latent rum, i stället för att hela tiden återge världen bildruta för bildruta. 1
10
Yu Kaicheng, eller 于开丞 på kinesiska, utbildade sig först inom automatisk maskininlärning, AutoML. Därefter anslöt han till Alibaba DAMO Academy genom talangprogrammet Alibaba Star och började arbeta med perception för autonoma fordon.
Ett av de mest uppmärksammade projekten var BEVFusion. Metoden kombinerade data från lidar – en avståndssensor som bygger en tredimensionell punktmängd – med kamerabilder i en gemensam representation sedd ovanifrån, så kallad bird’s-eye view. Därmed kunde geometrisk information och bildens visuella detaljer bearbetas i samma fysiska rum. Arbetet beskrivs i senare rapportering som ett brett citerat bidrag inom multisensorfusion. 10
År 2023 gick Yu till Westlake University och byggde upp Autonomous Intelligence Lab, AutoLab. Inledningsvis arbetade gruppen med generativa världsmodeller för autonom körning. Enligt samtida rapportering vann teamet en autonom körningsgren vid ECCV 2024 och toppade Fail2Drive-rankningen 2026. 10
Erfarenheten ledde till en praktisk fråga: Om en modell redan kan skapa visuellt trovärdiga observationer, varför ska den då lägga stora mängder beräkning på att återge varje pixel? För en agent är den viktigare frågan ofta vad som händer efter en viss handling. Att rekonstruera hela bildens utseende kan då bli en kostsam omväg förbi det tillstånd och de orsakssamband som faktiskt behövs för att agera. 1
10
Mot slutet av 2024 uppges teamet ha bytt från pixelgenerering till en end-to-end-inlärd matematisk latent rymd. Målet är att dela upp en scen i ett begränsat antal återanvändbara fysiska begrepp och relationer – och sedan sätta ihop dem till ett förutspått nästa tillstånd.
Det viktiga är att kombinationerna inte måste ha förekommit exakt så i träningsmaterialet. En modell som har lärt sig begreppen ”kopp”, ”fallande”, ”hand”, ”dörr” och ”stänga” separat skulle i princip kunna resonera om en ny kombination av dem, utan att ha sett hela scenariot som en färdig demonstration. 1
”Implicit” betyder därför inte nödvändigtvis ostrukturerat. Awomos påstående är att det latenta tillståndet ska bära information om bland annat entiteter, rumsliga relationer, objekts tillstånd, handlingar och kausala övergångar – inte bara vara en komprimerad bildrepresentation. 1
11
Den utlovade vinsten är kompositionell generalisering: förmågan att kombinera lärda delar till nya situationer. Yu menar att fysisk intelligens därför inte kan skalas obegränsat genom att enbart lägga till mer VLA-data eller fler demonstrationer. VLA står för vision-language-action-modeller, system som kopplar ihop synintryck och språk med konkreta handlingar. 1
Tekniken placerar sig i samma breda familj av latenta prediktionsmodeller som Yann LeCuns JEPA. Grundtanken är att förutsäga en representation av nästa tillstånd i stället för att rekonstruera alla pixlar. 1
Awomo framhäver samtidigt en semantisk och arkitektonisk skillnad. Enligt Yu lämnar JEPA öppet vad de latenta variablerna faktiskt ska innehålla. Konceptvärldsmodellen försöker däremot uttryckligen fylla det latenta rummet med ett sammansättningsbart ordförråd av fysiska begrepp.
Det är dock viktigt att skilja mellan en tydlig forskningshypotes och en etablerad fördel. Det offentliga materialet visar ännu inte oberoende att Awomos val av representation ger bättre generalisering än alternativa latenta modeller. 1
Awomo har rapporterat interna experiment från 2025 där uppdelning och sammankoppling av begrepp uppges ha förbättrat framgången på komplexa uppgifter jämfört med baslinjer från imitation learning och reinforcement learning, samtidigt som kostnaden för förutsägelser minskade. 1
Men offentliga rapporter som ligger till grund för uppgifterna redovisar inte ett fullständigt experimentprotokoll, modellstorlekar, uppgiftsfördelning, exakta framgångstal, konfidensintervall, ablationer, kod eller oberoende replikering. Hur stor fördelen är går därför ännu inte att bedöma med tillräcklig offentlig evidens. 1
Yu använder bland annat bilden av en robot som ska fånga en fallande kopp samtidigt som den stänger en dörr. Poängen är att modellen måste hantera flera samtidiga tillståndsförändringar och deras kausala begränsningar. Den ska inte bara välja det närmaste mönstret från en demonstrationssamling.
Exemplet illustrerar ambitionen, men ska inte läsas som ett verifierat benchmarkresultat. 1
Forskningen kommersialiserades genom Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., med varumärket Awomo. Bolaget registrerades i Xihu-distriktet i Hangzhou den 8 januari 2026. Enligt företagets egen beskrivning arbetar det med fysisk AI för bland annat autonom körning, robotik, industriell utrustning, smart hårdvara och generering av simuleringsdata. 11
Rapporteringen beskriver den första kärnan som Yu och chefsforskaren Tong, med en bredare rekrytering från Westlake-universitetets AutoLab. Formuleringen att kollegorna är ”konsekvent självdokumenterade genier” är däremot marknadsförande språk, inte ett oberoende mätetal för teamets kompetens. 1
Awomo har meddelat att bolaget sammanlagt tagit in mer än 100 miljoner yuan i sådd- och ängelfinansiering. Bland de namngivna investerarna finns InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund och Jinma Investment. 13
I rapporteringen från augusti 2026 presenterades Awomo-v0.1 som den första offentliga versionen av arbetet med konceptvärldsmodellen. Där hänvisades också till utvärdering på RoboTwin 2.0, en simulerad benchmark- och datagenereringsram för robust tvåarmad robotmanipulation. 1
3
Det ger projektet en tidig offentlig testmiljö, men bevisar inte i sig generalisering till verkliga robotar, säkerhet eller överlägsenhet gentemot ledande alternativ. För en mer övertygande bedömning krävs öppet redovisade benchmarkresultat, standardiserade jämförelser och tester av överföringen från simulering till den fysiska världen.
Det är i grunden också Yu Kaichengs större invändning mot den tidigare utvecklingslinjen: mer data och mer beräkningskraft kan förbättra vad en modell ser och återger, men det följer inte automatiskt att modellen förstår vad som händer när den ingriper i världen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Yu Kaichengs perspektivskifte handlar inte om att avvisa stora datamängder, utan om att pixel för pixel generering kan vara en dyr omväg när målet är att fatta beslut och styra handlingar.
Yu Kaichengs perspektivskifte handlar inte om att avvisa stora datamängder, utan om att pixel för pixel generering kan vara en dyr omväg när målet är att fatta beslut och styra handlingar. Awomos konceptuella världsmodell försöker representera objekt, tillstånd, relationer, handlingar och orsakssamband i ett sammansättningsbart latent rum.
Interna tester från 2025 uppges visa bättre resultat på komplexa uppgifter till lägre beräkningskostnad, men offentliga uppgifter räcker ännu inte för att bedöma hur stor fördelen faktiskt är.