Yu Kaicheng tvrdí, že generování realistického videa ještě neznamená, že model efektivně rozumí fyzickému světu. Awomo chce nahradit předpovídání každého pixelu strukturovaným latentním prostorem fyzických konceptů, vztahů, akcí a kauzálních změn.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Yu Kaicheng svou dosavadní kariéru neodmítá. Jeho posun od vnímání obrazu a velkých dat k takzvanému konceptuálnímu světovému modelu vychází z praktičtější otázky: Co se stane, když agent provede určitou akci?
Pokud už model dokáže vytvořit přesvědčivý obraz nebo video, nemusí být nejefektivnějším dalším krokem znovu vykreslovat každý pixel. Pro řízení auta nebo robota je důležitější předpovědět změnu stavu, vztahy mezi objekty a důsledky jednání. Právě na tom staví Awomo: místo nepřetržitého generování videa chce plánovat v latentním prostoru fyzických konceptů. 1
10
Tato zkušenost Yuovi podle jeho vlastního popisu ukázala hranice čistě datového přístupu. Generování videa může přinést vizuální realismus, ale samo o sobě nemusí být vhodným výpočetním cílem pro plánování a rozhodování. Jestliže je klíčová otázka „jak se prostředí změní po mém zásahu“, pak rekonstrukce všech obrazových detailů představuje nákladnou okliku kolem stavu a kauzality, které agent skutečně potřebuje. 1
10
Na konci roku 2024 tým podle dostupných zpráv změnil směr: od generování pixelů přešel k end-to-end učenému matematickému latentnímu prostoru. Jeho cílem je rozložit scénu na konečný počet znovu použitelných fyzických konceptů a vztahů a následně je skládat do předpovědi dalšího stavu — včetně kombinací, které se v trénovacích datech nikdy neobjevily jako celý scénář. 1
„Implicitní“ zde nemá znamenat chaotické nebo beztvaré. Awomo tvrdí, že latentní stav má zachycovat například:
Nejde tedy pouze o komprimovanou podobu obrázku. Záměrem je vytvořit složitelný „slovník“ fyzického světa, s nímž může agent pracovat při predikci, plánování a následném jednání. 1
11
Pokud se model naučí jednotlivé koncepty a jejich vazby odděleně, mohl by je použít i v nové kombinaci. Nemusel by dostat ukázku každé možné situace jako hotový celek. Právě v tom Yu vidí cestu ke kompoziční generalizaci a důvod, proč další přidávání dat VLA — tedy společně trénovaných modelů vidění, jazyka a akce — nebo dalších demonstrací nemusí fyzickou inteligenci zvyšovat donekonečna. 1
Příklad s chytáním padajícího šálku při současném zavírání dveří ilustruje zamýšlený přínos. Agent by měl společně reprezentovat několik probíhajících změn a jejich kauzální omezení, nikoli pouze vybrat nejpodobnější vzorec z databáze demonstrací. Tento příklad je však třeba chápat jako Yuovu motivaci, nikoli jako ověřený výsledek veřejného benchmarku. 1
Přístup Awomo patří do stejné širší rodiny latentního predikování jako JEPA, které prosazuje Yann LeCun. Základní myšlenka je předpovídat reprezentaci budoucího stavu, nikoli rekonstruovat každý pixel. 1
Awomo však za svou odlišnost považuje především sémantiku a architekturu latentního prostoru. Podle Yu koncept JEPA ponechává otevřenou otázku, co přesně mají latentní proměnné obsahovat. Konceptuální světový model se naopak snaží explicitně definovat složitelnou sadu fyzických konceptů. Jde ovšem o výzkumnou hypotézu; veřejně dostupné podklady zatím nezávisle nepotvrdily, že tato volba přináší obecnou výhodu. 1
Awomo uvádí interní experimenty z roku 2025, v nichž rozklad konceptů a jejich asociace zlepšily úspěšnost na komplexních úlohách ve srovnání s výchozími metodami imitovaného a posilovaného učení. Zároveň měl klesnout náklad na predikci. 1
Veřejně dostupné zprávy ale neobsahují kompletní experimentální protokol, velikost modelů, rozložení úloh, přesné hodnoty úspěšnosti, intervaly spolehlivosti, ablační studie, kód ani nezávislou replikaci. Rozsah deklarované výhody je proto zatím veřejně nedostatečně doložen. 1
Totéž platí pro širší sliby kolem fyzické inteligence. Úspěch v simulaci nebo v interním testu ještě automaticky neprokazuje přenos na skutečné roboty, bezpečnost v reálném prostředí ani převahu nad nejlepšími alternativami.
Výzkum byl komercializován prostřednictvím společnosti Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., známé pod značkou Awomo. Firma byla podle svého profilu registrována v chaj-čou-čtvrti Si-chu 8. ledna 2026. Zaměřuje se na fyzickou AI pro autonomní řízení, robotiku, průmyslová zařízení, inteligentní hardware a generování simulačních dat. 11
Podle dostupných zpráv tvořili počáteční jádro Yu a hlavní vědecký pracovník Tong. Tým se postupně rozšířil o členy laboratoře AutoLab. Označení kolegů za „malé génie, kteří se opakovaně osvědčili“, je propagační formulace, nikoli nezávisle ověřitelná metrika kvality týmu. 1
Awomo oznámilo, že v seed a andělských kolech získalo dohromady více než 100 milionů jüanů. Mezi uvedenými investory jsou InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund a Jinma Investment. 13
Zpravodajství z srpna 2026 představilo Awomo-v0.1 jako první veřejnou verzi projektu konceptuálního světového modelu a zmínilo hodnocení na RoboTwin 2.0. Jde o simulační benchmark a rámec pro generování dat zaměřený na robustní manipulaci obouručních robotů. 1
3
Toto představení poskytuje první veřejné místo, kde lze směr Awomo sledovat. Samo o sobě však nepotvrzuje zobecnitelnost na skutečné roboty, bezpečnost ani převahu nad konkurenčními přístupy. K přesvědčivému ověření by byly potřeba zveřejněné výsledky benchmarků, standardizované baseline modely, detailní ablace a výsledky přenosu ze simulace do reálného světa.
Příběh Yu Kaichenga tak není příběhem vědce, který zavrhl data nebo vnímání. Je spíše příběhem změny cíle: od modelu, který se snaží realisticky zobrazit svět, k modelu, který má předpovídat jeho relevantní fyzické stavy a následky akcí. Zda se tento koncept ukáže jako skutečně škálovatelná cesta k fyzické inteligenci, zůstává otevřenou otázkou.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Yu Kaicheng tvrdí, že generování realistického videa ještě neznamená, že model efektivně rozumí fyzickému světu.
Yu Kaicheng tvrdí, že generování realistického videa ještě neznamená, že model efektivně rozumí fyzickému světu. Awomo chce nahradit předpovídání každého pixelu strukturovaným latentním prostorem fyzických konceptů, vztahů, akcí a kauzálních změn.
Konceptuální světový model má podle týmu lépe kombinovat známé prvky do nových situací, například při současném chytání padajícího šálku a zavírání dveří.