Юй Кайчен не відмовляється від сприйняття чи великих даних — він вважає, що відтворення кожного пікселя є надто дорогим проміжним етапом для керування. Концептуальна світова модель Awomo має представляти об’єкти, стани, просторові зв’язки, дії та причинні переходи у спільному латентному просторі.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Поворот Юй Кайчена не був відмовою від комп’ютерного зору чи масштабних даних. Його висновок інший: якщо модель уже здатна генерувати правдоподібні спостереження, то відтворення відео на рівні пікселів може бути не найкращою основою для керування. Замість цього він пропонує прогнозувати структурований стан світу — об’єкти, їхні властивості, зв’язки, дії та причинні зміни — а потім планувати в латентному просторі, не промальовуючи щоразу весь відеоряд. 1
10
Юй Кайчен (于开丞) починав із досліджень автоматичного машинного навчання — AutoML, тобто методів, які допомагають системам автоматично добирати алгоритми та налаштування. Після цього він приєднався до Alibaba DAMO Academy через програму Alibaba Star і перейшов до комп’ютерного зору для автономного водіння.
Однією з найвідоміших робіт його команди стала BEVFusion. Вона об’єднувала дані камер і лідара — сенсора, що вимірює відстань за допомогою лазерних імпульсів, — у спільному представленні з перспективи «з висоти пташиного польоту» (BEV). Такий підхід зберігає геометричну й семантичну інформацію та став широко цитованим внеском у мультисенсорне злиття. 10
У 2023 році Юй приєднався до Westlake University та створив лабораторію автономного інтелекту AutoLab. Спочатку команда працювала над генеративними світовими моделями для автономного водіння. За даними профільних публікацій, у 2024 році вона перемогла в автомобільному треку ECCV, а у 2026-му очолила рейтинг Fail2Drive. 10
Однак практична робота підштовхнула дослідника до незручного запитання: якщо модель справді має розуміти фізичний світ і передбачати наслідки дій, навіщо витрачати величезні обчислювальні ресурси на повторне відтворення всіх пікселів? У такій постановці відеогенерація може бути дорогою відволікаючою ланкою між спостереженням і рішенням. 1
10
Наприкінці 2024 року команда, як повідомляється, перейшла від генерації пікселів до наскрізно навчуваного математичного латентного простору. Її мета — розкласти сцену на обмежений набір фізичних понять і зв’язків, а потім комбінувати їх для прогнозування наступного стану. Це має дозволити працювати і з поєднаннями, яких у такому вигляді не було в навчальних даних. 1
У цьому підході слово «неявна» не означає «без структури». Awomo стверджує, що латентний стан повинен містити поняття про сутності, просторові відносини, стани об’єктів, дії та причинні переходи, а не бути лише стислим вектором зображення. 1
11
Ключова обіцянка — композиційне узагальнення. Якщо система окремо вивчила поняття «падіння», «захоплення предмета», «закриття дверей» і відповідні причинні зв’язки, вона потенційно може об’єднати їх у нову ситуацію без прикладів кожної можливої сцени цілком. Саме тому Юй вважає, що просте додавання даних для VLA-моделей — систем, які поєднують зір, мову та дії, — і нових демонстрацій з часом матиме дедалі меншу віддачу для фізичного інтелекту. 1
За загальною логікою цей підхід належить до тієї самої широкої родини методів, що й JEPA Янна ЛеКуна: модель прогнозує представлення майбутнього стану, а не намагається відновити кожен піксель. 1
Заявлена Awomo відмінність — у змісті та архітектурі латентного простору. На думку Юя, JEPA залишає відкритим питання, що саме мають описувати латентні змінні. Концептуальна світова модель натомість прагне створити композиційну «мову» фізичних понять.
Втім, це поки дослідницька гіпотеза. Незалежно підтвердженої переваги над JEPA або іншими латентними підходами наведені публічні матеріали не встановлюють. 1
Awomo повідомляє про внутрішні експерименти 2025 року, у яких декомпозиція сцен на поняття та встановлення зв’язків між ними підвищили успішність виконання складних завдань порівняно з базовими методами імітаційного та підкріплювального навчання. Команда також заявляє про нижчу вартість прогнозування. 1
Але у доступних публічних повідомленнях немає повного опису протоколу експериментів, розмірів моделей, розподілу завдань, числових показників успішності, довірчих інтервалів, абляційних досліджень, коду чи незалежної реплікації. Тому масштаб заявленої переваги наразі публічно недостатньо підтверджений. 1
Приклад із чашкою, що падає, поки робот зачиняє двері, добре ілюструє задум: система має одночасно подати кілька переходів стану та їхні причинні обмеження, а не просто вибрати знайомий шаблон із корпусу демонстрацій. Однак це приклад-мотивація, наведений у межах позиції Юя, а не підтверджений результат тестування. 1
Дослідження комерціалізували через Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., що працює під брендом Awomo. Компанію зареєстрували в районі Сіху міста Ханчжоу 8 січня 2026 року. Вона заявляє про розробку технологій фізичного ШІ для автономного водіння, робототехніки, промислового обладнання, інтелектуальних пристроїв і генерації симуляційних даних. 11
За повідомленнями, початкове ядро команди складалося із самого Юя та головного наукового співробітника на ім’я Tong, а згодом розширилося за рахунок учасників AutoLab. Характеристика колег як «маленьких геніїв, які постійно доводили власну спроможність», є рекламною мовою засновника, а не незалежно вимірюваним показником складу команди. 1
Awomo оголосила, що загальний обсяг посівного та ангельського фінансування перевищив 100 млн юанів. Серед названих інвесторів — InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund і Jinma Investment. 13
У серпневих матеріалах 2026 року Awomo-v0.1 представили як першу публічну версію роботи над концептуальною світовою моделлю. Також згадувалося оцінювання на RoboTwin 2.0 — симуляційному бенчмарку та фреймворку генерації даних для надійного маніпулювання предметами двома руками. 1
3
Це дає проєкту ранній публічний майданчик для оцінювання, але саме по собі не доводить узагальнення на реальних роботах, безпечності чи переваги над провідними альтернативами. Для ґрунтовної перевірки потрібні оприлюднені бали на бенчмарках, стандартизовані базові методи та результати перенесення з симуляції у фізичний світ.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Юй Кайчен не відмовляється від сприйняття чи великих даних — він вважає, що відтворення кожного пікселя є надто дорогим проміжним етапом для керування.
Юй Кайчен не відмовляється від сприйняття чи великих даних — він вважає, що відтворення кожного пікселя є надто дорогим проміжним етапом для керування. Концептуальна світова модель Awomo має представляти об’єкти, стани, просторові зв’язки, дії та причинні переходи у спільному латентному просторі.
Команда заявляє про кращі результати на складних завданнях і нижчу вартість прогнозування, але публічних даних для незалежної перевірки поки недостатньо.