Юй Кайчэн не отвергает данные и компьютерное зрение: его вывод состоит в том, что генерация каждого пикселя может быть дорогим промежуточным шагом для управления, если модель уже умеет правдоподобно синтезировать набл... Вместо восстановления видео команда Awomo стремится моделировать физически значимое состояние ми...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Юй Кайчэн пришёл к концепции «концептуальной модели мира» не через отказ от компьютерного зрения или больших данных. Его разворот был более практичным: если модель уже способна генерировать реалистичные изображения и видео, постоянное восстановление пикселей может оказаться слишком дорогим способом отвечать на главный вопрос автономного агента — что произойдёт после конкретного действия.
Альтернатива Awomo — прогнозировать не картинку, а структурированное состояние физического мира. В него должны входить объекты, их свойства, пространственные отношения, действия и причинные переходы. Тогда система сможет комбинировать выученные элементы и планировать в латентном пространстве, не рисуя заново каждый кадр. 1
10
Юй начинал с автоматического машинного обучения — AutoML, то есть методов, позволяющих автоматизировать поиск и настройку алгоритмов. После защиты диссертации он присоединился к Alibaba DAMO Academy в рамках программы Alibaba Star и переключился на восприятие в беспилотном транспорте.
Одной из наиболее известных его работ стала BEVFusion. Метод объединял данные камер и лидаров в общей BEV-представленности — пространстве «вида сверху», которое одновременно сохраняет геометрическую и смысловую информацию. Эта работа стала широко цитируемым вкладом в многосенсорное восприятие. 10
В 2023 году Юй перешёл в Западный озёрный университет и создал лабораторию автономного интеллекта AutoLab. Сначала команда исследовала генеративные мировые модели для автономного вождения. По данным профильных публикаций, в 2024 году она выиграла автомобильный трек ECCV, а в 2026 году возглавила рейтинг Fail2Drive. 10
Именно этот опыт, по словам Юя, подтолкнул команду пересмотреть собственный подход. Генерация видео помогает добиться визуального реализма, но не обязательно делает систему лучше в планировании и управлении. Для агента важнее понять, как изменится состояние среды после действия, чем с высокой точностью восстановить все детали изображения. 1
10
В конце 2024 года команда, как сообщается, перешла от генерации пикселей к сквозному обучаемому математическому латентному пространству. Идея состоит в том, чтобы разложить сцену на конечный набор повторно используемых физических концептов и отношений, а затем собрать из них прогноз следующего состояния — в том числе такого сочетания, которого в обучающих данных целиком не было. 1
В этом смысле «неявная» модель не означает бесформенное или случайное представление. Awomo утверждает, что латентное состояние должно содержать понятия, связанные с физическим миром:
Такой подход призван дать композиционное обобщение. Если система отдельно выучила понятия «падающий предмет», «закрывающаяся дверь» и «движение руки», она потенциально сможет рассуждать об их новой комбинации без отдельного набора демонстраций для каждого полного сценария. Именно поэтому Юй считает, что простое увеличение объёма данных VLA-моделей — моделей, связывающих зрение, язык и действия, — со временем столкнётся с убывающей отдачей. 1
По общей логике концептуальная модель Awomo относится к тому же широкому семейству методов латентного предсказания, что и JEPA Янна ЛеКуна: модель должна предсказывать представление будущего состояния, а не восстанавливать каждый пиксель. 1
Заявленное отличие Awomo — в том, что именно должно находиться внутри латентного пространства. По версии Юя, JEPA оставляет этот вопрос открытым, тогда как концептуальная модель мира пытается заранее задать композиционный словарь физических понятий.
Пока это исследовательская гипотеза, а не независимо доказанное преимущество. Само по себе наличие более осмысленных латентных переменных ещё не гарантирует лучшей обобщаемости, надёжности или эффективности в реальном роботе. 1
Awomo сообщила о внутренних экспериментах 2025 года. Согласно опубликованным описаниям, разложение сцен на концепты и установление связей между ними повысили успешность на сложных задачах по сравнению с базовыми методами имитационного обучения и обучения с подкреплением. Одновременно снизилась стоимость предсказаний. 1
Однако публично доступные материалы не содержат полного протокола экспериментов, размеров моделей, распределения задач, численных показателей успешности, доверительных интервалов, абляционных исследований, кода или независимого воспроизведения результатов. Поэтому масштаб заявленного преимущества пока нельзя надёжно оценить по открытым данным. 1
Пример с роботом, который должен поймать падающую чашку, одновременно закрывая дверь, хорошо иллюстрирует замысел. Модель должна совместно представить несколько происходящих изменений и их причинные ограничения, а не выбрать знакомый шаблон из набора демонстраций. Но этот пример следует воспринимать как мотивационный сценарий Юя, а не как подтверждённый результат отдельного бенчмарка. 1
Коммерческим продолжением проекта стала компания Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., работающая под брендом Awomo. Она зарегистрирована в районе Сиху города Ханчжоу 8 января 2026 года.
Компания заявляет, что развивает технологии физического ИИ для автономного вождения, робототехники, промышленного оборудования, интеллектуальных устройств и генерации симуляционных данных. В собственной формулировке Awomo делает ставку на подход «сначала латентное пространство» — Latent-First — и пытается создать слой физического здравого смысла, который позволит системе понимать пространство, объекты, состояния, действия и причинность. 11
По сообщениям СМИ, первоначальное ядро команды составили Юй и главный научный сотрудник по имени Tong; затем к проекту присоединились специалисты из AutoLab. Характеристика новых коллег как «маленьких гениев, которые постоянно доказывали свою состоятельность» относится к рекламной риторике основателя, а не к проверяемому показателю качества команды. 1
Awomo объявила, что суммарно привлекла более 100 млн юаней на посевной и ангельской стадиях. Среди названных инвесторов — InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund и Jinma Investment. 13
В августе 2026 года компания представила Awomo-v0.1 как первую публичную версию проекта концептуальной модели мира. В материалах также упоминалась оценка на RoboTwin 2.0 — симуляционном фреймворке и бенчмарке для устойчивого управления двуручными роботами. 1
3
Это даёт проекту раннюю публичную площадку для проверки идеи. Но одна такая демонстрация ещё не доказывает переносимость на реальные роботы, безопасность или превосходство над ведущими альтернативами. Для убедительной оценки потребуются раскрытые баллы на бенчмарках, единые базовые методы сравнения и результаты переноса из симуляции в физический мир.
Путь Юя поэтому выглядит не как простая смена научной моды, а как попытка изменить объект масштабирования. Вместо того чтобы бесконечно наращивать объём данных для генерации всё более реалистичных наблюдений, Awomo хочет научить систему оперировать компактным набором понятий о мире. Сработает ли такой переход от «рисования» к моделированию причинных состояний, покажут только более подробные и независимо воспроизводимые эксперименты.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Юй Кайчэн не отвергает данные и компьютерное зрение: его вывод состоит в том, что генерация каждого пикселя может быть дорогим промежуточным шагом для управления, если модель уже умеет правдоподобно синтезировать набл...
Юй Кайчэн не отвергает данные и компьютерное зрение: его вывод состоит в том, что генерация каждого пикселя может быть дорогим промежуточным шагом для управления, если модель уже умеет правдоподобно синтезировать набл... Вместо восстановления видео команда Awomo стремится моделировать физически значимое состояние мира — объекты, отношения, состояния, действия и причинные изменения — в компактном латентном пространстве.
В 2025 году команда сообщила о внутренних экспериментах с более высокой успешностью на сложных задачах и меньшей стоимостью предсказаний по сравнению с базовыми методами имитационного и подкрепляющего обучения, однако...