Après avoir travaillé sur la perception automobile et la fusion de données LiDAR caméra, Yu Kaicheng estime que générer des pixels réalistes n’est pas forcément la meilleure étape intermédiaire pour piloter un agent p... Le modèle conceptuel d’Awomo cherche à représenter les objets, leurs états, leurs relations, les...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Le virage de Yu Kaicheng ne constitue pas un rejet de la perception visuelle ni des jeux de données à grande échelle. Il part d’un constat plus ciblé : une fois qu’un système sait produire des observations visuellement plausibles, continuer à générer chaque pixel peut devenir une étape intermédiaire coûteuse et peu utile pour la décision. Son alternative consiste à faire de l’état prédictif lui-même une structure organisée de concepts physiques — objets, états, relations, actions et transformations causales — afin que l’agent puisse les recombiner et planifier dans un espace latent, sans devoir constamment restituer une vidéo. 1
10
À la fin de 2024, l’équipe aurait abandonné la génération directe de pixels au profit d’un espace latent mathématique appris de bout en bout. L’objectif est de décomposer une scène en un ensemble fini de concepts physiques et de relations réutilisables, puis de recomposer ces éléments pour prédire l’état suivant — y compris des associations qui n’étaient jamais apparues telles quelles dans les données d’entraînement. 1
Dans cette approche, « implicite » ne veut donc pas dire « informe » ou « dépourvu de structure ». La thèse d’Awomo est que l’état latent doit encoder des entités, des relations spatiales, l’état des objets, des actions et des transitions causales, plutôt que de se limiter à une version compressée d’une image. 1
11
Le bénéfice recherché est la généralisation compositionnelle. Un agent qui a appris séparément les concepts pertinents pourrait raisonner face à une nouvelle combinaison de ces concepts, au lieu d’avoir besoin d’un exemple pour chaque scénario complet. C’est aussi la raison pour laquelle Yu estime que l’ajout continu de données VLA — modèles associant vision, langage et action — ou de démonstrations finit par produire des gains décroissants pour l’intelligence physique. 1
La proposition s’inscrit dans la même grande famille que le JEPA défendu par Yann LeCun : prédire une représentation de l’environnement plutôt que reconstruire directement les pixels. 1
La différence revendiquée par Awomo est à la fois sémantique et architecturale. Selon Yu, JEPA laisse ouverte la question de ce que doivent contenir les variables latentes. Le « monde conceptuel », lui, chercherait à y inscrire un vocabulaire explicite de concepts physiques pouvant être combinés. Cette distinction reste toutefois une hypothèse de recherche : les éléments publics disponibles ne suffisent pas encore à établir indépendamment un avantage systématique. 1
Awomo rapporte des expériences internes réalisées en 2025. D’après ces résultats, la décomposition et l’association de concepts auraient amélioré la réussite sur des tâches complexes par rapport à des références fondées sur l’apprentissage par imitation et l’apprentissage par renforcement, tout en diminuant le coût de prédiction. 1
Mais les informations publiques disponibles ne donnent ni protocole expérimental complet, ni taille des modèles, ni répartition des tâches, ni taux de réussite détaillés, ni intervalles de confiance, ni études d’ablation, ni code, ni réplication indépendante. L’ampleur exacte de l’avantage annoncé reste donc insuffisamment étayée publiquement. 1
L’exemple d’un agent qui rattraperait une tasse en train de tomber tout en fermant une porte illustre l’ambition du projet : représenter ensemble plusieurs transitions d’état et leurs contraintes causales, plutôt que choisir une action à partir de motifs observés dans une banque de démonstrations. Il s’agit d’un exemple destiné à motiver la démarche de Yu, et non d’un résultat de benchmark vérifié. 1
La recherche a été transformée en entreprise sous le nom de Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., avec la marque Awomo. La société a été enregistrée dans le district de Xihu, à Hangzhou, le 8 janvier 2026. Elle affirme développer des briques d’IA physique pour la conduite autonome, la robotique, les équipements industriels, les appareils intelligents et la production de données de simulation. 11
Selon les articles disponibles, le premier noyau réunissait Yu et Tong, son directeur scientifique, avant de s’élargir à partir de l’équipe d’AutoLab de Westlake. La formule présentant les nouvelles recrues comme des « génies ayant constamment fait leurs preuves » relève du discours promotionnel et ne constitue pas un indicateur indépendant et vérifiable des compétences de l’équipe. 1
Awomo a annoncé un financement cumulé supérieur à 100 millions de yuans lors de ses tours d’amorçage et de pré-amorçage. Les investisseurs cités sont InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund et Jinma Investment. 13
Les articles publiés en août 2026 ont présenté Awomo-v0.1 comme la première version publique de cette recherche sur le monde conceptuel. Ils mentionnent également une évaluation sur RoboTwin 2.0, un cadre de simulation et de génération de données destiné à tester la robustesse de la manipulation robotique bimanuelle. 1
3
Cette présentation fournit un premier terrain d’évaluation public, mais elle ne démontre pas à elle seule la généralisation à des robots réels, la sûreté du système ou sa supériorité sur les solutions concurrentes. Pour juger solidement la proposition, il faudrait disposer de scores détaillés, de références standardisées et de résultats de transfert de la simulation vers le monde réel.
Le parcours de Yu est ainsi moins celui d’un chercheur qui renierait ses travaux antérieurs que celui d’un ingénieur de la perception arrivé à la limite d’une certaine intuition : davantage de données et de calcul peuvent améliorer les apparences, sans nécessairement fournir à une machine une compréhension exploitable des conséquences physiques. Awomo tente de déplacer le centre de gravité du problème — de l’image à l’état du monde — mais la validation indépendante de cette promesse reste encore à construire.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Après avoir travaillé sur la perception automobile et la fusion de données LiDAR caméra, Yu Kaicheng estime que générer des pixels réalistes n’est pas forcément la meilleure étape intermédiaire pour piloter un agent p...
Après avoir travaillé sur la perception automobile et la fusion de données LiDAR caméra, Yu Kaicheng estime que générer des pixels réalistes n’est pas forcément la meilleure étape intermédiaire pour piloter un agent p... Le modèle conceptuel d’Awomo cherche à représenter les objets, leurs états, leurs relations, les actions et les changements causaux dans un espace latent mathématique et composable.
Des expériences internes menées en 2025 auraient amélioré la réussite sur des tâches complexes tout en réduisant le coût de prédiction, mais les détails permettant une vérification indépendante n’ont pas été publiés.