Yu Kaicheng pasó de investigar AutoML y percepción para conducción autónoma en Alibaba DAMO Academy a cuestionar que generar imágenes y vídeos sea la mejor vía para dotar de inteligencia física a una máquina. La propuesta de Awomo sustituye la predicción de píxeles por un espacio latente estructurado con entidades,...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
El giro de Yu Kaicheng no supone renunciar a la percepción ni a los grandes volúmenes de datos. Su conclusión es más concreta: una vez que un sistema puede generar observaciones visualmente plausibles, seguir prediciendo cada píxel puede convertirse en un intermediario demasiado caro para controlar y tomar decisiones.
La alternativa de Awomo consiste en convertir el propio estado predictivo en un inventario estructurado de conceptos físicos —objetos, estados, relaciones, acciones y cambios causales— que el agente pueda recombinar y utilizar para planificar en un espacio latente, sin tener que reconstruir continuamente un vídeo. 1
10
Yu (于开丞) comenzó trabajando en aprendizaje automático automatizado, o AutoML. Después se incorporó a Alibaba DAMO Academy a través del programa Alibaba Star y se orientó hacia la percepción para vehículos autónomos.
Su trabajo en BEVFusion combinó los datos de cámaras y sensores LiDAR —que aportan información geométrica tridimensional— en una representación común vista desde arriba, conocida como bird’s-eye view (BEV). La propuesta fue descrita posteriormente como una contribución muy citada en la fusión de sensores. 10
En 2023, Yu se incorporó a la Universidad Westlake y creó el laboratorio AutoLab. En un primer momento, el grupo exploró modelos generativos del mundo para la conducción autónoma. Según los perfiles publicados, el equipo ganó una competición de conducción autónoma de ECCV en 2024 y encabezó la clasificación de Fail2Drive en 2026. 10
La experiencia práctica llevó a Yu a replantearse el objetivo. En su lectura, generar vídeo puede resolver el problema de la apariencia visual, pero no necesariamente el de predecir consecuencias y elegir acciones. Si la pregunta relevante es «¿qué ocurrirá si actúo?», reconstruir todos los detalles de una imagen puede ser un rodeo costoso frente a modelar directamente el estado físico y la causalidad. 1
10
A finales de 2024, el equipo habría abandonado la generación de píxeles para centrarse en un espacio latente matemático aprendido de extremo a extremo. La idea es descomponer una escena en un conjunto finito de conceptos físicos reutilizables y relaciones, y después recombinarlos para predecir el siguiente estado, incluso cuando la combinación exacta no aparezca en los datos de entrenamiento. 1
En este contexto, «implícito» no significa necesariamente desestructurado. Awomo sostiene que su estado latente debe representar entidades, relaciones espaciales, estados de los objetos, acciones y transiciones causales, en lugar de limitarse a comprimir una imagen. 1
11
El beneficio buscado es la generalización composicional. Un agente que haya aprendido por separado qué es un objeto, cómo cambia su estado y cómo interactúa con otros podría enfrentarse a una combinación nueva sin necesitar ejemplos de cada escenario completo.
Ese es también el motivo por el que Yu considera que aumentar indefinidamente los datos de modelos VLA —modelos que conectan visión, lenguaje y acción— o añadir más demostraciones acaba ofreciendo rendimientos decrecientes para la inteligencia física. 1
La propuesta se sitúa dentro de la misma familia general que JEPA, la arquitectura asociada a Yann LeCun: predecir una representación del futuro en lugar de reconstruir directamente los píxeles. 1
La diferencia que reclama Awomo es semántica y arquitectónica. Según Yu, JEPA deja abierta la cuestión de qué deben contener exactamente las variables latentes. El modelo conceptual del mundo intenta responderla con un vocabulario composable de conceptos físicos.
Esa distinción sigue siendo una hipótesis de investigación, no una ventaja demostrada de forma independiente. 1
Awomo ha informado de experimentos internos realizados en 2025 en los que la descomposición y asociación de conceptos mejoraron el éxito en tareas complejas frente a referencias basadas en aprendizaje por imitación y aprendizaje por refuerzo, al tiempo que reducían el coste de predicción. 1
Pero los materiales públicos disponibles no incluyen el protocolo experimental completo, el tamaño de los modelos, la distribución de tareas, las tasas numéricas de éxito, intervalos de confianza, estudios de ablación, código ni replicaciones independientes. Por tanto, la magnitud de la ventaja anunciada sigue estando insuficientemente demostrada públicamente. 1
Yu utiliza como ejemplo una situación en la que un robot debe atrapar una taza que cae mientras cierra una puerta. La intención es representar simultáneamente varios cambios de estado y sus restricciones causales, en vez de escoger entre patrones aprendidos de un corpus de demostraciones.
Es un ejemplo motivador de la propuesta, no un resultado de referencia validado por un benchmark público. 1
La investigación se comercializó como Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., con la marca Awomo. La compañía quedó registrada en el distrito de Xihu, en Hangzhou, el 8 de enero de 2026. Su objetivo declarado es desarrollar tecnología de inteligencia física para conducción autónoma, robótica, equipos industriales, hardware inteligente y generación de datos de simulación. 11
Los reportes describen el núcleo inicial como un equipo formado por Yu y el científico jefe Tong, que después se amplió a partir de AutoLab. La expresión «genios que han demostrado constantemente su valía» para describir a los integrantes tiene carácter promocional y no constituye una métrica independiente y verificable sobre el personal. 1
Awomo anunció una financiación acumulada superior a 100 millones de yuanes en rondas semilla y ángel. Entre los inversores mencionados figuran InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund y Jinma Investment. 13
La cobertura de agosto de 2026 presentó Awomo-v0.1 como la primera versión pública del proyecto de modelo conceptual del mundo y mencionó una evaluación en RoboTwin 2.0, un benchmark y marco de generación de datos simulado para tareas robustas de manipulación robótica bimanual. 1
3
Esa presentación ofrece un primer escenario público de evaluación, pero por sí sola no demuestra que el sistema generalice a robots reales, sea seguro o supere a las principales alternativas. Para valorar la propuesta harían falta puntuaciones detalladas, referencias estandarizadas y resultados de transferencia del entorno simulado al mundo real.
En resumen, la evolución de Yu no es un rechazo absoluto de la estrategia basada en datos que ayudó a impulsar. Es un cambio de objetivo: pasar de enseñar a la máquina a producir una imagen convincente del mundo a enseñarle a mantener una representación útil de sus objetos, estados, acciones y relaciones causales. El reto ahora es demostrar que esa representación conceptual funciona fuera de los ejemplos internos y se traduce en mejoras reproducibles para robots y vehículos.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Yu Kaicheng pasó de investigar AutoML y percepción para conducción autónoma en Alibaba DAMO Academy a cuestionar que generar imágenes y vídeos sea la mejor vía para dotar de inteligencia física a una máquina.
Yu Kaicheng pasó de investigar AutoML y percepción para conducción autónoma en Alibaba DAMO Academy a cuestionar que generar imágenes y vídeos sea la mejor vía para dotar de inteligencia física a una máquina. La propuesta de Awomo sustituye la predicción de píxeles por un espacio latente estructurado con entidades, estados, relaciones espaciales, acciones y cambios causales.
El equipo afirma que sus experimentos internos de 2025 mejoraron el éxito en tareas complejas y redujeron el coste de predicción, aunque todavía faltan protocolos y resultados públicos detallados.