HyWorldVLA de BYD obtuvo 90,59 PDMS en NAVSIM v1 al combinar supervisión a nivel de píxel con predicción en un espacio latente comprimido. El sistema entrena primero un VAE de vídeo, después combina objetivos de píxeles y latentes en el preentrenamiento, y finalmente ajusta el modelo junto a un experto que genera tr...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD ha presentado HyWorldVLA, un modelo de tipo Vision-Language-Action (VLA) para conducción autónoma que emplea un «modelo del mundo» híbrido. Su propuesta combina dos formas de representar la carretera: predicciones detalladas a nivel de píxel, que mantienen el vínculo con la escena visual, y representaciones latentes comprimidas, más eficientes para anticipar lo que ocurrirá y planificar una trayectoria. 1
Predecir futuros fotogramas píxel a píxel conserva muchos detalles de la escena, pero exige una gran capacidad de cálculo. Trabajar en un espacio latente, en cambio, significa predecir sobre una versión comprimida y abstracta de esa información: resulta más práctico para la ejecución, aunque puede dejar fuera detalles relevantes para conducir. 1
HyWorldVLA no escoge una sola vía. Durante el entrenamiento utiliza supervisión por píxeles para que el espacio latente siga anclado a la imagen real de la carretera. En la fase operativa, sin embargo, predice únicamente características latentes y las entrega a un action expert, el módulo encargado de generar trayectorias. 1
7
La idea es aprovechar la precisión visual costosa cuando se entrena el sistema, sin tener que asumir ese mismo coste al usarlo para planificar la conducción.
En primer lugar, un autoencoder variacional de vídeo, o video VAE, comprime secuencias de conducción en características latentes. El lenguaje se incorpora como contexto semántico durante el entrenamiento de ese compresor. 2
5
El objetivo no es solo reducir el volumen de datos del vídeo: la representación comprimida debe retener información útil para prever la evolución de la escena y tomar decisiones de conducción.
Después, imágenes, acciones, elementos lingüísticos y características latentes se convierten en tokens discretos que el modelo procesa de forma autorregresiva. En esta etapa predice los latentes de vídeo futuros y, al mismo tiempo, reconstruye los fotogramas futuros. 1
2
Ahí está la clave de la supervisión dual:
Dicho de forma sencilla, la pérdida asociada a los píxeles actúa como una restricción: evita que el modelo latente comprima tanto la escena que termine perdiendo detalles importantes. 1
7
En la fase final, BYD optimiza conjuntamente el modelo del mundo y un modelo especializado en acciones o trayectorias. Durante la ejecución, el sistema predice características latentes en vez de generar fotogramas completos a nivel de píxel; esas características alimentan al experto de acciones, que produce la trayectoria de conducción. 1
Esta separación explica el enfoque de eficiencia: la supervisión visual detallada moldea la representación durante el aprendizaje, mientras que la inferencia se apoya en el espacio latente, menos costoso.
En NAVSIM v1, HyWorldVLA registró 90,59 PDMS, una cifra que el trabajo y las informaciones relacionadas describen como líder entre los resultados públicos en ese momento. 1
7
Los experimentos de ablación —pruebas en las que se retiran componentes para medir su aportación— sugieren que la combinación no es una simple suma de funciones:
Los datos respaldan la hipótesis de los investigadores: la supervisión por píxeles y la predicción latente resuelven partes distintas del problema. La primera conserva fidelidad respecto de la escena; la segunda permite una representación más económica para anticipar acciones.
El artículo analiza dos pesos: λ1, asociado a la pérdida de predicción de tokens de vídeo, y λ2, relativo a la consistencia de la representación latente. 20
Con λ2 fijado en 0,1, elevar λ1 de 0,1 a 0,5 mejoró el PDMS de 90,48 a 90,59. Al subir λ1 hasta 1,0, el resultado descendió a 89,83. 20
Con λ1 fijado en 0,5, aumentar λ2 por encima de 0,1 también redujo el rendimiento: con 0,2, el PDMS fue de 90,47, y la tendencia siguió bajando al incrementarlo más. 20
La conclusión no es que una mayor supervisión sea siempre preferible. El modelo necesita suficiente restricción visual y latente para conservar información útil, pero no tanta como para volver su representación excesivamente rígida.
El PDMS es una métrica compuesta de calidad de conducción dentro del simulador NAVSIM. Considera factores como evitar colisiones atribuibles al vehículo propio, respetar las zonas transitables, el tiempo hasta una posible colisión, la comodidad del movimiento y el progreso a lo largo de la ruta. 2
Por eso, un 90,59 no equivale a una puntuación de reconocimiento de imágenes: refleja el desempeño de planificación de conducción dentro de ese benchmark. Aun así, se trata de una evaluación en un entorno simulado y no de una validación independiente de seguridad o rendimiento en tráfico real.
El trabajo está atribuido al Automotive New Technology Research Institute de BYD y constituye una señal pública de su inversión en investigación propia sobre modelos fundacionales para conducción autónoma. 1
Las referencias a una conexión del equipo con experiencia en robótica del Harbin Institute of Technology resultan relevantes, pero la evidencia primaria disponible no permite confirmar la trayectoria académica de cada investigador. 5
Frente a fabricantes como NIO, XPeng y Li Auto, HyWorldVLA aporta a BYD un resultado de investigación público y medible en VLA y modelado del mundo. Eso muestra capacidad investigadora, pero no demuestra que la compañía tenga ya una ventaja confirmada en la conducción autónoma en carretera.
La escala de despliegue de vehículos de BYD solo se convertiría en una ventaja si logra transformar este resultado de investigación en un producto seguro, validado y desplegado de forma eficiente. La prueba decisiva no será otro marcador de simulación, sino la transición fiable del modelo a la circulación real.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
HyWorldVLA de BYD obtuvo 90,59 PDMS en NAVSIM v1 al combinar supervisión a nivel de píxel con predicción en un espacio latente comprimido.
HyWorldVLA de BYD obtuvo 90,59 PDMS en NAVSIM v1 al combinar supervisión a nivel de píxel con predicción en un espacio latente comprimido. El sistema entrena primero un VAE de vídeo, después combina objetivos de píxeles y latentes en el preentrenamiento, y finalmente ajusta el modelo junto a un experto que genera trayectorias.
Eliminar la predicción por píxeles redujo el resultado a 87,50 PDMS; retirar el procesamiento en espacio latente lo llevó a 89,91, lo que apunta a funciones complementarias.