BYD oplyser, at HyWorldVLA opnåede 90,59 PDMS på NAVSIM v1 ved at kombinere supervision på pixelniveau med forudsigelser i et komprimeret latent space. Træningen foregår i tre trin: en sprogvejledt video VAE, hybrid prætræning med både pixel og latentmål samt fælles finjustering med en action ekspert, der genererer...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD har præsenteret HyWorldVLA, en Vision-Language-Action-model (VLA) til autonom kørsel med en hybrid verdensmodel. Idéen er at kombinere to forskellige måder at repræsentere trafiksituationen på: detaljerede fremtidige billeder på pixelniveau og mere kompakte, såkaldte latente repræsentationer. 1
Det skal give modellen både et præcist visuelt grundlag og en mere beregningsvenlig måde at forudsige og planlægge bilens bevægelser på.
At forudsige fremtidige videobilleder pixel for pixel kan bevare små, visuelle detaljer i scenen, men det kræver meget regnekraft. En model, der arbejder i et latent space – en komprimeret intern repræsentation af scenen – kan være lettere at køre, men risikerer at sortere detaljer fra, som er vigtige for kørsel. 1
HyWorldVLA forsøger ikke at vælge den ene metode frem for den anden. I træningen bruges pixelbaseret supervision til at sikre, at det latente rum fortsat er bundet til den faktiske vejscene. Under brug forudsiger systemet derimod kun latente egenskaber, som sendes videre til en specialiseret action-ekspert, der genererer kørselsbaner. 1
7
Kort sagt: Den dyre, detaljerede pixelanalyse bruges til at forme modellen under træningen, mens den komprimerede repræsentation bruges, når modellen skal træffe beslutninger effektivt.
Først trænes en video-variational autoencoder, eller video-VAE, til at komprimere sekvenser af kørselsvideo til latente egenskaber. Sprog indgår som semantisk kontekst, mens videokompressoren trænes. 2
5
Målet er ikke blot at få videoen til at fylde mindre. Den komprimerede repræsentation skal bevare oplysninger, der kan bruges til at forudsige, hvad der sker på vejen, og til sidst vælge en kørselsbane.
Derefter samles billeder, handlinger, sproglige elementer og latente egenskaber som diskrete tokens, der bruges til autoregressiv forudsigelse. I denne fase forudsiger modellen både fremtidige video-latents og rekonstruerer fremtidige videobilleder. 1
2
Det er kernen i den dobbelte supervision:
Pixel-tabet fungerer dermed som en begrænsning: Det skal forhindre den latente model i at komprimere scenen så hårdt, at afgørende information går tabt. 1
7
Til sidst finjusteres verdensmodellen sammen med en model, der er specialiseret i handlinger og kørselsbaner. Når systemet er i drift, forudsiger det latente egenskaber i stedet for at generere komplette billeder på pixelniveau. Egenskaberne sendes til action-eksperten, som producerer bilens planlagte bane. 1
Det er den centrale effektivitetsgevinst: Pixel-supervisionen hjælper med at lære en brugbar repræsentation, men den samme tunge pixelgenerering behøver ikke at køre under den løbende inferens i bilen.
På benchmarken NAVSIM v1 rapporterede HyWorldVLA en score på 90,59 PDMS. Papiret og de tilhørende omtaler beskriver det som det førende blandt offentligt rapporterede resultater på det tidspunkt. 1
7
Forsøg, hvor enkelte komponenter fjernes – såkaldte ablation-tests – peger på, at den hybride tilgang ikke blot er to teknikker lagt oven på hinanden:
Det understøtter forskernes pointe: Pixel-supervisionen og den latente forudsigelse løser hver sin del af opgaven. Pixelsporet bevarer troværdigheden i den visuelle scene, mens latent space gør forudsigelse og handlingsplanlægning mere kompakt.
Papiret undersøger to vægte i træningen: λ1 for tabet ved forudsigelse af videotokens og λ2 for konsistensen i den latente repræsentation. 20
Når λ2 holdes fast på 0,1, forbedres PDMS fra 90,48 til 90,59, når λ1 øges fra 0,1 til 0,5. Ved λ1 på 1,0 falder resultatet igen til 89,83. 20
Når λ1 holdes på 0,5, reduceres præstationen, hvis λ2 hæves over 0,1: Ved 0,2 er PDMS 90,47, og den fortsætter nedad ved højere værdier. 20
Pointen er altså ikke, at mere supervision automatisk er bedre. Modellen skal have nok pixel- og latentbegrænsninger til at bevare relevant information, men ikke så mange, at repræsentationen bliver for rigid.
PDMS er et samlet mål for kvaliteten af kørselsplanlægningen i NAVSIM, en simuleret benchmark for autonom kørsel. Målet omfatter blandt andet kollisioner, som ego-bilen selv er ansvarlig for, overholdelse af det kørbare vejareal, tid til potentiel kollision, komforten i kørslen og fremdrift på ruten. 2
En score på 90,59 er derfor ikke blot et mål for, hvor godt modellen genkender billeder. Den siger noget om planlægningen af kørsel i denne specifikke testopsætning.
Men resultatet er stadig opnået i en benchmark- og simuleringskontekst. Det er ikke det samme som en uafhængig dokumentation af sikkerhed eller ydeevne i rigtig trafik.
Arbejdet er tilknyttet BYD’s Automotive New Technology Research Institute og er et offentligt tegn på, at bilproducenten investerer i intern forskning i foundation models til autonom kørsel. 1
Omtalen af forbindelser til robotteknisk ekspertise fra Harbin Institute of Technology er interessant, men det tilgængelige primærmateriale dokumenterer ikke hver enkelt forskers akademiske baggrund. 5
I forhold til kinesiske elbilrivaler som NIO, XPeng og Li Auto giver HyWorldVLA BYD et målbart, offentligt forskningsresultat inden for VLA og world modeling. Det viser forskningskapacitet – ikke, at BYD allerede har et dokumenteret forspring i autonom kørsel på almindelige veje.
BYD’s skala i bilproduktionen kan blive en fordel, hvis selskabet kan omsætte forskningsresultatet til et sikkert, valideret og effektivt udrullet produkt. Den afgørende prøve bliver derfor ikke den næste benchmarkscore, men om overgangen fra model og simulering til drift på vejene kan ske pålideligt.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
BYD oplyser, at HyWorldVLA opnåede 90,59 PDMS på NAVSIM v1 ved at kombinere supervision på pixelniveau med forudsigelser i et komprimeret latent space.
BYD oplyser, at HyWorldVLA opnåede 90,59 PDMS på NAVSIM v1 ved at kombinere supervision på pixelniveau med forudsigelser i et komprimeret latent space. Træningen foregår i tre trin: en sprogvejledt video VAE, hybrid prætræning med både pixel og latentmål samt fælles finjustering med en action ekspert, der genererer kørselsbaner.
Når pixel forudsigelsen fjernes, falder PDMS fra 90,59 til 87,50. Uden latent space behandlingen falder resultatet til 89,91, hvilket peger på, at de to dele supplerer hinanden.