HyWorldVLA fra BYD oppnådde 90,59 PDMS på NAVSIM v1 ved å kombinere pikseltillsyn med prediksjon i et komprimert latent rom. Opplæringen skjer i tre faser: en språkveiledet video VAE, hybrid forhåndstrening og felles finjustering med en ekspertmodell som lager kjøreforløp.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD har presentert HyWorldVLA, en Vision-Language-Action-modell (VLA) for autonom kjøring med en hybrid «verdensmodell». Hovedideen er å bruke to måter å representere trafikksituasjonen på: detaljerte prognoser på pikselnivå, og komprimerte representasjoner i et såkalt latent rom. Det første gir sterk visuell forankring; det andre skal gjøre prediksjon og planlegging av kjøreforløp mer beregningseffektiv. 1
Å forutsi fremtidige videobilder piksel for piksel kan bevare svært mange detaljer i scenen. Men det krever mye regnekraft. En modell som arbeider i et latent rom, bruker i stedet en komprimert intern representasjon av scenen. Det er mer praktisk under kjøring, men kan også føre til at informasjon som er viktig for kjørebeslutninger, går tapt. 1
HyWorldVLA forsøker å unngå å velge bare én av tilnærmingene. Under trening bruker modellen pikseltilsyn for å holde den latente representasjonen tett knyttet til den faktiske visuelle scenen. Under bruk predikerer den derimot bare latente trekk, som sendes videre til en handlingsmodell som produserer kjøreforløp. 1
7
Først komprimerer en video-variational autoencoder, eller video-VAE, sekvenser av kjørevideor til latente trekk. Språk brukes som semantisk kontekst i opplæringen av denne komprimeringsmodellen. 2
5
Målet er ikke bare å gjøre videodataene mindre. Det latente rommet må samtidig beholde informasjon som er nyttig for å forutsi hva som skjer videre – og til slutt for å styre bilen.
Deretter samles bilder, handlinger, språkinformasjon og latente trekk i diskrete tokener som modellen lærer å forutsi autoregressivt. I denne fasen predikerer HyWorldVLA både framtidige video-latenter og rekonstruerer framtidige videobilder. 1
2
Det er kjernen i modellens doble tilsyn:
Enkelt sagt fungerer pikselmålet som en kontrollmekanisme: Den skal hindre at den latente representasjonen blir så komprimert at den mister detaljer som er viktige i trafikkbildet. 1
7
I siste fase finjusteres verdensmodellen sammen med en spesialisert handlings- eller baneekspert. Når systemet kjører, predikerer det latente trekk i stedet for hele bilder på pikselnivå. Disse trekkene brukes av handlingseksperten til å generere kjøreforløp. 1
Dette skillet er sentralt for effektiviteten: Den kostbare piksellæringen brukes til å forme representasjonen under trening, uten at bilen må betale den samme beregningskostnaden ved løpende prediksjon.
På NAVSIM v1 rapporterte HyWorldVLA en PDMS på 90,59. Artikkelen og tilhørende omtale beskrev dette som ledende blant de offentlige resultatene på tidspunktet. 1
7
Ablasjonsforsøkene – der enkeltdeler av modellen tas bort for å måle effekten – tyder på at hybridoppsettet betyr noe:
Funnene støtter forskernes hypotese om at pikseltilsyn og latent prediksjon løser ulike deler av oppgaven: Pikslene bevarer detaljtroskapen til scenen, mens det latente rommet gir en mer økonomisk representasjon for handlingsprediksjon.
Artikkelen undersøker to vekter: λ1 for tapet knyttet til prediksjon av videotokener, og λ2 for konsistens i den latente representasjonen. 20
Da λ2 ble holdt på 0,1, forbedret en økning av λ1 fra 0,1 til 0,5 PDMS fra 90,48 til 90,59. Da λ1 ble økt videre til 1,0, falt resultatet til 89,83. 20
Med λ1 fast på 0,5 ga en økning av λ2 over 0,1 svakere resultater: Ved 0,2 var PDMS 90,47, og ved ytterligere økninger fortsatte nedgangen. 20 Poenget er dermed ikke at mer tilsyn alltid er bedre. Modellen trenger nok begrensninger til å beholde nyttig visuell og latent informasjon, men ikke så mange at representasjonen blir for rigid.
PDMS er en sammensatt måling av kjørekvalitet i NAVSIM, en simuleringsbasert benchmark for autonom kjøring. Den inkluderer blant annet kollisjonsunngåelse der eget kjøretøy har ansvar, etterlevelse av kjørbart område, tid til mulig kollisjon, bevegelseskomfort og framdrift langs ruten. 2
En score på 90,59 er derfor ikke bare et mål på bildegjenkjenning. Den sier noe om kvaliteten på kjøreplanleggingen innenfor denne spesifikke testprotokollen. Samtidig er dette en evaluering i simulering, ikke en uavhengig dokumentasjon av sikkerhet eller ytelse i vanlig veitrafikk.
Arbeidet er knyttet til BYDs Automotive New Technology Research Institute og er et offentlig tegn på selskapets satsing på egen forskning på grunnmodeller for autonom kjøring. 1 Omtalen av koblinger til robotikkmiljøet ved Harbin Institute of Technology er interessant, men tilgjengelig primærmateriale er ikke nok til å fastslå den akademiske bakgrunnen til hver enkelt forsker.
5
Sammenlignet med konkurrenter som NIO, XPeng og Li Auto gir HyWorldVLA BYD et offentlig, målbart forskningsresultat innen VLA-modeller og verdensmodellering. Det viser forskningskapasitet, men ikke at BYD allerede har dokumentert et forsprang i selvkjøring på ekte vei.
BYDs store kjøretøyskala kan bli en fordel bare dersom selskapet klarer å omsette forskningsresultatet til et sikkert, validert og effektivt utrullet produkt. Den neste viktige testen er ikke nødvendigvis en ny benchmarksrekord, men en pålitelig overgang fra modell og simulering til faktisk veidrift.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
HyWorldVLA fra BYD oppnådde 90,59 PDMS på NAVSIM v1 ved å kombinere pikseltillsyn med prediksjon i et komprimert latent rom.
HyWorldVLA fra BYD oppnådde 90,59 PDMS på NAVSIM v1 ved å kombinere pikseltillsyn med prediksjon i et komprimert latent rom. Opplæringen skjer i tre faser: en språkveiledet video VAE, hybrid forhåndstrening og felles finjustering med en ekspertmodell som lager kjøreforløp.
Når pikselprediksjon ble fjernet, falt PDMS fra 90,59 til 87,50. Uten latent behandling falt resultatet til 89,91, noe som tyder på at komponentene utfyller hverandre.