BYD:s HyWorldVLA nådde 90,59 PDMS i NAVSIM v1 genom att kombinera pixelbaserad övervakning med prediktion i ett komprimerat latent space. Metoden tränas i tre steg: en språkvägledd video VAE, hybrid förträning med både pixel och latentprediktion samt samoptimering med en expert för köråtgärder och trajektorier.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD har presenterat HyWorldVLA, en Vision-Language-Action-modell (VLA) för självkörning med en hybridvariant av ett så kallat världsmodellssystem. Grundidén är att modellen använder två sätt att representera trafiksituationen: detaljerade förutsägelser på pixelnivå för tydlig visuell förankring och komprimerade, latenta representationer för effektivare prognoser och trajektorieplanering. 1
Att förutsäga framtida videobilder pixel för pixel kan behålla mycket av scenens detaljrikedom, men kräver stora beräkningsresurser. En modell som arbetar i latent space gör i stället sina prognoser i en komprimerad representation. Det är mer praktiskt vid körning, men riskerar att tappa information som är viktig i trafiken. 1
HyWorldVLA försöker undvika att välja bara den ena vägen. Under träningen används pixelövervakning för att hålla den latenta representationen knuten till den faktiska syninmatningen. När systemet används förutsäger det däremot endast latenta egenskaper, som skickas vidare till en action expert – en specialiserad modul som skapar körtrajektorier. 1
7
I det första steget komprimerar en video-VAE (variational autoencoder) sekvenser av körvideo till latenta egenskaper. Språk används som semantiskt sammanhang när videokomprimeringen tränas. 2
5
Målet är alltså inte enbart att minska mängden videodata. Den latenta representationen måste också behålla den information som behövs för att förutsäga vad som händer härnäst – och i förlängningen för att fatta körbeslut.
Därefter förs bilder, åtgärder, språkliga element och latenta egenskaper samman som diskreta tokens för autoregressiv prediktion. Modellen förutsäger då framtida video-latenter samtidigt som den rekonstruerar framtida bildrutor. 1
2
Detta är kärnan i den dubbla övervakningen:
Enkelt uttryckt fungerar pixelförlusten som en begränsning: den ska hindra den latenta modellen från att komprimera trafiksituationen så hårt att avgörande detaljer försvinner. 1
7
I det sista steget finjusteras världsmodellen tillsammans med en specialiserad åtgärds- och trajektoriemodul. Vid användning förutsäger systemet latenta egenskaper i stället för att generera kompletta bildrutor på pixelnivå. Egenskaperna används sedan av action expert-modulen för att skapa körtrajektorier. 1
Den uppdelningen är central för effektiviteten. Den beräkningstunga pixelövervakningen används för att forma representationen under träningen, utan att samma kostnad behöver uppstå när modellen körs.
I NAVSIM v1 rapporterade HyWorldVLA 90,59 PDMS, vilket artikeln och relaterade rapporter beskriver som det främsta offentliga resultatet vid tidpunkten. 1
7
Ablationstesterna – där en komponent i taget tas bort – talar för att hybridupplägget inte bara är fler funktioner ovanpå varandra:
Resultaten stödjer forskarnas hypotes: pixelövervakning och latent prediktion löser olika delar av problemet. Den första bevarar troheten till den visuella scenen, medan den andra ger en resurssnål representation som kan användas för att förutsäga åtgärder.
I uppsatsen testas två vikter: λ1 för förlusten vid prediktion av videotokens och λ2 för konsekvensen i den latenta representationen. 20
Med λ2 låst till 0,1 förbättrades PDMS från 90,48 till 90,59 när λ1 höjdes från 0,1 till 0,5. När λ1 höjdes vidare till 1,0 föll resultatet till 89,83. 20
Med λ1 låst till 0,5 sänktes prestandan när λ2 höjdes över 0,1: vid 0,2 var PDMS 90,47, och den nedåtgående trenden fortsatte vid högre värden. 20 Slutsatsen är inte att mer övervakning alltid är bättre. Modellen behöver tillräckligt mycket pixel- och latentstyrning för att behålla användbar information, men inte så mycket att representationen blir för rigid.
PDMS är ett sammansatt mått på körkvalitet i NAVSIM, en simuleringsbaserad testmiljö för självkörning. Det omfattar bland annat undvikande av kollisioner där det egna fordonet bär ansvaret, följsamhet till körbar yta, tid till en möjlig kollision, rörelsekomfort och fordonets framåtdrift längs rutten. 2
Siffran 90,59 är därmed inte ett rent mått på bildigenkänning. Den avser kvaliteten på körplaneringen inom just detta benchmark. Samtidigt är det fortfarande en utvärdering i simulerad miljö, inte en oberoende bekräftelse av säkerhet eller prestanda i verklig trafik.
Arbetet tillskrivs BYD:s Automotive New Technology Research Institute och är en offentlig signal om bolagets investering i egen forskning om grundmodeller för självkörning. 1 Uppgifter om kopplingar till robotikkompetens vid Harbin Institute of Technology är intressanta, men det tillgängliga primärmaterialet räcker inte för att slå fast varje forskares akademiska bakgrund.
5
Jämfört med konkurrenter som NIO, XPeng och Li Auto ger HyWorldVLA BYD ett offentligt och mätbart forskningsresultat inom VLA och världsmodellering. Det visar forskningskapacitet – inte att BYD redan har ett bevisat försprång i självkörning på riktiga vägar.
BYD:s stora fordonsvolymer kan bli en fördel endast om företaget förmår omvandla forskningsresultatet till en säker, validerad och effektivt driftsatt produkt. Det verkligt avgörande testet är därför inte nästa benchmarkpoäng, utan om modellen kan gå från simulering till tillförlitlig funktion i vägtrafik.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
BYD:s HyWorldVLA nådde 90,59 PDMS i NAVSIM v1 genom att kombinera pixelbaserad övervakning med prediktion i ett komprimerat latent space.
BYD:s HyWorldVLA nådde 90,59 PDMS i NAVSIM v1 genom att kombinera pixelbaserad övervakning med prediktion i ett komprimerat latent space. Metoden tränas i tre steg: en språkvägledd video VAE, hybrid förträning med både pixel och latentprediktion samt samoptimering med en expert för köråtgärder och trajektorier.
När pixelprediktionen togs bort föll PDMS från 90,59 till 87,50. Utan behandling i latent space sjönk resultatet till 89,91, vilket pekar på att delarna fyller olika funktioner.