HyWorldVLA behaalde 90,59 PDMS op NAVSIM v1 door pixel level supervision te combineren met voorspellingen in een gecomprimeerde latent space. BYD traint eerst een video VAE, voert daarna hybride pre training uit en optimaliseert het wereldmodel vervolgens samen met een action expert die trajecten genereert.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD heeft HyWorldVLA gepresenteerd: een Vision-Language-Action-model (VLA) voor autonoom rijden met een hybride wereldmodel. Het systeem probeert een lastig compromis op te lossen: een auto moet de verkeerssituatie gedetailleerd begrijpen, maar kan tijdens het rijden niet voortdurend volledige toekomstige videobeelden op pixelniveau berekenen. 1
De oplossing van BYD is een taakverdeling. Tijdens de training leert het model zowel van gedetailleerde pixels als van compacte, interne representaties — de zogeheten latent space. Tijdens gebruik voorspelt het uitsluitend die compactere kenmerken en geeft ze door aan een gespecialiseerd actiemodel dat rijtrajecten produceert. 1
Een wereldmodel op pixelniveau voorspelt hoe toekomstige camerabeelden eruit kunnen zien. Dat behoudt veel details van de weg, andere weggebruikers en de omgeving, maar kost veel rekenkracht. Een model dat in latent space werkt, redeneert juist met een samengeperste weergave van dezelfde situatie. Dat is efficiënter, maar kan informatie verliezen die voor het rijden relevant is. 1
HyWorldVLA kiest niet volledig voor één van beide routes. Pixel-level supervision dwingt de compacte representatie tijdens de training om voldoende visuele informatie te behouden. Bij de online voorspelling gebruikt het systeem vervolgens alleen de efficiëntere latent features voor de trajectplanning. 1
7
Eerst traint BYD een video variational autoencoder, of video-VAE. Die zet reeksen rijvideo’s om in compacte latent features. Taal wordt hierbij als semantische context gebruikt: de tekstuele informatie moet de compressor helpen om relevante structuren in de scène vast te houden. 2
5
Het doel is dus niet alleen videodata zo klein mogelijk opslaan. De gecomprimeerde representatie moet ook bruikbaar blijven om toekomstige verkeerssituaties en rijacties te voorspellen.
In de tweede stap worden beelden, acties, taal en latent features samengebracht als discrete tokens. Het model leert vervolgens autoregressief voorspellen welke tokens volgen. Daarbij voorspelt het zowel toekomstige video-latents als toekomstige videoframes. 1
2
Dit is de kern van de dubbele supervisie:
De pixelverliesfunctie werkt daarmee als een begrenzing: zij moet voorkomen dat de latent space de verkeersscène te agressief samendrukt en cruciale details verliest. 1
7
In de laatste fase optimaliseert BYD het wereldmodel samen met een gespecialiseerde module voor acties en trajecten. Tijdens de uitvoering voorspelt HyWorldVLA geen volledige frames op pixelniveau meer. Het model levert latent features aan de action expert, die daaruit een rijtraject afleidt. 1
Dat onderscheid is belangrijk voor de praktische inzetbaarheid. De dure pixel-level supervision vormt de representatie tijdens het leerproces, zonder dezelfde rekenlast op te leggen aan de voorspelling terwijl de auto rijdt.
Op de openbare NAVSIM v1-benchmark rapporteerde HyWorldVLA een score van 90,59 PDMS. Het paper en berichtgeving over het onderzoek omschrijven dat als het leidende publieke resultaat op dat moment. 1
7
De ablaties — experimenten waarin afzonderlijke onderdelen worden weggelaten — suggereren dat het hybride ontwerp meer is dan een losse combinatie van technieken:
Dat ondersteunt de hypothese van de onderzoekers dat pixels en latent representations verschillende functies vervullen: pixels bewaken de visuele nauwkeurigheid, terwijl latent-spacevoorspelling een efficiënter signaal levert voor de rijplanning.
Het paper onderzoekt ook twee gewichten in de trainingsdoelfunctie: λ1 voor het voorspellen van videotokens en λ2 voor de consistentie van de latente representatie. 20
Met λ2 vastgezet op 0,1 steeg de PDMS-score bij een verhoging van λ1 van 0,1 naar 0,5 van 90,48 naar 90,59. Bij λ1 = 1,0 zakte de score vervolgens naar 89,83. 20
Ook meer latent supervision is niet automatisch beter. Met λ1 op 0,5 daalde de score bij een verhoging van λ2 van 0,1 naar 0,2 van 90,59 naar 90,47; bij verdere verhogingen zette die daling door. 20
De les is dat het model voldoende visuele en latente beperkingen nodig heeft om bruikbare informatie te behouden, maar dat een te zwaar aangezette supervisie de representatie juist te star kan maken.
PDMS is een samengestelde maat voor rijkwaliteit binnen NAVSIM, een simulatiebenchmark voor autonoom rijden. De score omvat onder meer het vermijden van botsingen waarvoor het eigen voertuig verantwoordelijk is, naleving van de berijdbare zone, tijd tot een mogelijke botsing, rijcomfort en voortgang op de route. 2
Een score van 90,59 is dus niet simpelweg een maat voor beeldherkenning. Hij zegt iets over de kwaliteit van de geplande rijhandeling binnen deze specifieke benchmark. Tegelijk is NAVSIM een gesimuleerde evaluatie: de score is geen onafhankelijke bevestiging van veiligheid of prestaties in het echte verkeer.
De auteurs zijn verbonden aan BYD’s Automotive New Technology Research Institute. De publicatie is daarmee een zichtbaar teken dat de autofabrikant investeert in eigen onderzoek naar foundation models voor autonoom rijden. 1
Berichten leggen een verband met robotica-expertise van het Harbin Institute of Technology. Dat is interessant als achtergrond, maar de beschikbare primaire informatie is niet voldoende om het academische verleden van iedere onderzoeker vast te stellen. 5
Vergeleken met Chinese EV-concurrenten als NIO, XPeng en Li Auto geeft HyWorldVLA BYD in elk geval een publiek meetbaar onderzoeksresultaat op het terrein van VLA’s en wereldmodellen. Dat toont onderzoeksvermogen, niet dat BYD al een aantoonbare voorsprong heeft in autonoom rijden op de openbare weg.
De schaal waarop BYD voertuigen ontwikkelt en produceert kan pas een voordeel worden als het bedrijf dit onderzoeksresultaat omzet in een veilig gevalideerd en efficiënt uitgerold product. De volgende echte test is daarom niet alleen een betere benchmarkscore, maar de betrouwbare stap van simulatie naar verkeerssituaties in de praktijk.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
HyWorldVLA behaalde 90,59 PDMS op NAVSIM v1 door pixel level supervision te combineren met voorspellingen in een gecomprimeerde latent space.
HyWorldVLA behaalde 90,59 PDMS op NAVSIM v1 door pixel level supervision te combineren met voorspellingen in een gecomprimeerde latent space. BYD traint eerst een video VAE, voert daarna hybride pre training uit en optimaliseert het wereldmodel vervolgens samen met een action expert die trajecten genereert.
Zonder pixelvoorspelling daalde de PDMS score naar 87,50; zonder latent spaceverwerking naar 89,91.