HyWorldVLA BYD mencatat 90.59 PDMS pada NAVSIM v1 dengan menggabungkan penyeliaan aras piksel dan ramalan dalam ruang laten termampat. Latihan berlaku dalam tiga fasa: video VAE berpandukan bahasa, pralatihan hibrid piksel laten, kemudian penalaan bersama pakar tindakan untuk menghasilkan trajektori.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD memperkenalkan HyWorldVLA sebagai model Vision-Language-Action (VLA) untuk pemanduan autonomi yang menggunakan pendekatan “model dunia” hibrid. Ringkasnya, ia belajar daripada dua gambaran jalan raya: butiran visual pada aras piksel dan representasi termampat dalam ruang laten (latent space). 1
Gabungan ini cuba menyelesaikan pertukaran yang biasa berlaku dalam AI pemanduan: model berasaskan piksel boleh mengekalkan butiran adegan yang sangat halus, tetapi memerlukan pengiraan besar. Model ruang laten pula bekerja dengan versi maklumat yang telah dimampatkan, menjadikannya lebih cekap, namun berisiko terlepas butiran penting untuk keputusan memandu. 1
HyWorldVLA tidak memilih salah satu pendekatan secara mutlak. Ketika latihan, ia menggunakan penyeliaan piksel supaya representasi laten kekal berasaskan keadaan visual sebenar. Namun ketika sistem digunakan untuk inferens, ia hanya meramal ciri laten dan menyerahkannya kepada pakar tindakan (action expert) untuk membina trajektori pemanduan. 1
7
Jadi, kos penghasilan bingkai video penuh pada aras piksel digunakan untuk membentuk model semasa latihan, bukan dibawa sepenuhnya ke operasi masa nyata. Itu ialah asas tuntutan kecekapannya.
Pada fasa pertama, sebuah video variational autoencoder (VAE) memampatkan urutan video pemanduan kepada ciri laten. Bahasa digunakan sebagai konteks semantik ketika melatih pemampat ini. 2
5
Matlamatnya bukan sekadar mengecilkan data video. Ruang laten perlu menyimpan maklumat yang berguna untuk meramal apa yang bakal berlaku dan, akhirnya, untuk membuat keputusan pemanduan.
Seterusnya, imej, tindakan, unsur bahasa dan ciri laten ditukar kepada token diskret dalam satu urutan untuk ramalan autoregresif. Pada peringkat ini, model meramal laten video masa depan sambil membina semula bingkai masa depan. 1
2
Di sinilah berlakunya penyeliaan berganda:
Dalam bahasa mudah, kehilangan (loss) pada aras piksel bertindak sebagai pagar kawalan: ia menghalang ruang laten daripada menjadi terlalu ringkas sehingga mengabaikan maklumat penting dalam adegan. 1
7
Dalam fasa terakhir, model dunia ditala bersama model khusus untuk tindakan atau trajektori. Ketika inferens, sistem meramal ciri laten—bukan bingkai piksel penuh—dan ciri itu digunakan oleh pakar tindakan untuk menghasilkan trajektori pemanduan. 1
Pemisahan ini penting: butiran piksel membantu melatih representasi yang baik, manakala penggunaan laten ketika operasi mengurangkan beban pengiraan.
Dalam NAVSIM v1, HyWorldVLA melaporkan skor 90.59 PDMS, yang digambarkan oleh penerbitan dan laporan berkaitan sebagai keputusan teratas dalam kalangan hasil awam pada waktu itu. 1
7
Ujian ablation—iaitu mengeluarkan komponen tertentu untuk mengukur kesannya—menunjukkan reka bentuk hibrid ini bukan sekadar gabungan ciri:
Dapatan ini menyokong hujah penyelidik bahawa dua jenis isyarat tersebut menjalankan peranan berlainan: piksel mengekalkan kesetiaan kepada adegan, sementara laten menyediakan representasi yang lebih ekonomik untuk meramal tindakan.
Kertas itu menguji dua pemberat: λ1 untuk kehilangan ramalan token video dan λ2 untuk konsistensi representasi laten. 20
Dengan λ2 dikekalkan pada 0.1, menaikkan λ1 daripada 0.1 kepada 0.5 meningkatkan PDMS daripada 90.48 kepada 90.59. Tetapi apabila λ1 dinaikkan kepada 1.0, skornya merosot kepada 89.83. 20
Apabila λ1 ditetapkan pada 0.5, peningkatan λ2 melebihi 0.1 pula mengurangkan prestasi: pada 0.2, PDMS ialah 90.47, dan skor terus menurun pada nilai lebih tinggi. 20
Maksudnya, lebih banyak kekangan bukan semestinya lebih baik. Model memerlukan penyeliaan piksel dan laten yang mencukupi untuk menyimpan maklumat berguna, tetapi terlalu banyak kekangan boleh menjadikan representasi terlalu kaku.
PDMS ialah metrik gabungan kualiti pemanduan dalam NAVSIM, sebuah penanda aras simulasi pemanduan autonomi. Ia merangkumi perkara seperti pengelakan pelanggaran yang berpunca daripada kenderaan sendiri, pematuhan kepada kawasan boleh dipandu, masa ke pelanggaran berpotensi, keselesaan pergerakan dan kemajuan kenderaan di sepanjang laluan. 2
Oleh itu, 90.59 bukan sekadar skor pengecaman imej. Ia mengukur kualiti perancangan pemanduan dalam penanda aras itu. Namun, ia masih penilaian dalam persekitaran simulasi dan bukan pengesahan bebas terhadap keselamatan atau prestasi dalam trafik dunia sebenar.
Karya ini dikaitkan dengan Automotive New Technology Research Institute milik BYD, sekali gus menjadi petunjuk terbuka bahawa syarikat itu melabur dalam penyelidikan dalaman model asas untuk pemanduan autonomi. 1
Laporan yang mengaitkan pasukan tersebut dengan kepakaran robotik daripada Harbin Institute of Technology menarik perhatian, tetapi bukti primer yang tersedia tidak mencukupi untuk mengesahkan latar akademik setiap penyelidik. 5
Berbanding pesaing seperti NIO, XPeng dan Li Auto, HyWorldVLA memberi BYD satu hasil penyelidikan VLA dan pemodelan dunia yang boleh diukur secara terbuka. Ini menunjukkan keupayaan penyelidikan, bukannya bukti bahawa BYD sudah mendahului dalam pemanduan autonomi di jalan raya.
Kekuatan skala pengeluaran kenderaan BYD hanya akan menjadi kelebihan jika syarikat itu dapat menterjemahkan hasil penyelidikan ini kepada produk yang selamat, disahkan dan boleh digunakan secara cekap. Ujian sebenar seterusnya bukan sekadar skor penanda aras yang lebih tinggi, tetapi peralihan yang boleh dipercayai daripada model simulasi ke operasi di jalan raya.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
HyWorldVLA BYD mencatat 90.59 PDMS pada NAVSIM v1 dengan menggabungkan penyeliaan aras piksel dan ramalan dalam ruang laten termampat.
HyWorldVLA BYD mencatat 90.59 PDMS pada NAVSIM v1 dengan menggabungkan penyeliaan aras piksel dan ramalan dalam ruang laten termampat. Latihan berlaku dalam tiga fasa: video VAE berpandukan bahasa, pralatihan hibrid piksel laten, kemudian penalaan bersama pakar tindakan untuk menghasilkan trajektori.
Apabila ramalan piksel dibuang, PDMS jatuh kepada 87.50; apabila pemprosesan ruang laten dibuang, skornya menjadi 89.91.