BYD:n HyWorldVLA sai NAVSIM v1 vertailussa 90,59 PDMS pistettä yhdistämällä pikselitason valvonnan ja pakatun latenttitilan ennustamisen. Koulutus etenee videota pakkaavasta VAE mallista hybridiesikoulutukseen ja lopuksi ajolinjoja tuottavan toimintamoduulin yhteishienosäätöön.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD on esitellyt HyWorldVLA:n, autonomiseen ajamiseen tarkoitetun Vision-Language-Action (VLA) -mallin. Sen keskeinen ajatus on yhdistää kaksi erilaista tapaa mallintaa ympäristöä: pikselitaso, joka säilyttää näkymän yksityiskohdat, ja latenttitila, eli videosta tiivistetty sisäinen esitys, jossa tulevaa voidaan ennustaa kevyemmin. 1
Ratkaisu on käytännössä kompromissi tarkkuuden ja laskentatehon välillä. Mallia opetetaan näkemään tieympäristö tarkasti pikselitasolla, mutta ajon aikana sen ei tarvitse muodostaa kokonaisia tulevia videoruutuja. Sen sijaan se ennustaa tiivistettyjä latenttisia piirteitä, joiden pohjalta erillinen toimintamoduuli tuottaa ajolinjoja. 1
7
Tulevien videoruutujen ennustaminen pikseli pikseliltä voi säilyttää esimerkiksi muiden tienkäyttäjien, kaistojen ja tien reuna-alueiden yksityiskohtia. Se on kuitenkin laskennallisesti raskasta. Latenttitilassa malli käsittelee videon pakattua esitystä, mikä on tehokkaampaa, mutta pakkaus voi samalla kadottaa ajamisen kannalta olennaista tietoa. 1
HyWorldVLA:n ratkaisu on käyttää molempia, mutta eri vaiheissa:
Pikselitason tavoite toimii siis ikään kuin laadunvarmistuksena: latenttitilaa ei saa tiivistää niin aggressiivisesti, että olennaiset ympäristön yksityiskohdat häviävät.
Ensimmäisessä vaiheessa video-VAE eli variational autoencoder tiivistää ajovideon sarjan latenttisiksi piirteiksi. Kieltä käytetään semanttisena tukena, kun videon pakkaajaa opetetaan. 2
5
Tavoitteena ei ole vain tehdä videosta pienempi esitys. Latenttitilaan pitää jäädä sellaista tietoa, joka auttaa ennustamaan tulevia tilanteita ja tekemään myöhemmin ajosuunnitelman.
Seuraavaksi kuvat, ajotoiminnot, kielisyötteet ja latentit muunnetaan yhteiseen diskreettien tokenien muotoon. Malli oppii ennustamaan tokenien jatkoa autoregressiivisesti. Samalla se ennustaa tulevia videolatentteja ja rekonstruoi tulevia videoruutuja. 1
2
Kyse on kaksoisvalvonnasta:
Pelkkä yksityiskohtainen kuva ei vielä ole tehokas ajosuunnitelma, mutta pelkkä pakattu esitys voi olla liian karkea. HyWorldVLA pyrkii säilyttämään molempien vahvuudet.
Viimeisessä vaiheessa maailmanmallia hienosäädetään yhdessä toimintamoduulin kanssa. Käytön aikana järjestelmä ei muodosta kokonaisia pikselitason videoruutuja, vaan ennustaa latentteja piirteitä. Toimintamoduuli hyödyntää niitä ajolinjojen tuottamiseen. 1
Tämä erotus on mallin tehokkuusväitteen ytimessä: kallista pikselitason valvontaa hyödynnetään oppimisessa, mutta samaa laskentakuormaa ei siirretä suoraan reaaliaikaiseen päättelyyn.
HyWorldVLA saavutti NAVSIM v1 -vertailussa 90,59 PDMS-pistettä, mikä kuvattiin julkisten tulosten kärkitasoksi tuolloin. 1
7
Komponentteja poistavissa ablaatiokokeissa tulos heikkeni selvästi:
Tulokset tukevat tutkijoiden tulkintaa siitä, että pikseli- ja latenttitason tavoitteet eivät ole päällekkäisiä. Pikselitaso auttaa säilyttämään näkymän tarkkuutta, kun taas latenttitila tarjoaa kevyemmän esityksen ajon ennakointiin ja suunnitteluun.
Tutkimuksessa säädettiin kahta painoa: λ1 ohjaa videotokenien ennustuksen häviötä ja λ2 latenttiesityksen johdonmukaisuuden häviötä. 20
Kun λ2 pidettiin arvossa 0,1, λ1:n nostaminen 0,1:stä 0,5:een paransi PDMS-tulosta 90,48:sta 90,59:ään. Kun λ1 nostettiin arvoon 1,0, tulos heikkeni 89,83:een. 20
Kun λ1 pidettiin arvossa 0,5, λ2:n nostaminen 0,1:n yli heikensi tulosta: arvolla 0,2 PDMS oli 90,47, ja suuremmilla arvoilla lasku jatkui. 20
Johtopäätös ei ole, että lisävalvonta olisi aina hyödyksi. Malli tarvitsee riittävästi pikseli- ja latenttitason rajoitteita säilyttääkseen ajamisen kannalta hyödyllisen tiedon, mutta liian vahvat rajoitteet voivat tehdä esityksestä liian jäykän.
PDMS on NAVSIM-ajovirtuaaliympäristön yhdistelmäpistemäärä. Se arvioi muun muassa sitä, välttääkö egoajoneuvo sille vastuulliset törmäykset, pysyykö se ajokelpoisella alueella, millaiset turvamarginaalit sillä on mahdolliseen törmäykseen, kuinka mukavaa sen liike on ja eteneekö se reitillään. 2
Siksi 90,59 ei ole kuvanluokitustulos, vaan mittari ajosuunnittelun laadusta kyseisessä vertailuympäristössä. Se ei silti ole riippumaton osoitus turvallisuudesta tai suorituskyvystä todellisessa liikenteessä.
Tutkimus on liitetty BYD:n Automotive New Technology Research Instituteen, ja se on julkinen osoitus yhtiön sisäisestä perustamallien tutkimuksesta autonomiseen ajoon. 1 Raportit tiimin yhteyksistä Harbin Institute of Technologyn robotiikkaosaamiseen ovat kiinnostavia, mutta saatavilla oleva ensisijainen aineisto ei riitä vahvistamaan jokaisen tutkijan akateemista taustaa.
5
NIO:n, XPengin ja Li Auton kaltaisiin kilpailijoihin verrattuna HyWorldVLA antaa BYD:lle julkisen, mitattavan tutkimusnäytön VLA- ja maailmanmallityöstä. Se kertoo tutkimuskyvykkyydestä, ei vielä todistetusta johtoasemasta tosielämän autonomisessa ajossa.
BYD:n suuri ajoneuvokanta voisi muuttua eduksi vain, jos tutkimustulos saadaan muutettua turvalliseksi, validoiduksi ja tehokkaasti käyttöönotettavaksi tuotteeksi. Seuraava olennainen testi ei ole uusi vertailupistemäärä, vaan luotettava siirtymä simulaatiosta todelliseen liikenteeseen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
BYD:n HyWorldVLA sai NAVSIM v1 vertailussa 90,59 PDMS pistettä yhdistämällä pikselitason valvonnan ja pakatun latenttitilan ennustamisen.
BYD:n HyWorldVLA sai NAVSIM v1 vertailussa 90,59 PDMS pistettä yhdistämällä pikselitason valvonnan ja pakatun latenttitilan ennustamisen. Koulutus etenee videota pakkaavasta VAE mallista hybridiesikoulutukseen ja lopuksi ajolinjoja tuottavan toimintamoduulin yhteishienosäätöön.
Kun pikselitason ennustus poistettiin, PDMS laski 90,59:stä 87,50:een. Kun latenttitilan käsittely poistettiin, tulos laski 89,91:een.