HyWorldVLA dosáhl v benchmarku NAVSIM v1 skóre 90,59 PDMS díky kombinaci pixelového dohledu a predikce v latentním prostoru. Trénink má tři kroky: jazykově vedený video VAE, hybridní předtrénování a společné dolaďování s expertem pro akce, který vytváří jízdní trajektorie.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD představilo HyWorldVLA, model typu Vision-Language-Action (VLA) pro autonomní řízení s hybridním „modelem světa“. Jeho hlavní myšlenka je jednoduchá: systém se při učení opírá jak o velmi podrobný obraz silnice na úrovni pixelů, tak o komprimovanou reprezentaci v takzvaném latentním prostoru. Při samotném vyhodnocování pak používá pouze úspornější latentní reprezentaci a z ní vytváří trajektorii jízdy. 1
Predikovat budoucí obrazové snímky pixel po pixelu znamená zachovat mimořádné množství detailů. To je důležité pro pevné ukotvení modelu ve vizuální scéně, ale výpočetně náročné. Latentní prostor naopak obraz komprimuje do abstraktnějších příznaků: model v něm může pracovat efektivněji, může však ztratit podstatné informace pro řízení. 1
HyWorldVLA se nesnaží vybrat jednu z těchto cest. Pixelový dohled využívá při tréninku jako pojistku, aby se latentní reprezentace příliš nezjednodušila. V provozní fázi už model predikuje jen latentní příznaky, které předává specializovanému modulu pro akce a plánování trajektorie. 1
7
Nejprve se video variational autoencoder neboli video VAE učí komprimovat sekvence záznamů z jízdy do latentních příznaků. Textové informace zde slouží jako sémantický kontext pro učení kompresoru. 2
5
Cílem není jen zmenšit objem videa. Latentní reprezentace musí uchovat to, co bude později užitečné pro předvídání vývoje situace a pro volbu jízdy.
Ve druhé fázi model převádí obraz, akce, jazykové vstupy i latentní příznaky do společné posloupnosti diskrétních tokenů. Autoregresivně pak předpovídá další tokeny: současně budoucí video latentní reprezentace i budoucí obrazové snímky. 1
2
Tím vzniká dvojí dohled:
Pixelová ztrátová funkce zde funguje jako omezení: brání tomu, aby latentní model scénu přehnaně zkomprimoval a ztratil relevantní detaily. 1
7
Nakonec BYD dolaďuje model světa společně se specializovaným modulem pro akce a trajektorie. Při inferenci systém negeneruje celé budoucí snímky v pixelech. Místo toho předpoví latentní příznaky, z nichž action expert vytvoří trajektorii vozidla. 1
Právě toto rozdělení má přinést praktickou výhodu: nákladný pixelový dohled formuje reprezentaci během tréninku, ale nezatěžuje systém stejnou měrou při provozu.
V benchmarku NAVSIM v1 HyWorldVLA dosáhl skóre 90,59 PDMS, které autoři a související zprávy označují za tehdy vedoucí veřejně publikovaný výsledek. 1
7
Ablační testy, tedy experimenty, v nichž se jednotlivé části modelu odebírají, naznačují, že hybridní přístup není jen nadbytečné vrstvení funkcí:
Výsledky podporují závěr, že obě reprezentace řeší jinou část úlohy: pixelový dohled zachovává věrnost scéně, zatímco latentní prostor umožňuje výpočetně úspornější predikci potřebnou pro plánování akcí.
Studie sleduje také dvě váhy ztrátových funkcí: λ1 pro predikci video tokenů a λ2 pro konzistenci latentní reprezentace. 20
Při pevně nastaveném λ2 = 0,1 zvýšení λ1 z 0,1 na 0,5 zlepšilo PDMS z 90,48 na 90,59. Při dalším zvýšení λ1 na 1,0 však skóre spadlo na 89,83. 20
Při λ1 = 0,5 zvýšení λ2 nad 0,1 výkon zhoršovalo: při λ2 = 0,2 činilo PDMS 90,47 a při vyšších hodnotách dál klesalo. 20 Závěr tedy není, že více dohledu automaticky znamená lepší model. Omezení musí být dostatečné k zachování užitečné informace, ale nesmí reprezentaci příliš svazovat.
PDMS je složený ukazatel kvality řízení v simulovaném benchmarku NAVSIM. Zahrnuje mimo jiné prevenci kolizí zaviněných vlastním vozidlem, dodržení sjízdné oblasti, čas do možné srážky, komfort pohybu a postup vozidla po trase. 2
Skóre 90,59 proto není metrika rozpoznávání obrazu. Vypovídá o výkonu plánování jízdy v podmínkách daného benchmarku. Zároveň však jde stále o simulované hodnocení, nikoli o nezávislé potvrzení bezpečnosti nebo spolehlivosti v běžném silničním provozu.
Práce je spojena s Automotive New Technology Research Institute společnosti BYD a představuje veřejně viditelný krok firmy k vlastnímu výzkumu základních modelů pro autonomní řízení. 1 Zprávy hovoří také o vazbách týmu na robotické know-how Harbin Institute of Technology, dostupné primární podklady ale samy o sobě nedokládají akademické zázemí každého jednotlivého výzkumníka.
5
Vedle výrobců, jako jsou NIO, XPeng a Li Auto, dává HyWorldVLA BYD veřejně měřitelný výzkumný výsledek v oblasti VLA modelů a modelování světa. Ukazuje schopnost interního výzkumu, nikoli prokázaný náskok v reálné autonomní jízdě.
Rozsah výroby vozidel BYD by se mohl stát výhodou jen tehdy, pokud firma dokáže výsledek výzkumu převést do bezpečného, ověřeného a efektivně nasaditelného produktu. Rozhodující test proto nebude další benchmark, ale spolehlivý přechod od simulace k provozu na skutečných silnicích.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
HyWorldVLA dosáhl v benchmarku NAVSIM v1 skóre 90,59 PDMS díky kombinaci pixelového dohledu a predikce v latentním prostoru.
HyWorldVLA dosáhl v benchmarku NAVSIM v1 skóre 90,59 PDMS díky kombinaci pixelového dohledu a predikce v latentním prostoru. Trénink má tři kroky: jazykově vedený video VAE, hybridní předtrénování a společné dolaďování s expertem pro akce, který vytváří jízdní trajektorie.
Po odstranění predikce na úrovni pixelů skóre kleslo na 87,50; bez zpracování latentního prostoru na 89,91.