HyWorldVLA firmy BYD uzyskał 90,59 PDMS w benchmarku NAVSIM v1, łącząc nadzór na poziomie pikseli z przewidywaniem w skompresowanej przestrzeni ukrytej. Proces obejmuje trzy etapy: trening video VAE, hybrydowy pretrening modelu świata oraz wspólne dostrajanie z modułem generującym trajektorie.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD zaprezentowało HyWorldVLA, model typu Vision-Language-Action (VLA) dla autonomicznej jazdy, wykorzystujący hybrydowy „model świata”. Jego założenie jest proste, choć technicznie wymagające: system ma jednocześnie korzystać z dwóch opisów sytuacji drogowej — szczegółowego obrazu na poziomie pikseli oraz skompresowanej reprezentacji w tzw. przestrzeni ukrytej (latent space). 1
Pierwszy opis pomaga nie gubić detali sceny. Drugi pozwala przewidywać rozwój sytuacji i planować tor jazdy przy niższym koszcie obliczeniowym. Zamiast wybierać wyłącznie jedną z tych dróg, BYD wykorzystuje obie, ale na różnych etapach pracy modelu.
Przewidywanie przyszłych klatek wideo piksel po pikselu może zachować bardzo dużo szczegółów: układ jezdni, obiekty, ich położenie i kontekst wizualny. Jest jednak kosztowne obliczeniowo. Z kolei model działający w przestrzeni ukrytej operuje na zwartej, skompresowanej wersji danych. To jest praktyczniejsze przy działaniu systemu, ale niesie ryzyko utraty informacji ważnych dla prowadzenia pojazdu. 1
HyWorldVLA ma połączyć mocne strony obu podejść. Podczas treningu nadzór pikselowy pilnuje, by reprezentacja ukryta pozostawała powiązana z faktyczną sceną wizualną. Podczas działania system przewiduje już wyłącznie cechy ukryte, a następnie przekazuje je do wyspecjalizowanego modułu generującego trajektorie. 1
7
Inaczej mówiąc: kosztowne uczenie na pełnym obrazie ma poprawić jakość reprezentacji, lecz nie musi obciążać systemu w takim samym stopniu w trakcie bieżącego planowania jazdy.
Najpierw model video VAE (variational autoencoder) kompresuje sekwencje nagrań z jazdy do cech w przestrzeni ukrytej. W procesie uczenia język służy jako kontekst semantyczny. 2
5
Celem nie jest sama redukcja rozmiaru danych wideo. Skompresowana reprezentacja powinna zachować informacje przydatne do przewidywania przyszłych sytuacji i podejmowania decyzji podczas jazdy.
W kolejnym kroku obrazy, działania, dane językowe i cechy ukryte są zamieniane na wspólny zestaw dyskretnych tokenów. Model uczy się autoregresyjnie przewidywać kolejne tokeny: prognozuje przyszłe reprezentacje wideo, a równocześnie odtwarza przyszłe klatki obrazu. 1
2
To właśnie mechanizm podwójnego nadzoru:
Nadzór pikselowy działa tu jak ogranicznik: ma nie dopuścić, aby model ukryty zbyt agresywnie skompresował scenę i pominął szczegóły istotne dla jazdy. 1
7
W ostatniej fazie model świata jest dostrajany razem z eksperckim modułem akcji i trajektorii. Gdy system działa, nie generuje już pełnych klatek pikselowych. Przewiduje cechy ukryte, które trafiają do modułu akcji tworzącego trajektorię jazdy. 1
Ten podział ma znaczenie dla wydajności. Szczegółowy nadzór pikselowy pomaga wykształcić reprezentację na etapie treningu, natomiast w działaniu wykorzystywany jest lżejszy mechanizm predykcji w przestrzeni ukrytej.
W benchmarku NAVSIM v1 HyWorldVLA uzyskał 90,59 PDMS. Publikacja oraz towarzyszące jej relacje opisują ten rezultat jako najlepszy wśród publicznie dostępnych wyników w tamtym czasie. 1
7
Testy ablation, czyli eksperymenty polegające na usuwaniu części systemu, wskazują, że hybryda nie jest tylko dodatkiem kolejnych funkcji:
Wyniki są zgodne z hipotezą autorów: nadzór pikselowy i predykcja w przestrzeni ukrytej rozwiązują różne części tego samego problemu. Pierwszy chroni wierność wobec obrazu sceny, druga zapewnia bardziej ekonomiczną reprezentację do prognozowania działań.
W pracy sprawdzono dwie wagi: λ1 dla straty predykcji tokenów wideo oraz λ2 dla spójności reprezentacji ukrytej. 20
Przy stałym λ2 równym 0,1 zwiększenie λ1 z 0,1 do 0,5 podniosło PDMS z 90,48 do 90,59. Gdy λ1 zwiększono do 1,0, rezultat spadł do 89,83. 20
Przy λ1 ustawionym na 0,5 zwiększenie λ2 powyżej 0,1 również pogorszyło wynik: dla 0,2 PDMS wyniósł 90,47, a dalsze podnoszenie wagi utrzymało trend spadkowy. 20
Wniosek nie brzmi więc: „im więcej nadzoru, tym lepiej”. Model potrzebuje wystarczającego ograniczenia pikselowego i ukrytego, aby zachować użyteczne informacje, ale zbyt silne wymuszenia mogą nadmiernie usztywnić reprezentację.
PDMS to złożony wskaźnik jakości jazdy w środowisku NAVSIM. Uwzględnia m.in. unikanie kolizji zawinionych przez pojazd autonomiczny, zgodność z obszarem przejezdnym, czas do potencjalnej kolizji, komfort ruchu oraz postęp pojazdu na trasie. 2
Wynik 90,59 nie jest zatem miarą samego rozpoznawania obrazu. Opisuje jakość planowania jazdy w warunkach konkretnego benchmarku. Nadal jest to jednak ocena w środowisku symulacyjnym, a nie niezależne potwierdzenie bezpieczeństwa lub skuteczności systemu w normalnym ruchu drogowym.
Autorzy pracy są związani z Automotive New Technology Research Institute firmy BYD. Publikacja jest więc publicznym sygnałem inwestycji spółki we własne badania nad modelami bazowymi dla autonomicznej jazdy. 1
Doniesienia o powiązaniach zespołu z kompetencjami robotycznymi Harbin Institute of Technology są interesujące, ale dostępne materiały źródłowe nie wystarczają, by wiarygodnie potwierdzić akademickie życiorysy wszystkich badaczy. 5
W rywalizacji z firmami takimi jak NIO, XPeng i Li Auto HyWorldVLA daje BYD publiczny, mierzalny wynik badawczy w obszarze modeli VLA i modelowania świata. To dowód kompetencji badawczych, lecz nie dowód, że BYD ma już przewagę w autonomicznej jeździe w realnym ruchu.
Skala działalności BYD mogłaby stać się atutem tylko wtedy, gdy firma przełoży rezultat badawczy na bezpieczny, zwalidowany i efektywnie wdrożony produkt. Najważniejszym sprawdzianem nie będzie kolejny wynik w benchmarku, ale wiarygodne przejście od modelu i symulacji do działania na drodze.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
HyWorldVLA firmy BYD uzyskał 90,59 PDMS w benchmarku NAVSIM v1, łącząc nadzór na poziomie pikseli z przewidywaniem w skompresowanej przestrzeni ukrytej.
HyWorldVLA firmy BYD uzyskał 90,59 PDMS w benchmarku NAVSIM v1, łącząc nadzór na poziomie pikseli z przewidywaniem w skompresowanej przestrzeni ukrytej. Proces obejmuje trzy etapy: trening video VAE, hybrydowy pretrening modelu świata oraz wspólne dostrajanie z modułem generującym trajektorie.
Usunięcie predykcji pikselowej obniżyło wynik do 87,50 PDMS, a usunięcie przetwarzania w przestrzeni ukrytej — do 89,91, co wskazuje na uzupełniającą rolę obu elementów.