HyWorldVLA 在 NAVSIM v1 公開基準取得 90.59 PDMS,核心是將像素級監督與壓縮的潛在空間預測結合。[1] 訓練流程分三步:語言引導的影片 VAE、像素與潛在特徵的混合預訓練,以及與軌跡生成 action expert 的共同微調。[1][2] 移除像素級預測後,PDMS 由 90.59 降至 87.50;移除潛在空間處理則降至 89.91,顯示兩條路徑具互補性。[7]
研究答案

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD 發表的 HyWorldVLA,是一套面向自動駕駛的視覺—語言—動作(Vision-Language-Action,VLA)模型。它的關鍵不是在「像素級世界模型」與「潛在空間世界模型」之間二選一,而是把兩者分配到不同階段:訓練時保留像素層級的細節約束,實際推理時則主要在壓縮後的潛在空間運算。目標是在環境細節、行車規劃與運算成本間取得平衡。1
像素級預測可直接推估未來影像畫面,對道路邊界、車輛位置與場景細節的保留較完整;代價是資料量與計算量都很大。相較之下,潛在空間(latent space)把影像壓縮成特徵表示再進行預測,較適合即時推理與路徑規劃,但若壓縮過度,也可能遺失與駕駛決策有關的資訊。1
HyWorldVLA 的作法是讓像素監督在訓練中扮演「校準器」:要求潛在表示仍能對應真實的視覺場景;到了推理階段,系統不再生成完整的像素畫面,而是預測潛在特徵,再交由動作模型產生行駛軌跡。1
7
第一步是訓練影片變分自編碼器(video VAE)。它將連續的駕駛影片壓縮為較緊湊的潛在特徵;文字語言在這個階段提供語意脈絡,協助模型學習哪些場景資訊較有意義。2
5
重點不只是縮小影像資料,而是讓壓縮後的特徵仍保有預測未來交通狀態、支援駕駛規劃所需的內容。
接著,模型把影像、動作、語言與潛在特徵轉換為統一的離散 token,以自回歸方式預測後續 token。在這個階段,它一方面預測未來影片的潛在特徵,另一方面重建未來影格。1
2
這就是所謂的雙重監督:
換句話說,像素損失可防止潛在表示為了壓縮而丟失過多關鍵資訊;但模型也不必在運行時一直承擔高成本的全畫面像素生成。1
7
最後,世界模型會和專門產生動作或行駛軌跡的 action expert 共同優化。系統實際執行時只預測潛在特徵,並將這些特徵輸入 action expert,由後者輸出車輛軌跡。1
這個設計把「高成本的像素級監督」留在訓練期,將「較有效率的潛在空間預測」留給推理期,是 HyWorldVLA 的效率取向核心。
在 NAVSIM v1 基準上,HyWorldVLA 報告的 PDMS 成績為 90.59,論文與相關報導將其描述為當時公開結果中的領先表現。1
7
消融實驗則顯示,混合設計不是單純把兩種模組疊加:
這些結果支持研究團隊的觀點:像素監督較有助於維持場景細節與視覺對應;潛在空間則提供更精煉、適合預測動作的表示。兩者各自處理不同問題。
論文另檢驗兩個損失權重:λ1 用於影片 token 預測,λ2 用於潛在表示的一致性約束。20
在 λ2 固定為 0.1 時,將 λ1 由 0.1 提升至 0.5,PDMS 從 90.48 增至 90.59;但 λ1 提高到 1.0 時,成績反而降至 89.83。20
在 λ1 固定為 0.5 時,λ2 從 0.1 提高至 0.2,PDMS 由 90.59 降至 90.47;再繼續提高,成績仍下滑。20
意思是,監督訊號並非越強越好。模型需要足夠的像素與潛在特徵約束,以免失去重要資訊;但約束過重,也可能讓表徵變得僵化,限制模型找出真正與駕駛規劃相關的模式。
PDMS 是 NAVSIM 自動駕駛模擬基準中的綜合駕駛品質分數,涵蓋自車責任碰撞避免、可行駛區域遵循、潛在碰撞時間、行車舒適性與車輛在路線上的推進等面向。2
因此,90.59 並不是單純的影像辨識分數,而是該模型在這套模擬基準中,對駕駛規劃表現的綜合評估。不過,NAVSIM 仍是模擬環境;這項成果不等於已獲獨立驗證的真實道路安全性,也不能直接證明量產車上的自動駕駛表現領先。
論文作者所屬單位為 BYD 汽車新技術研究院,這是 BYD 對外展現其自研自動駕駛基礎模型研究的一項公開成果。1 有報導提及團隊與哈爾濱工業大學機器人技術背景的連結;但就目前可得的一手資料而言,尚不足以逐一確認每位研究者的學術背景。
5
面對蔚來、XPeng 與理想汽車等同樣投入智慧駕駛的競爭者,HyWorldVLA 至少讓 BYD 展示了一項可量化的 VLA 與世界模型研究成績。這反映其研發能力正在加碼,卻不能據此推論 BYD 已在真實自動駕駛部署上取得決定性優勢。
BYD 的車輛規模未來是否能成為優勢,仍取決於它能否把研究模型轉化為經過安全驗證、可高效率部署的產品。下一個真正關卡,不是再刷新一項模擬榜單,而是能否可靠地從模型與模擬,走到真實道路運行。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
HyWorldVLA 在 NAVSIM v1 公開基準取得 90.59 PDMS,核心是將像素級監督與壓縮的潛在空間預測結合。[1]
HyWorldVLA 在 NAVSIM v1 公開基準取得 90.59 PDMS,核心是將像素級監督與壓縮的潛在空間預測結合。[1] 訓練流程分三步:語言引導的影片 VAE、像素與潛在特徵的混合預訓練,以及與軌跡生成 action expert 的共同微調。[1][2]
移除像素級預測後,PDMS 由 90.59 降至 87.50;移除潛在空間處理則降至 89.91,顯示兩條路徑具互補性。[7]