HyWorldVLA 在 NAVSIM v1 获得 90.59 PDMS,通过像素级监督与压缩隐空间预测结合,平衡场景细节和推理效率。 训练流程分三步:训练语言引导的视频 VAE、联合预训练像素与隐空间预测、再与动作专家协同微调以生成驾驶轨迹。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
比亚迪发布的 HyWorldVLA 是一套面向自动驾驶的**视觉—语言—动作(VLA)**模型,并引入了混合世界模型思路。它不只用一种方式理解道路,而是同时利用两类表征:一类是保留丰富画面细节的像素级预测,另一类是在压缩后的隐空间(latent space)中进行预测与规划。 1
核心取舍很直接:像素级模型能更精细地刻画前方场景,却需要较高算力;隐空间模型在压缩表征中运算,效率更高,但若压缩不当,可能遗漏对驾驶至关重要的信息。HyWorldVLA 的做法是把两者分工:训练时借助像素级监督约束隐空间,实际推理时则只预测隐特征,再交由动作专家生成行驶轨迹。 1
7
让模型直接预测未来画面的每一个像素,能够保留车辆、道路边界和周边环境等细粒度视觉信息,但计算成本较高。反过来,隐空间模型先把视频压缩为更抽象的特征,再在这些特征上预测未来;这样更适合高效运行,却存在丢失驾驶相关细节的风险。 1
HyWorldVLA 并不强迫二选一。它将像素级监督留在训练环节,用来确保压缩后的隐空间仍与真实视觉场景紧密对应;进入推理环节后,系统不再生成完整像素画面,而是仅预测隐特征,并将其输入动作专家来生成轨迹。 1
7
第一步是训练视频变分自编码器(Video VAE)。它将连续的驾驶视频压缩成隐特征;语言信息在训练中充当语义上下文,帮助模型学习哪些内容对理解场景更重要。 2
5
目标并不只是把视频压得更小,而是让隐空间保留可用于预测未来、进而服务驾驶决策的信息。
第二步,模型将图像、动作、语言和隐特征统一为离散 token,并以自回归方式预测后续 token。在这一阶段,HyWorldVLA 一边预测未来的视频隐特征,一边重建未来视频帧。 1
2
这构成了它的双重监督:
可以把像素级损失理解为一道约束:它防止隐空间为了压缩而过度简化场景,丢掉关键的道路环境信息。 1
7
最后,世界模型会与专门负责动作和轨迹的模块共同优化。实际运行时,系统只预测隐特征,而不是生成成本更高的完整像素帧;这些特征随后送入动作专家,输出车辆的行驶轨迹。 1
这种分工是效率的关键:高成本的像素级监督主要用于塑造训练阶段的表征,而在线推理只保留较轻量的隐空间预测路径。
在 NAVSIM v1 公开基准上,HyWorldVLA 报告的 PDMS 为 90.59,论文及相关报道将其描述为当时公开结果中的领先成绩。 1
7
消融实验显示,这并非简单叠加模块带来的效果:
这些结果支持研究团队的判断:像素级监督和隐空间预测分别解决不同问题。前者更有利于维持对场景的细节刻画,后者则提供更适合动作预测的紧凑表征。
论文还测试了两个训练权重:λ1 用于视频 token 预测损失,λ2 用于隐空间表征一致性。 20
在 λ2 固定为 0.1 时,将 λ1 从 0.1 提高到 0.5,PDMS 从 90.48 升至 90.59;继续升至 1.0 后,分数反而降至 89.83。 20
在 λ1 固定为 0.5 时,若将 λ2 从 0.1 提高到 0.2,PDMS 降至 90.47;进一步增大,成绩继续下降。 20
这意味着,监督信号并非越强越好。模型需要足够的像素与隐空间约束来保留有用信息,但约束过强也可能让表征变得过于僵化,限制其学习与驾驶规划相关的特征。
PDMS 是 NAVSIM 中衡量驾驶质量的综合指标,涵盖自车责任碰撞、可行驶区域合规性、碰撞时间裕度、行驶舒适性以及车辆在路线中的推进情况等维度。 2
因此,90.59 并不是单纯的图像识别分数,而是该模型在这一自动驾驶仿真基准中的规划表现。不过,它仍属于模拟环境下的基准评估,不能等同于已经获得独立验证的真实道路安全性或量产表现。
论文作者单位为比亚迪汽车新技术研究院,这项公开工作表明,比亚迪正将自动驾驶研发进一步延伸到内部基础模型与世界模型研究。 1
关于团队与哈尔滨工业大学机器人技术背景的联系,相关报道提供了值得关注的线索;但现有一手材料不足以确认每位研究人员的具体学术背景,因此不宜作过度推断。 5
与蔚来、小鹏、理想等同样投入端到端智能驾驶技术的车企相比,HyWorldVLA 至少为比亚迪提供了一项可公开比较的 VLA 与世界模型研究成果。这能体现其研究能力,但并不意味着它已经在真实道路自动驾驶能力上建立了经过验证的领先优势。
比亚迪庞大的车辆部署规模未来或许能够成为优势,但前提是它能把研究成果转化为安全、经过充分验证且能高效落地的产品。真正关键的下一步,不是再刷新一个基准分数,而是完成从模型和仿真到真实道路运行的可靠跨越。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
HyWorldVLA 在 NAVSIM v1 获得 90.59 PDMS,通过像素级监督与压缩隐空间预测结合,平衡场景细节和推理效率。
HyWorldVLA 在 NAVSIM v1 获得 90.59 PDMS,通过像素级监督与压缩隐空间预测结合,平衡场景细节和推理效率。 训练流程分三步:训练语言引导的视频 VAE、联合预训练像素与隐空间预测、再与动作专家协同微调以生成驾驶轨迹。
消融实验显示,去掉像素级预测后 PDMS 降至 87.50;去掉隐空间处理后降至 89.91,说明两类信号具有互补性。