HyWorldVLA от BYD получила 90,59 PDMS в NAVSIM v1, сочетая пиксельный контроль при обучении с прогнозированием в сжатом latent пространстве. Метод состоит из трёх этапов: обучения видео VAE, гибридного предварительного обучения модели мира и совместной донастройки с модулем, строящим траектории.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD представила HyWorldVLA — модель класса Vision-Language-Action (VLA) для автономного вождения с гибридной «моделью мира». Её идея в том, чтобы не выбирать между двумя подходами к представлению дорожной сцены: детальным прогнозированием на уровне пикселей и сжатыми скрытыми представлениями — latent space. 1
Пиксельная модель позволяет сохранять мелкие визуальные детали, но требует больших вычислительных ресурсов. Модель в latent-пространстве работает с компактным описанием сцены, поэтому удобнее для прогнозирования и планирования, однако рискует отбросить детали, важные для вождения. HyWorldVLA использует преимущества обоих вариантов: при обучении она получает пиксельный контроль, а при работе предсказывает только latent-признаки и передаёт их модулю действий, который формирует траекторию. 1
7
Сначала видео-вариационный автоэнкодер, или video VAE, сжимает последовательности дорожных видео в компактные latent-признаки. Текстовая информация используется как семантический контекст при обучении такого компрессора. 2
5
Задача здесь не сводится к уменьшению объёма видео. Скрытое представление должно сохранить сведения, которые пригодятся для прогнозирования развития сцены и последующего выбора траектории.
Затем изображения, действия, языковые элементы и latent-признаки преобразуются в единые дискретные токены. Модель авторегрессионно предсказывает будущие video latents и одновременно реконструирует будущие видеокадры. 1
2
Именно здесь действует двойной контроль:
Проще говоря, пиксельная функция потерь служит ограничителем: она не даёт latent-модели чрезмерно «сжать» картину и потерять существенные для дороги детали. 1
7
На финальном этапе модель мира оптимизируется вместе со специализированным модулем действий и траекторий. В рабочем режиме система не генерирует полные кадры на пиксельном уровне: она прогнозирует latent-признаки, а затем передаёт их action expert для построения траектории движения. 1
Такой разнос ролей важен для эффективности. Дорогой пиксельный контроль помогает сформировать представление на этапе обучения, но не переносит те же вычислительные затраты на работу модели в реальном времени.
В бенчмарке NAVSIM v1 HyWorldVLA сообщила результат 90,59 PDMS. В статье и связанных публикациях он характеризуется как лучший среди открыто опубликованных результатов на тот момент. 1
7
Эксперименты с исключением отдельных частей модели показывают, что гибридная схема — не просто набор дополнительных функций:
Эти результаты согласуются с гипотезой авторов: пиксельный и скрытый уровни решают разные задачи. Первый помогает сохранить верность наблюдаемой сцене, второй даёт более экономичное представление для прогноза действий.
В работе проверяются два коэффициента: λ1 задаёт вес потерь при прогнозировании video tokens, а λ2 отвечает за согласованность latent-представления. 20
При фиксированном λ2 = 0,1 увеличение λ1 с 0,1 до 0,5 подняло PDMS с 90,48 до 90,59. Но при λ1 = 1,0 оценка упала до 89,83. 20
При фиксированном λ1 = 0,5 увеличение λ2 выше 0,1 также ухудшало результат: при 0,2 PDMS составил 90,47, а при дальнейшем росте коэффициента снижение продолжилось. 20
Вывод не в том, что больше контроля всегда лучше. Модели нужен достаточный пиксельный и latent-контроль, чтобы не терять полезную информацию, но чрезмерно жёсткие ограничения могут помешать ей находить представления, полезные именно для вождения.
PDMS — составная метрика качества вождения в NAVSIM, симуляционном бенчмарке для проверки планирования. Она учитывает, в частности, отсутствие столкновений по вине автомобиля, соблюдение допустимой зоны движения, время до потенциального столкновения, плавность манёвров и продвижение по маршруту. 2
Поэтому 90,59 — не показатель распознавания объектов на изображении, а комплексная оценка планирования движения в условиях конкретного теста. При этом результат в NAVSIM остаётся оценкой в симуляции: он не равнозначен независимому подтверждению безопасности или эффективности системы в реальном дорожном движении.
Работа связана с Automotive New Technology Research Institute компании BYD и служит публичным признаком инвестиций автопроизводителя в собственные фундаментальные модели для автономного вождения. 1 Публикации упоминают связь команды с робототехнической школой Харбинского политехнического университета, однако доступных первичных данных недостаточно, чтобы уверенно установить академический бэкграунд каждого исследователя.
5
На фоне NIO, XPeng и Li Auto HyWorldVLA даёт BYD публичный и измеримый исследовательский результат в области VLA и моделирования мира. Это демонстрация исследовательских возможностей, но не доказательство уже достигнутого превосходства в реальном автономном вождении.
Масштаб производства BYD потенциально может стать преимуществом, если компании удастся превратить исследовательский результат в безопасный, валидированный и эффективно развёрнутый продукт. Следующая принципиальная проверка — не новый рекорд в бенчмарке, а надёжный переход от модели и симуляции к эксплуатации на дорогах.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
HyWorldVLA от BYD получила 90,59 PDMS в NAVSIM v1, сочетая пиксельный контроль при обучении с прогнозированием в сжатом latent пространстве.
HyWorldVLA от BYD получила 90,59 PDMS в NAVSIM v1, сочетая пиксельный контроль при обучении с прогнозированием в сжатом latent пространстве. Метод состоит из трёх этапов: обучения видео VAE, гибридного предварительного обучения модели мира и совместной донастройки с модулем, строящим траектории.
В экспериментах без пиксельного прогнозирования показатель PDMS снизился до 87,50, а без обработки в latent пространстве — до 89,91: компоненты дополняют друг друга.