HyWorldVLA поєднує піксельний контроль із прогнозуванням у latent просторі: перший зберігає деталі сцени, другий зменшує обчислювальні витрати під час роботи. Навчання складається з трьох кроків: мовно керованого video VAE, гібридного попереднього навчання та спільного донавчання з модулем, який будує траєкторії.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD представила HyWorldVLA — модель класу Vision-Language-Action (VLA) для автономного водіння з гібридною «моделлю світу». Її принцип простий, хоча реалізація складна: система навчається одночасно зберігати дорожню сцену на рівні пікселів і представляти її у стислому latent-просторі — внутрішньому наборі ознак моделі. 1
Такий підхід покликаний поєднати два взаємодоповнювальні завдання: не втрачати важливі візуальні подробиці дороги та не витрачати надто багато ресурсів на побудову повних майбутніх відеокадрів під час роботи автомобіля.
Прогнозування майбутніх кадрів на рівні пікселів дає дуже детальну картину: положення інших учасників руху, розмітку, межі проїжджої частини та інші візуальні елементи. Але це обчислювально дороге завдання. Моделі, що працюють у latent-просторі, прогнозують не самі пікселі, а стиснене подання сцени. Це ефективніше, проте за надмірного стискання можна втратити деталі, важливі для водіння. 1
HyWorldVLA не відмовляється від жодного з підходів. Під час навчання піксельний сигнал дисциплінує latent-подання та прив'язує його до реальної сцени. Під час виконання система прогнозує лише latent-ознаки й передає їх спеціалізованому модулю дій, який формує траєкторію автомобіля. 1
7
На першому етапі варіаційний автоенкодер для відео, або video VAE, стискає послідовності дорожніх відео у компактні latent-ознаки. Текстова інформація використовується як семантичний контекст для навчання цього компресора. 2
5
Мета полягає не просто в зменшенні обсягу відео. Стиснене подання має зберігати те, що знадобиться для передбачення подальшого розвитку ситуації та планування руху.
Далі зображення, дії, мовні дані та latent-ознаки перетворюються на єдину послідовність дискретних токенів. Модель авторегресивно прогнозує наступні токени: одночасно передбачає майбутні latent-подання відео та реконструює майбутні кадри. 1
2
Саме тут працює подвійний нагляд:
Інакше кажучи, піксельна втрата не дає latent-моделі надто спростити сцену й «забути» критично важливу для керування інформацію. 1
7
На фінальному етапі модель світу оптимізують разом із action expert — спеціалізованим модулем, який генерує траєкторії. Під час роботи HyWorldVLA вже не створює повні майбутні кадри на рівні пікселів: вона прогнозує latent-ознаки, а модуль дій використовує їх для побудови маршруту руху. 1
Це ключовий компроміс системи. Дорога піксельна перевірка формує якісне подання на етапі навчання, але не переносить ті самі витрати в режим роботи автомобіля.
У бенчмарку NAVSIM v1 HyWorldVLA повідомила про результат 90,59 PDMS, який у роботі та пов'язаних публікаціях названо найкращим серед доступних на той момент публічних результатів. 1
7
Експерименти з абляціями — тобто вимкненням окремих частин моделі — вказують, що гібридна схема не є просто механічним додаванням функцій:
Ці результати підтримують висновок авторів: піксельний і latent-сигнали виконують різні ролі. Перший зберігає точність опису сцени, другий дає більш економне подання для передбачення дій.
У роботі перевіряли два коефіцієнти: λ1 для втрати прогнозування відеотокенів та λ2 для узгодженості latent-подання. 20
Коли λ2 було зафіксовано на рівні 0,1, збільшення λ1 з 0,1 до 0,5 підняло PDMS із 90,48 до 90,59. Однак за λ1 = 1,0 показник упав до 89,83. 20
За фіксованого λ1 = 0,5 збільшення λ2 понад 0,1 також погіршувало результат: при 0,2 PDMS становив 90,47, а подальше підвищення продовжило спадну тенденцію. 20
Практичний висновок: більше нагляду не обов'язково означає кращу модель. Обмеження мають бути достатніми, щоб не втратити корисну інформацію, але не настільки сильними, щоб зробити внутрішнє подання надто жорстким.
PDMS — це комплексна метрика якості водіння в NAVSIM, середовищі оцінювання автономного керування. Вона враховує, зокрема, відсутність зіткнень з вини автомобіля, дотримання придатної для руху зони, запас часу до потенційного зіткнення, комфортність руху та просування транспортного засобу маршрутом. 2
Тому 90,59 PDMS — це не оцінка розпізнавання зображень, а показник якості планування водіння в межах конкретного бенчмарку. Водночас NAVSIM є симуляційним оцінюванням: цей результат сам по собі не підтверджує безпечність системи чи її ефективність у реальному дорожньому русі.
Роботу пов'язують з Automotive New Technology Research Institute компанії BYD. Вона є публічним свідченням того, що автовиробник інвестує у власні дослідження фундаментальних моделей для автономного водіння. 1
Повідомлення про зв'язок команди з робототехнічною школою Харбінського технологічного інституту заслуговують уваги, але наявних первинних даних недостатньо, щоб підтвердити академічний бекграунд кожного дослідника. 5
На тлі NIO, XPeng і Li Auto результат HyWorldVLA дає BYD публічний і вимірюваний доказ дослідницької компетенції у VLA та моделюванні світу. Але це ще не означає доведеної переваги BYD у реальному автономному водінні.
Масштаб випуску автомобілів може стати для BYD перевагою лише за умови, що компанія перетворить лабораторний результат на безпечний, перевірений і ефективно розгорнутий продукт. Наступна справжня перевірка для HyWorldVLA — не нова оцінка в бенчмарку, а надійний перехід від моделі та симуляції до експлуатації на дорогах.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
HyWorldVLA поєднує піксельний контроль із прогнозуванням у latent просторі: перший зберігає деталі сцени, другий зменшує обчислювальні витрати під час роботи.
HyWorldVLA поєднує піксельний контроль із прогнозуванням у latent просторі: перший зберігає деталі сцени, другий зменшує обчислювальні витрати під час роботи. Навчання складається з трьох кроків: мовно керованого video VAE, гібридного попереднього навчання та спільного донавчання з модулем, який будує траєкторії.
На NAVSIM v1 модель набрала 90,59 PDMS; без піксельного прогнозування оцінка знизилася до 87,50, а без latent компонента — до 89,91.