HyWorldVLA של BYD השיג ציון PDMS של 90.59 ב NAVSIM v1 באמצעות שילוב של פיקוח ברמת פיקסל וחיזוי במרחב לטנטי דחוס. תהליך האימון כולל מאמן וידאו VAE מונחה שפה, אימון מוקדם עם פיקוח כפול, ולאחר מכן כוונון משותף עם מודול פעולה שמייצר מסלולי נסיעה.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD הציגה את HyWorldVLA, מודל Vision-Language-Action (VLA) לנהיגה אוטונומית המבוסס על "מודל עולם" היברידי. הרעיון המרכזי הוא להחזיק שתי תמונות משלימות של הכביש: חיזוי עשיר בפרטים ברמת פיקסל, לצד ייצוג לטנטי — ייצוג דחוס שהמודל לומד — שמאפשר חיזוי ותכנון יעילים יותר. 1
חיזוי של פריימים עתידיים ברמת פיקסל יכול לשמר פרטים חזותיים רבים בסצנה, אבל הוא יקר מבחינה חישובית. מודל הפועל במרחב לטנטי, לעומת זאת, מבצע חיזוי על ייצוגים דחוסים; לכן הוא מעשי יותר להרצה, אך עלול לאבד מידע חשוב להחלטות נהיגה. 1
HyWorldVLA מנסה לא לבחור רק באחת משתי הגישות. במהלך האימון הוא משתמש בפיקוח פיקסלים כדי לשמור את הייצוג הלטנטי קשור לסצנה החזותית בפועל. בשלב ההפעלה, לעומת זאת, הוא חוזה רק תכונות לטנטיות ומעביר אותן למומחה פעולה שמפיק מסלולי נסיעה. 1
7
בשלב הראשון, מקודד אוטומטי הסתברותי לווידאו — Video VAE — דוחס רצפי וידאו של נהיגה לתכונות לטנטיות. השפה משמשת הקשר סמנטי בזמן אימון המדחס. 2
5
המטרה אינה רק להקטין את נפח המידע בווידאו: המרחב הלטנטי אמור לשמר את המידע הנחוץ לחיזוי העתיד ולבסוף גם לנהיגה.
לאחר מכן, תמונות, פעולות, רכיבי שפה ותכונות לטנטיות מאוחדים לטוקנים בדידים לצורך חיזוי אוטורגרסיבי. בשלב זה המודל חוזה את הלטנטים של הווידאו העתידי, ובמקביל משחזר פריימים עתידיים. 1
2
זוהי מהות הפיקוח הכפול:
במילים פשוטות, אובדן הפיקסלים משמש מגבלה שמונעת מהמודל הלטנטי לדחוס את הסצנה יותר מדי ולאבד פרטים קריטיים. 1
7
בשלב האחרון מודל העולם עובר אופטימיזציה יחד עם מודל ייעודי לפעולות ולמסלולי נסיעה. בזמן ההפעלה המערכת חוזה תכונות לטנטיות במקום לייצר פריימים מלאים ברמת פיקסל; התכונות מועברות למומחה הפעולה, שמפיק את מסלול הנהיגה. 1
החלוקה הזו חשובה ליעילות: הפיקוח המדויק ברמת פיקסל מעצב את הייצוג בזמן האימון, בלי לכפות את אותה עלות חישובית בזמן החיזוי המקוון.
ב-NAVSIM v1, HyWorldVLA דיווח על 90.59 PDMS — תוצאה שהמאמר והדיווחים הנלווים תיארו כמובילה בין התוצאות הציבוריות באותה עת. 1
7
ניסויי ההסרה מצביעים על כך שהשילוב אינו רק צירוף של רכיבים:
התוצאות תומכות בטענת החוקרים שפיקוח הפיקסלים והחיזוי הלטנטי פותרים חלקים שונים של הבעיה: הראשון שומר על נאמנות לסצנה, והשני מספק ייצוג חסכוני יותר לחיזוי פעולות.
המאמר בוחן שני משקלים: λ1 עבור אובדן חיזוי טוקני הווידאו, ו-λ2 עבור עקביות הייצוג הלטנטי. 20
כאשר λ2 נשמר על 0.1, העלאת λ1 מ-0.1 ל-0.5 שיפרה את ה-PDMS מ-90.48 ל-90.59. כשהערך של λ1 עלה ל-1.0, הציון ירד ל-89.83. 20
כאשר λ1 נשמר על 0.5, העלאת λ2 מעבר ל-0.1 פגעה בביצועים: ב-0.2 ה-PDMS היה 90.47, והעלאה נוספת המשיכה את מגמת הירידה. 20 המסקנה אינה שיותר פיקוח תמיד טוב יותר. המודל זקוק למספיק אילוצים ברמת פיקסל ובמרחב הלטנטי כדי לשמר מידע שימושי, אך לא לכאלה שיהפכו את הייצוג לנוקשה מדי.
PDMS הוא מדד משולב לאיכות נהיגה בסביבת NAVSIM. הוא כולל רכיבים כגון הימנעות מהתנגשויות שהרכב אחראי להן, עמידה בתחום הנסיעה המותר, זמן עד להתנגשות אפשרית, נוחות התנועה והתקדמות הרכב במסלול. 2
לכן, הציון 90.59 אינו מדד פשוט לזיהוי תמונה: הוא משקף את ביצועי תכנון הנהיגה במסגרת אותו בנצ'מרק. עם זאת, זו עדיין הערכה בסביבה מדומה, ולא אישור עצמאי לבטיחות או לביצועים בתנועה אמיתית.
העבודה משויכת למכון המחקר Automotive New Technology Research Institute של BYD, והיא עדות פומבית להשקעה במחקר פנימי של מודלי יסוד לנהיגה אוטונומית. 1 הדיווחים על זיקה של הקבוצה למומחיות רובוטיקה מהמכון הטכנולוגי של חרבין מעניינים, אך הראיות הראשוניות הזמינות אינן מספיקות כדי לקבוע את הרקע האקדמי של כל חוקר.
5
מול יצרניות כמו NIO, XPeng ו-Li Auto, HyWorldVLA מעניק ל-BYD הישג מחקרי פומבי ומדיד בתחום VLA ומודלי עולם. זה מעיד על יכולת מחקרית — אך לא מוכיח של-BYD כבר יש יתרון מבוסס בנהיגה אוטונומית בעולם האמיתי.
היקף הייצור והפריסה של כלי רכב מבית BYD עשוי להפוך ליתרון רק אם החברה תצליח להמיר את תוצאת המחקר למוצר בטוח, מאומת ויעיל לפריסה. המבחן המשמעותי הבא אינו עוד ציון בנצ'מרק, אלא מעבר אמין מהמודל ומהסימולציה לתפקוד על הכביש.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
HyWorldVLA של BYD השיג ציון PDMS של 90.59 ב NAVSIM v1 באמצעות שילוב של פיקוח ברמת פיקסל וחיזוי במרחב לטנטי דחוס.
HyWorldVLA של BYD השיג ציון PDMS של 90.59 ב NAVSIM v1 באמצעות שילוב של פיקוח ברמת פיקסל וחיזוי במרחב לטנטי דחוס. תהליך האימון כולל מאמן וידאו VAE מונחה שפה, אימון מוקדם עם פיקוח כפול, ולאחר מכן כוונון משותף עם מודול פעולה שמייצר מסלולי נסיעה.
בניסויי הסרה, ויתור על חיזוי פיקסלים הוריד את הציון ל 87.50; ויתור על העיבוד הלטנטי הוריד אותו ל 89.91 — סימן לכך ששני המרכיבים משלימים זה את זה.