BYD’nin HyWorldVLA modeli, piksel düzeyi denetimi ile sıkıştırılmış latent uzayda tahmini birleştirerek NAVSIM v1’de 90,59 PDMS elde etti. Sistem önce dil rehberliğinde bir video VAE eğitiyor; ardından piksel ve latent tahminlerini birlikte önceden eğitiyor; son aşamada ise yörünge üreten bir eylem uzmanıyla birlikt...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD, otonom sürüş için geliştirdiği HyWorldVLA adlı Vision-Language-Action (VLA) modelinde iki farklı “dünya modeli” yaklaşımını bir araya getiriyor: sahneyi ayrıntılı biçimde koruyan piksel düzeyi tahmin ve hesaplama açısından daha ekonomik olan sıkıştırılmış latent uzay temsilleri. 1
Temel fikir şu: Sistem eğitim sırasında gelecekteki görüntü karelerini de yeniden oluşturarak yol sahnesine sıkı biçimde bağlanıyor; araç çalışırken ise tam piksel kareleri üretmek yerine yalnızca latent özellikleri tahmin ediyor. Bu özellikler, sürüş yörüngesi oluşturan ayrı bir eylem uzmanına aktarılıyor. 1
7
Piksel düzeyinde gelecek kare tahmini, şeridin konumu, diğer araçlar ve yol çevresi gibi görsel ayrıntıları koruyabilir. Ancak bu yaklaşım yüksek hesaplama maliyeti getirir. Latent uzay yaklaşımı ise görüntüyü daha kompakt, soyut özelliklere sıkıştırır; dolayısıyla tahmin ve planlama için daha verimlidir, fakat sürüş açısından kritik bazı ayrıntıları kaybetme riski taşır. 1
HyWorldVLA bu iki seçenekten yalnızca birini tercih etmiyor. Piksel denetimini eğitimde, latent temsillerin gerçek görsel sahneden kopmamasını sağlayan bir güvence olarak kullanıyor. Çevrim içi çıkarım aşamasında ise daha hafif latent temsillerle çalışarak verimliliği korumayı amaçlıyor. 1
7
İlk aşamada bir video varyasyonel otoenkoderi (video VAE), sürüş videolarındaki ardışık kareleri latent özelliklere sıkıştırıyor. Dil bilgisi ya da metinsel açıklamalar, sıkıştırıcı eğitilirken sahnenin anlamsal bağlamını desteklemek için kullanılıyor. 2
5
Buradaki hedef yalnızca videoyu küçültmek değil. Ortaya çıkan latent temsilin geleceği tahmin etmek ve sonunda sürüş kararı vermek için gerekli bilgiyi taşıması gerekiyor.
İkinci aşamada görüntüler, eylemler, dil öğeleri ve latent özellikler ortak bir ayrık token dizisinde birleştiriliyor. Model bu dizide otoregresif tahmin yaparken hem gelecekteki video latentlerini öngörüyor hem de gelecekteki görüntü karelerini yeniden yapılandırıyor. 1
2
Bu, çift denetim yaklaşımının merkezinde yer alıyor:
Başka bir deyişle, piksel kaybı latent uzayın sahneyi gereğinden fazla soyutlayıp sürüşte kritik detayları silmesini engelleyen bir kısıt işlevi görüyor. 1
7
Son aşamada dünya modeli, yörünge ve eylem üretimine odaklanan bir “action expert” ile birlikte optimize ediliyor. Sistem çalışma sırasında tam çözünürlüklü görüntü kareleri üretmek yerine latent özellikleri tahmin ediyor; eylem uzmanı da bu özelliklerden sürüş yörüngeleri oluşturuyor. 1
Bu ayrım verimlilik açısından önemli: Hesaplama maliyeti yüksek piksel düzeyi denetim, temsili eğitimde şekillendirmek için kullanılıyor; ancak gerçek zamanlı tahminde aynı maliyet taşınmıyor.
HyWorldVLA, NAVSIM v1’de 90,59 PDMS skoru bildirdi. Çalışma ve buna ilişkin haberler, bu sonucu o tarihte açıklanmış kamuya açık sonuçlar arasında lider olarak tanımlıyor. 1
7
Bileşen çıkarma deneyleri, hibrit yaklaşımın yalnızca ek modüller yığmak olmadığını gösteriyor:
Bu sonuçlar, iki temsilin farklı ihtiyaçları karşıladığı görüşünü destekliyor: Piksel denetimi sahne sadakatini korurken, latent tahmin sürüş eylemleri için daha ekonomik bir planlama temeli sunuyor.
Makale, iki eğitim ağırlığını inceliyor: video token tahmin kaybı için λ1, latent temsil tutarlılığı için ise λ2. 20
λ2 değeri 0,1’de sabitken, λ1’in 0,1’den 0,5’e çıkarılması PDMS’yi 90,48’den 90,59’a yükseltti. λ1 değeri 1,0’a çıktığında ise skor 89,83’e düştü. 20
λ1 değeri 0,5’te sabitken λ2’nin 0,1’in üzerine çıkarılması da sonucu olumsuz etkiledi: λ2 0,2 iken PDMS 90,47 oldu; daha yüksek değerlerde düşüş sürdü. 20
Buradaki mesaj, daha fazla denetimin her zaman daha iyi olmadığı. Modelin yararlı ayrıntıları koruyacak kadar piksel ve latent kısıtına ihtiyacı var; ancak aşırı kısıt, sürüşe uygun temsiller öğrenmesini zorlaştırabiliyor.
PDMS, NAVSIM adlı otonom sürüş benzetim değerlendirmesindeki bileşik sürüş kalitesi metriğidir. Araç kaynaklı çarpışmalardan kaçınma, sürülebilir alana uyum, olası çarpışmaya kalan süre, hareket konforu ve aracın rota üzerindeki ilerlemesi gibi ölçütleri içerir. 2
Bu nedenle 90,59 PDMS, basit bir görüntü tanıma sonucu değildir; belirli bir test ortamında sürüş planlama performansını yansıtır. Yine de bu sonuç bir simülasyon değerlendirmesidir. Bağımsız gerçek yol güvenliği doğrulaması ya da gerçek trafikte üstün performans kanıtı olarak değerlendirilmemelidir.
Çalışma, BYD’nin Automotive New Technology Research Institute birimine atfediliyor ve şirketin otonom sürüşe yönelik temel model araştırmalarını şirket içinde geliştirmeye yatırım yaptığını kamuya açık biçimde gösteriyor. 1
Ekibin Harbin Institute of Technology’deki robotik uzmanlığıyla bağlantılı olduğuna dair haberler dikkat çekici olsa da, mevcut birincil kaynaklar her araştırmacının akademik geçmişini doğrulamak için yeterli değil. 5
NIO, XPeng ve Li Auto gibi rakiplerle karşılaştırıldığında HyWorldVLA, BYD’ye VLA ve dünya modelleme alanında kamuya açık, ölçülebilir bir araştırma sonucu sağlıyor. Bu, şirketin araştırma kapasitesine işaret ediyor; BYD’nin gerçek dünyadaki otonom sürüşte şimdiden kanıtlanmış bir üstünlüğe sahip olduğu anlamına gelmiyor.
BYD’nin geniş araç üretim ve dağıtım ölçeği, ancak bu araştırma sonucu güvenli, doğrulanmış ve verimli biçimde ürüne dönüştürülebilirse bir avantaj yaratabilir. Asıl sınav, bir sonraki kıyaslama skorundan çok, modelin simülasyondan gerçek yol koşullarına güvenilir biçimde taşınması olacak.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
BYD’nin HyWorldVLA modeli, piksel düzeyi denetimi ile sıkıştırılmış latent uzayda tahmini birleştirerek NAVSIM v1’de 90,59 PDMS elde etti.
BYD’nin HyWorldVLA modeli, piksel düzeyi denetimi ile sıkıştırılmış latent uzayda tahmini birleştirerek NAVSIM v1’de 90,59 PDMS elde etti. Sistem önce dil rehberliğinde bir video VAE eğitiyor; ardından piksel ve latent tahminlerini birlikte önceden eğitiyor; son aşamada ise yörünge üreten bir eylem uzmanıyla birlikte ince ayar yapıyor.
Bileşen çıkarma deneylerinde piksel tahmininin kaldırılması PDMS’yi 87,50’ye, latent uzay işlemenin kaldırılması ise 89,91’e düşürdü; bu da iki sinyalin tamamlayıcı rolünü destekliyor.