JD, JDD 2026 kapsamında etkileşimli görsel işitsel dünya modeli JoyAI EchoWM’yi ve dört adımlı EchoWM Flash sürümünü açık kaynak olarak yayımladı. Birleşik “kamera niyeti” arayüzü, klavye veya kumanda girdilerini sürekli altı serbestlik dereceli kamera rotalarına dönüştürüyor; birinci ve üçüncü şahıs bakışlarını des...
YayımlayanGPT-5.6 Terra ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What did JD.com announce at the September 10, 2026 JDDiscovery (JDD) conference about open-sourcing JoyAI-EchoWM—its interactive audiovisual. Article summary: JD announced that it is open-sourcing JoyAI‑EchoWM, an “enterable” interactive audiovisual world model, and EchoWM‑Flash, a faster four-step causal-streaming version. The release is best understood as part of JD’s physic. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
JD, JDD 2026’daki temel yapay zekâ duyurularından biri olarak JoyAI-EchoWM adlı etkileşimli görsel-işitsel dünya modelini, daha hafif dört adımlı nedensel akış sürümü EchoWM-Flash ile birlikte açık kaynak yaptı. Amaç, baştan sona sabit bir video klibi üretmek değil; kullanıcının içinde gezinebildiği, hareket ettikçe görüntüsü ve sesi birlikte değişen yapay bir sahne oluşturmak. 1
6
EchoWM, 720p video ile eşzamanlı ortam sesi, müzik ve konuşma üretebiliyor. Kullanıcı sahnede yön değiştirdiğinde ya da ilerlediğinde sistemin yalnızca yeni görüntüler değil, bu hareketle uyumlu sesler de üretmesi hedefleniyor. Örneğin adımlar, çarpışmalar, diyalog veya müzik, sonradan eklenmiş ayrı bir ses bandı gibi değil; sahnedeki gelişmelerle bağlantılı biçimde oluşuyor. 1
2
Modelin temel kontrol mekanizması birleşik bir “kamera niyeti” temsili. Bu sistem, klavye ya da oyun kumandası komutlarını sürekli, altı serbestlik dereceli (6-DoF) kamera rotalarına çeviriyor. Böylece birinci şahıs bakış açısından dolaşma, üçüncü şahıs kamera kullanımı ve takip kamerası benzeri çekimler aynı kontrol altyapısıyla gerçekleştirilebiliyor. Kamera rotası görsel üretimi yönlendirirken, sahne olaylarının da karşılık gelen sesleri tetiklemesi amaçlanıyor. 1
11
EchoWM-Flash, örnekleme adımı sayısını dörde indiren nedensel akış sürümü. Bu yaklaşımın hedefi, etkileşimli üretimde yanıt verme hızını artırırken kaliteyi mümkün olduğunca korumak.
Araştırma makalesinde paylaşılan 158 vakalık WBench Navigation değerlendirmesinde EchoWM’nin ortalama puanı 81,7, EchoWM-Flash’ın ise 81,0 olarak verildi. EchoWM için bildirilen etkileşim ve tutarlılık puanları sırasıyla 87,2 ve 89,8; Flash için etkileşim puanı ise 87,9 oldu. 1
Bu rakamlar, geliştiricilerin ve makalenin bildirdiği kıyaslama sonuçları olarak değerlendirilmelidir; her gerçek zamanlı yapım veya kullanım senaryosuna hazır olduğuna ilişkin bağımsız bir doğrulama anlamına gelmiyor. Ayrı WBench deposunda JoyAI-Echo-1.5 (WM) için 81,6, dört adımlı Flash sürümü içinse 81,0 puanı listeleniyor. Bu da kaynaklardaki 81,6 ile 81,7 arasındaki küçük farkı açıklıyor. 15
EchoWM, çok turlu keşfi kısa bir yakın dönem görsel-işitsel bağlam penceresi üzerinden sürdürüyor. Bu, kullanıcının yönlendirdiği bir sekansın devamını sağlayabiliyor; ancak sistemin kalıcı ve açık bir üç boyutlu dünya temsili tuttuğu anlamına gelmiyor.
Aradaki fark uzun süreli kullanımda önem kazanıyor. Kalıcı 3B bellek olmadığında, uzun gezintiler boyunca mekânsal ilişkilerde veya görsel ayrıntılarda sapma birikebilir. JD’nin sonuçları, kıyaslamada etkileşim ve tutarlılık açısından güçlü bir performansa işaret etse de bağlam penceresine dayalı bu süreklilik, uzun soluklu navigasyon için pratik bir sınırlama olmaya devam ediyor. 1
11
Araştırma ekibi, bir dünya verisi motoru ve aşamalı bir eğitim süreci tanımlıyor. Süreçte oyun kayıtları, insanların oyun oynadığı videolar, Unreal Engine tabanlı ve pozla ilişkilendirilmiş simülasyonlar ile internet videoları kullanılıyor. Hedef; kontrol edilebilir kamera hareketini, görsel dinamikleri ve eşzamanlı ses üretimini tek modelde buluşturmak. 1
Makale, herkese açık jd-opensource/JoyAI-Echo kod deposuna bağlantı veriyor. Bu nedenle çalışma, etkileşimli dünya modelleri üzerinde deney yapan araştırmacılar ve geliştiriciler açısından erişilebilir bir araştırma altyapısı sunuyor. 1
EchoWM, JD’nin veri, hesaplama kapasitesi, modeller ve lojistik operasyonlarını kapsayan daha geniş fiziksel yapay zekâ stratejisinin bir parçası olarak tanıtıldı. JD Cloud; büyük model eğitimi, çıkarım ve bedenlenmiş yapay zekâ iş yükleri için yerli olarak geliştirilecek 100.000 GPU’luk bir küme kurmayı, ayrıca gerçek dünyadaki insan faaliyetlerini gösteren 10 milyon saatten fazla video toplamayı planlıyor. 18
22
Bu stratejinin operasyonel tarafında JD Logistics’in Meta Brain 3.0 sistemi yer alıyor. JD’ye göre sistem, depolama, taşımacılık ve teslimat arasındaki kararları koordine ederek yüz milyonlarca paketin en uygun rota hesaplama süresini dakikalardan saniyelere indiriyor. 18
22
Özetle EchoWM duyurusu bir yatırım veya finansman haberi değil; etkileşimli ve fiziksel yapay zekâ geliştirmeye dönük açık model ve araştırma altyapısı hamlesi. Teknik açıdan en dikkat çekici önerisi, kontrol edilebilir kamera gezintisini görüntü ve sesin birlikte üretimiyle birleştirmesi. Buna karşılık, uzun zaman aralıklarında dünya tutarlılığını korumak hâlâ çözülmemiş bir sorun. 1
11
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
JD, JDD 2026 kapsamında etkileşimli görsel işitsel dünya modeli JoyAI EchoWM’yi ve dört adımlı EchoWM Flash sürümünü açık kaynak olarak yayımladı.
JD, JDD 2026 kapsamında etkileşimli görsel işitsel dünya modeli JoyAI EchoWM’yi ve dört adımlı EchoWM Flash sürümünü açık kaynak olarak yayımladı. Birleşik “kamera niyeti” arayüzü, klavye veya kumanda girdilerini sürekli altı serbestlik dereceli kamera rotalarına dönüştürüyor; birinci ve üçüncü şahıs bakışlarını destekliyor.
Duyuru, JD’nin fiziksel yapay zekâ stratejisinin parçası: şirket 100.000 GPU’luk yerli bir küme ve 10 milyon saati aşan gerçek dünya etkinliği videosu toplamayı planlıyor.