JD mengumumkan pembukaan kode JoyAI EchoWM dan EchoWM Flash versi streaming kausal empat langkah di JDD 2026. Antarmuka “camera intent” menerjemahkan input keyboard atau kontroler menjadi lintasan kamera 6 DoF untuk eksplorasi orang pertama maupun sudut pandang orang ketiga.
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did JD.com announce at the September 10, 2026 JDDiscovery (JDD) conference about open-sourcing JoyAI-EchoWM—its interactive audiovisual. Article summary: JD announced that it is open-sourcing JoyAI‑EchoWM, an “enterable” interactive audiovisual world model, and EchoWM‑Flash, a faster four-step causal-streaming version. The release is best understood as part of JD’s physic. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
JD membuka kode JoyAI-EchoWM, model dunia audiovisual interaktif, serta EchoWM-Flash, versi streaming kausal yang lebih ringan dengan empat langkah. Gagasan utamanya bukan membuat satu klip video statis, melainkan membiarkan pengguna menjelajahi sebuah adegan buatan AI saat gambar dan suara terus berubah mengikuti navigasi. 1
6
EchoWM dirancang untuk menghasilkan video 720p sekaligus suara lingkungan, musik, dan ucapan yang sinkron. Jadi, ketika pengguna mengubah arah pandang atau bergerak di dalam adegan, sistem ditujukan untuk memperbarui visual dan audio secara bersamaan—bukan sekadar menempelkan trek suara setelah videonya selesai dibuat. 1
2
Pusat kendalinya adalah representasi terpadu bernama camera-intent. Input dari keyboard atau kontroler diterjemahkan menjadi lintasan kamera kontinu dengan enam derajat kebebasan (six degrees of freedom atau 6-DoF). Dengan cara ini, model mendukung jelajah sudut pandang orang pertama, kamera orang ketiga, hingga mode kamera yang mengikuti subjek. 1
11
Lintasan kamera menjadi acuan bagi hasil visual, sedangkan peristiwa dalam adegan diharapkan memunculkan suara yang sesuai. Contohnya, langkah kaki, benturan, dialog, atau musik dapat berubah selaras dengan konteks adegan. 1
11
EchoWM-Flash adalah varian streaming kausal empat langkah yang dibuat untuk memangkas jumlah langkah sampling sambil tetap menjaga respons interaktif. Dalam pengujian WBench Navigation yang mencakup 158 kasus, makalah pengembang melaporkan skor rata-rata 81,7 untuk EchoWM dan 81,0 untuk EchoWM-Flash. Skor interaksi EchoWM tercatat 87,2, dengan konsistensi 89,8; sementara Flash mencatat skor interaksi 87,9. 1
Angka tersebut merupakan hasil benchmark yang dilaporkan pengembang dan makalah riset, bukan validasi independen bahwa model sudah siap untuk semua kebutuhan produksi waktu nyata. Repositori WBench secara terpisah mencantumkan JoyAI-Echo-1.5 (WM) pada 81,6 dan varian Flash empat langkah pada 81,0; perbedaan kecil antara 81,6 dan 81,7 itu berasal dari pelaporan yang berbeda. 15
EchoWM mendukung eksplorasi multi-putaran dengan mengandalkan jendela konteks audiovisual singkat dari rangkaian sebelumnya. Pendekatan ini memungkinkan model melanjutkan adegan yang telah dinavigasi, tetapi berbeda dari memiliki representasi dunia 3D yang eksplisit dan persisten.
Perbedaannya penting untuk penggunaan jangka panjang. Tanpa memori 3D persisten, eksplorasi yang lebih lama dapat mengalami pergeseran (drift) spasial atau visual secara bertahap. Hasil yang dilaporkan JD menunjukkan kekuatan pada interaksi dan konsistensi di benchmark, tetapi kesinambungan berbasis konteks ini tetap menjadi keterbatasan praktis untuk navigasi berdurasi panjang. 1
11
Riset yang menyertai rilis ini menjelaskan penggunaan mesin data dunia dan pelatihan bertahap. Sumber datanya mencakup log permainan, rekaman manusia bermain, simulasi berbasis Unreal Engine yang ditambatkan pada pose, serta video internet. Targetnya adalah menghubungkan pergerakan kamera yang dapat dikendalikan, dinamika visual, dan pembangkitan audio sinkron dalam satu model. 1
Makalah JD juga menautkan repositori kode publik jd-opensource/JoyAI-Echo, sehingga rilis ini dapat dimanfaatkan peneliti dan pengembang yang ingin bereksperimen dengan sistem model dunia interaktif. 1
EchoWM diperkenalkan sebagai salah satu komponen dari agenda physical AI JD yang mencakup data, komputasi, model, dan operasi logistik. JD Cloud menyatakan rencana membangun klaster domestik berisi 100.000 GPU untuk pelatihan model besar, inferensi, dan beban kerja AI berwujud (embodied AI), serta mengumpulkan lebih dari 10 juta jam video aktivitas manusia di dunia nyata. 18
22
Di sisi operasi, JD Logistics mengandalkan Meta Brain 3.0 untuk mengoordinasikan pengambilan keputusan di pergudangan, transportasi, dan pengantaran. JD menyebut sistem ini memangkas waktu kalkulasi rute optimal bagi ratusan juta paket dari hitungan menit menjadi hitungan detik. 18
22
Dalam konteks tersebut, pembukaan kode EchoWM lebih tepat dibaca sebagai langkah riset dan infrastruktur terbuka untuk pengembangan model dunia interaktif serta physical AI, bukan pengumuman pendanaan. Nilai teknis yang paling menonjol adalah penyatuan navigasi kamera yang dapat dikendalikan dengan pembangkitan video dan suara secara bersama-sama—dengan catatan bahwa konsistensi dunia untuk eksplorasi jangka panjang masih menjadi tantangan terbuka. 1
11
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
JD mengumumkan pembukaan kode JoyAI EchoWM dan EchoWM Flash versi streaming kausal empat langkah di JDD 2026.
JD mengumumkan pembukaan kode JoyAI EchoWM dan EchoWM Flash versi streaming kausal empat langkah di JDD 2026. Antarmuka “camera intent” menerjemahkan input keyboard atau kontroler menjadi lintasan kamera 6 DoF untuk eksplorasi orang pertama maupun sudut pandang orang ketiga.
Rilis ini menjadi bagian dari strategi physical AI JD, yang juga mencakup rencana klaster 100.000 GPU dan pengumpulan lebih dari 10 juta jam video aktivitas dunia nyata.