JD podczas JDD 2026 udostępniło jako open source model JoyAI EchoWM oraz czteroetapową, strumieniową wersję EchoWM Flash. System zamienia polecenia z klawiatury lub kontrolera na ciągłe trajektorie kamery w sześciu stopniach swobody, obsługując widok pierwszo i trzecioosobowy.
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did JD.com announce at the September 10, 2026 JDDiscovery (JDD) conference about open-sourcing JoyAI-EchoWM—its interactive audiovisual. Article summary: JD announced that it is open-sourcing JoyAI‑EchoWM, an “enterable” interactive audiovisual world model, and EchoWM‑Flash, a faster four-step causal-streaming version. The release is best understood as part of JD’s physic. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
JD udostępniło w modelu open source JoyAI-EchoWM, interaktywny audiowizualny model świata, a także EchoWM-Flash — lżejszy wariant strumieniowy działający w czterech krokach. Zamiast wygenerować zamknięty klip wideo, system ma pozwalać użytkownikowi poruszać się po stworzonej scenie, podczas gdy obraz i dźwięk rozwijają się wspólnie. 1
6
EchoWM tworzy wideo w rozdzielczości 720p razem z dopasowanymi dźwiękami otoczenia, muzyką i mową. Zamysł jest prosty: użytkownik ma wejść do wygenerowanej przestrzeni. Gdy zmienia kierunek albo przemieszcza się po scenie, model aktualizuje zarówno obraz, jak i warstwę dźwiękową — nie dokleja ścieżki audio dopiero po wygenerowaniu filmu. 1
2
Kluczowym elementem jest ujednolicona reprezentacja „intencji kamery” (camera intent). Polecenia z klawiatury lub kontrolera są przekształcane w ciągłe trajektorie kamery o sześciu stopniach swobody (6-DoF). Dzięki temu można poruszać się z perspektywy pierwszej osoby, ale też korzystać z ujęć trzecioosobowych czy kamery śledzącej postać. Ruch kamery ma wpływać na generowany obraz, a zdarzenia w scenie powinny otrzymywać odpowiadający im dźwięk — np. kroki, zderzenia, dialogi lub muzykę. 1
11
EchoWM-Flash to czteroetapowy wariant przyczynowo-strumieniowy. Jego zadaniem jest ograniczenie liczby kroków próbkowania przy zachowaniu szybkiej reakcji na interakcje użytkownika.
W przedstawionych w publikacji wynikach dla 158 przypadków WBench Navigation EchoWM uzyskał średnio 81,7, a EchoWM-Flash 81,0. Dla EchoWM raportowano wyniki 87,2 w kategorii interakcji i 89,8 w kategorii spójności; Flash uzyskał 87,9 za interakcję. 1
To wyniki zgłoszone przez autorów i opisane w publikacji, a nie niezależne potwierdzenie, że modele są gotowe do każdego zastosowania wymagającego działania w czasie rzeczywistym. Osobne repozytorium WBench podaje dla JoyAI-Echo-1.5 (WM) wynik 81,6, a dla czteroetapowego Flasha 81,0 — stąd niewielka rozbieżność między 81,6 a 81,7 w różnych materiałach. 15
Model obsługuje wieloturową eksplorację, opierając kolejne generowanie na krótkim, końcowym oknie wcześniejszego obrazu i dźwięku. Pozwala to kontynuować przemieszczanie się po scenie, ale nie oznacza utrzymywania trwałej, jawnej reprezentacji 3D całego świata.
To istotne ograniczenie. Bez trwałej pamięci trójwymiarowej w dłuższej eksploracji mogą narastać błędy przestrzenne lub wizualne odchylenia od wcześniejszej sceny. Raportowane wyniki pokazują mocne strony modelu w interakcji i spójności w benchmarku, lecz ciągłość oparta na ograniczonym kontekście nadal jest praktycznym problemem przy długiej nawigacji. 1
11
Towarzysząca premierze praca badawcza opisuje silnik danych świata oraz etapowy proces treningu. Wykorzystano dzienniki rozgrywek, nagrania ludzi grających, symulacje w Unreal Engine z kontrolą pozycji oraz materiały wideo z internetu. Celem było połączenie sterowalnego ruchu kamery, dynamiki obrazu i zsynchronizowanego generowania dźwięku w jednym modelu. 1
Artykuł JD prowadzi do publicznego repozytorium kodu jd-opensource/JoyAI-Echo, co czyni projekt interesującym dla badaczy i programistów eksperymentujących z interaktywnymi modelami świata. 1
EchoWM zaprezentowano jako część większego programu JD związanego z physical AI, czyli rozwiązaniami AI działającymi w powiązaniu ze światem fizycznym — od danych i mocy obliczeniowej po modele i logistykę. JD Cloud deklaruje plan budowy krajowego klastra 100 000 GPU do treningu dużych modeli, wnioskowania i zadań związanych z AI ucieleśnioną. Firma chce też zebrać ponad 10 mln godzin nagrań pokazujących rzeczywistą aktywność ludzi. 18
22
Operacyjną stroną tej strategii ma być Meta Brain 3.0 w JD Logistics. Według JD system koordynuje decyzje dotyczące magazynowania, transportu i dostaw, skracając obliczanie optymalnych tras dla setek milionów przesyłek z minut do sekund. 18
22
W tym ujęciu udostępnienie EchoWM należy traktować przede wszystkim jako ruch w stronę otwartych modeli i infrastruktury badawczej dla interaktywnych systemów AI oraz physical AI, a nie jako komunikat o finansowaniu. Najważniejsza propozycja techniczna jest czytelna: połączyć sterowaną nawigację kamery z jednoczesnym generowaniem obrazu i dźwięku, przy zachowaniu świadomości, że długoterminowa spójność świata pozostaje nierozwiązanym wyzwaniem. 1
11
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
JD podczas JDD 2026 udostępniło jako open source model JoyAI EchoWM oraz czteroetapową, strumieniową wersję EchoWM Flash.
JD podczas JDD 2026 udostępniło jako open source model JoyAI EchoWM oraz czteroetapową, strumieniową wersję EchoWM Flash. System zamienia polecenia z klawiatury lub kontrolera na ciągłe trajektorie kamery w sześciu stopniach swobody, obsługując widok pierwszo i trzecioosobowy.
Premiera wpisuje się w strategię physical AI JD, obejmującą plan klastra 100 000 GPU i zebranie ponad 10 mln godzin nagrań rzeczywistych aktywności.