JD는 JDD 2026에서 JoyAI EchoWM과 4단계 경량 모델 EchoWM Flash를 오픈소스로 공개했다. 통합 ‘카메라 의도’ 인터페이스는 키보드·컨트롤러 입력을 연속적인 6자유도(6 DoF) 카메라 궤적으로 바꿔 1인칭 탐색과 3인칭 시점을 지원한다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did JD.com announce at the September 10, 2026 JDDiscovery (JDD) conference about open-sourcing JoyAI-EchoWM—its interactive audiovisual. Article summary: JD announced that it is open-sourcing JoyAI‑EchoWM, an “enterable” interactive audiovisual world model, and EchoWM‑Flash, a faster four-step causal-streaming version. The release is best understood as part of JD’s physic. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
JD가 생성형 영상에 ‘들어가서’ 움직일 수 있는 시청각 세계 모델을 오픈소스로 내놨다. 핵심은 JoyAI-EchoWM과 더 가벼운 EchoWM-Flash다. 미리 완성된 동영상 한 편을 만드는 대신, 사용자가 장면 안에서 방향을 바꾸거나 이동하면 화면과 소리가 함께 이어서 생성되는 방식을 지향한다. 1
6
EchoWM은 720p 영상과 환경음, 음악, 음성을 동기화해 생성하도록 설계됐다. 사용자가 장면을 탐색할 때 영상만 바뀌는 것이 아니라, 카메라와 장면의 변화에 맞춰 소리도 함께 진화하는 것이 목표다. 1
2
이를 위해 모델은 통합 ‘카메라 의도(camera-intent)’ 표현을 사용한다. 키보드나 컨트롤러의 명령을 연속적인 6자유도(6-DoF) 카메라 궤적으로 변환해 1인칭 이동은 물론 3인칭·팔로우 시점도 다룬다. 카메라 경로는 시각 결과를 조건화하고, 장면에서 일어난 사건은 발소리·충돌음·대화·음악처럼 대응하는 소리로 이어지도록 설계됐다. 1
11
즉, 별도의 음원을 나중에 덧입히기보다 탐색과 시청각 생성을 하나의 상호작용으로 묶겠다는 접근이다.
EchoWM-Flash는 4단계 인과 스트리밍 버전이다. 샘플링 단계를 줄여, 상호작용 중 더 빠르게 반응하는 생성에 초점을 맞춘 모델이다.
논문이 제시한 158개 사례의 WBench Navigation 평가에서 EchoWM의 평균 점수는 81.7, EchoWM-Flash는 81.0이었다. EchoWM의 상호작용 점수와 일관성 점수는 각각 87.2점, 89.8점으로 보고됐고, Flash의 상호작용 점수는 87.9점이었다. 1
다만 이 수치는 논문 및 개발 측이 보고한 벤치마크 결과다. 모든 실시간 상용 제작 환경에서의 준비도를 독립적으로 입증하는 결과로 받아들이기는 어렵다. 별도 WBench 저장소에는 JoyAI-Echo-1.5(WM)가 81.6점, 4단계 Flash 버전이 81.0점으로 기재돼 있어 EchoWM 점수에 81.6~81.7이라는 작은 표기 차이가 있다. 15
EchoWM은 짧은 구간의 직전 시청각 컨텍스트를 바탕으로 다음 생성을 이어 가는 방식으로 다중 턴 탐색을 지원한다. 하지만 이는 세계 전체를 명시적 3D 구조로 영구 저장·유지하는 것과는 다르다.
이 차이는 장기 탐색에서 중요하다. 지속적인 3D 메모리가 없기 때문에 탐색 시간이 길어질수록 공간 관계나 시각적 요소가 조금씩 어긋나는 드리프트가 누적될 수 있다. JD가 제시한 평가에서는 상호작용성과 일관성에서 강점을 보였지만, 긴 시간 동안 세계의 일관성을 유지하는 문제는 여전히 과제로 남아 있다. 1
11
동반 논문은 게임 플레이 로그, 사람이 직접 플레이한 영상, Unreal Engine 기반의 포즈 정합 시뮬레이션, 인터넷 영상 등을 활용하는 월드 데이터 엔진과 단계적 학습 과정을 설명한다. 목표는 제어 가능한 카메라 움직임, 시각적 변화, 동기화된 오디오 생성을 하나의 모델 안에서 연결하는 것이다. 1
JD는 논문에서 공개 코드 저장소인 jd-opensource/JoyAI-Echo를 연결했다. 인터랙티브 세계 모델을 실험하려는 연구자와 개발자에게는 코드 공개 자체가 이번 발표의 중요한 부분이다. 1
이번 모델 공개는 데이터, 컴퓨팅, 모델, 물류 운영을 아우르는 JD의 더 큰 피지컬 AI 추진 구상 안에 놓여 있다. JD Cloud는 대규모 모델 학습·추론과 임바디드 AI 작업을 위해 자국산 기반의 10만 GPU 클러스터를 구축할 계획이며, 현실에서 이뤄지는 인간 활동을 담은 영상 1,000만 시간 이상을 수집하겠다고 밝혔다. 18
22
물류 현장에서는 JD Logistics의 Meta Brain 3.0가 그 전략의 운영 측면에 해당한다. JD에 따르면 이 시스템은 창고, 운송, 배송 전반의 의사결정을 조율하며, 수억 개 소포의 최적 경로 계산 시간을 분 단위에서 초 단위로 단축한다. 18
22
따라서 EchoWM은 투자 유치 발표라기보다, 인터랙티브·피지컬 AI 개발을 위한 공개 모델 및 연구 인프라 행보로 보는 편이 적절하다. 통제 가능한 카메라 탐색과 영상·사운드의 공동 생성을 결합했다는 점이 핵심 제안이며, 장기적인 세계 일관성은 아직 풀어야 할 문제로 남아 있다. 1
11
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
JD는 JDD 2026에서 JoyAI EchoWM과 4단계 경량 모델 EchoWM Flash를 오픈소스로 공개했다.
JD는 JDD 2026에서 JoyAI EchoWM과 4단계 경량 모델 EchoWM Flash를 오픈소스로 공개했다. 통합 ‘카메라 의도’ 인터페이스는 키보드·컨트롤러 입력을 연속적인 6자유도(6 DoF) 카메라 궤적으로 바꿔 1인칭 탐색과 3인칭 시점을 지원한다.
이번 공개는 10만 GPU 규모의 자국산 컴퓨팅 클러스터와 1,000만 시간 이상의 현실 활동 영상 데이터 수집 계획을 포함한 JD의 피지컬 AI 전략과 맞물려 있다.