JD a annoncé l’ouverture de JoyAI EchoWM et d’EchoWM Flash, sa version causale en flux continu à quatre étapes, lors de JDD 2026. L’interface d’« intention de caméra » convertit les commandes au clavier ou à la manette en trajectoires continues à six degrés de liberté, pour naviguer à la première ou à la troisième p...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did JD.com announce at the September 10, 2026 JDDiscovery (JDD) conference about open-sourcing JoyAI-EchoWM—its interactive audiovisual. Article summary: JD announced that it is open-sourcing JoyAI‑EchoWM, an “enterable” interactive audiovisual world model, and EchoWM‑Flash, a faster four-step causal-streaming version. The release is best understood as part of JD’s physic. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
JD a fait de l’ouverture de JoyAI-EchoWM l’une des annonces centrales de sa conférence JDDiscovery (JDD) 2026. Le groupe a également publié EchoWM-Flash, une version plus légère, causale et conçue pour le streaming en quatre étapes. L’objectif n’est pas de produire une simple séquence vidéo figée : ces modèles doivent permettre à l’utilisateur de parcourir une scène générée, tandis que l’image et le son évoluent de concert. 1
6
EchoWM génère une vidéo en 720p accompagnée de sons ambiants, de musique et de parole synchronisés. L’ambition est celle d’un monde « dans lequel on peut entrer » : lorsque l’utilisateur tourne, avance ou change de point de vue, le modèle actualise non seulement les images, mais aussi la bande sonore, au lieu d’ajouter du son après coup. 1
2
Son dispositif central est une représentation unifiée de l’intention de caméra. Les commandes au clavier ou à la manette sont converties en trajectoires continues à six degrés de liberté (6-DoF). Cette interface sert aussi bien à l’exploration à la première personne qu’aux vues à la troisième personne ou de type caméra suiveuse. La trajectoire de caméra guide la génération visuelle ; les événements de la scène doivent, eux, s’accompagner de sons cohérents, par exemple des pas, des chocs, des dialogues ou de la musique. 1
11
EchoWM-Flash est la variante causale de streaming en quatre étapes. Elle vise à diminuer le nombre d’étapes d’échantillonnage tout en conservant une génération suffisamment réactive pour l’interaction.
Dans les résultats publiés par les auteurs sur les 158 cas de navigation de WBench, EchoWM obtient une moyenne de 81,7, contre 81,0 pour EchoWM-Flash. EchoWM affiche des scores de 87,2 en interaction et de 89,8 en cohérence ; Flash atteint 87,9 pour l’interaction. 1
Ces chiffres sont des résultats de benchmark communiqués dans l’article et par les développeurs : ils ne constituent pas une validation indépendante de l’aptitude des modèles à tous les usages de production en temps réel. Le dépôt WBench indique, de son côté, 81,6 pour JoyAI-Echo-1.5 (WM) et 81,0 pour sa version Flash à quatre étapes, ce qui explique l’écart limité entre les valeurs de 81,6 et 81,7 selon les sources. 15
EchoWM prend en charge l’exploration sur plusieurs tours en conditionnant chaque génération sur une courte fenêtre de contexte audiovisuel récente. Cela permet de prolonger une navigation, mais ne revient pas à conserver une représentation 3D explicite et persistante du monde.
Cette nuance est importante : sans mémoire 3D persistante, les longues explorations peuvent accumuler des dérives spatiales ou visuelles. Les résultats rapportés par JD mettent en avant les performances d’interaction et de cohérence sur le benchmark, mais la continuité fondée sur le contexte reste une limite pratique pour les navigations prolongées. 1
11
Les travaux de recherche associés décrivent un moteur de données sur les mondes et un entraînement progressif à partir de journaux de jeu, de vidéos de personnes en train de jouer, de simulations Unreal Engine ancrées sur des poses, ainsi que de vidéos issues d’Internet. L’enjeu est de relier dans un même modèle le contrôle des mouvements de caméra, les dynamiques visuelles et la génération audio synchronisée. 1
L’article de JD renvoie vers le dépôt de code public jd-opensource/JoyAI-Echo, ce qui rend la publication pertinente pour les chercheurs et développeurs qui expérimentent les modèles de mondes interactifs. 1
EchoWM a été présenté comme l’un des éléments d’un effort plus large de JD dans l’IA physique, couvrant les données, la puissance de calcul, les modèles et les opérations logistiques. JD Cloud prévoit de bâtir un cluster domestique de 100 000 GPU destiné à l’entraînement et à l’inférence de grands modèles, ainsi qu’aux charges de travail d’IA incarnée. Le groupe prévoit aussi de collecter plus de 10 millions d’heures de vidéos montrant des activités humaines réelles. 18
22
Dans la logistique, Meta Brain 3.0 de JD Logistics est présenté comme le pendant opérationnel de cette stratégie. Selon JD, le système coordonne les décisions entre entrepôts, transport et livraison, et ramène de plusieurs minutes à quelques secondes le calcul des itinéraires optimaux pour des centaines de millions de colis. 18
22
Dans ce contexte, l’ouverture d’EchoWM relève avant tout d’une initiative de modèle ouvert et d’infrastructure de recherche pour l’IA interactive et physique, non d’une annonce de financement. Sa proposition technique est simple : associer une navigation de caméra contrôlable à la génération conjointe de vidéo et de son — tout en reconnaissant que la cohérence d’un monde sur de longues séquences reste un problème ouvert. 1
11
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
JD a annoncé l’ouverture de JoyAI EchoWM et d’EchoWM Flash, sa version causale en flux continu à quatre étapes, lors de JDD 2026.
JD a annoncé l’ouverture de JoyAI EchoWM et d’EchoWM Flash, sa version causale en flux continu à quatre étapes, lors de JDD 2026. L’interface d’« intention de caméra » convertit les commandes au clavier ou à la manette en trajectoires continues à six degrés de liberté, pour naviguer à la première ou à la troisième personne.
Cette publication s’inscrit dans la stratégie d’IA physique de JD, qui prévoit notamment un cluster domestique de 100 000 GPU et plus de 10 millions d’heures de vidéos d’activités réelles.