أعلنت JD في مؤتمر JDD 2026 إتاحة JoyAI‑EchoWM ونسخته الأخف EchoWM‑Flash مفتوحَي المصدر. تحوّل واجهة «نية الكاميرا» الموحدة أوامر لوحة المفاتيح أو وحدة التحكم إلى مسارات حركة مستمرة بست درجات حرية، لاستكشاف منظور الشخص الأول ولقطات الشخص الثالث.
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did JD.com announce at the September 10, 2026 JDDiscovery (JDD) conference about open-sourcing JoyAI-EchoWM—its interactive audiovisual. Article summary: JD announced that it is open-sourcing JoyAI‑EchoWM, an “enterable” interactive audiovisual world model, and EchoWM‑Flash, a faster four-step causal-streaming version. The release is best understood as part of JD’s physic. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
بدلاً من إنشاء مقطع فيديو ثابت ينتهي بعد ثوانٍ، تريد JD من JoyAI‑EchoWM أن يقدّم عالماً مولّداً يمكن للمستخدم «الدخول إليه» والتنقل فيه: تتحرك الكاميرا وفق أوامر المستخدم، وتتبدل الصورة والصوت معاً. وقد أعلنت الشركة خلال مؤتمر JDDiscovery (JDD) 2026 إتاحة النموذج مفتوح المصدر، إلى جانب EchoWM‑Flash، وهي نسخة أخف تعتمد البث السببي في أربع خطوات. 1
6
يولّد EchoWM فيديو بدقة 720p متزامناً مع أصوات البيئة والموسيقى والكلام. والفكرة ليست إلحاق مسار صوتي بفيديو مكتمل لاحقاً، بل تحديث العناصر المرئية والسمعية معاً بينما يغيّر المستخدم اتجاهه أو يتقدم داخل المشهد. 1
2
ويعتمد النموذج تمثيلاً موحداً يسمى «نية الكاميرا»؛ إذ يحوّل أوامر لوحة المفاتيح أو وحدة التحكم إلى مسارات متصلة للكاميرا بست درجات حرية (6‑DoF). ويتيح ذلك التجول بمنظور الشخص الأول، وكذلك منظور الشخص الثالث ولقطات تتبع الهدف. تؤثر مسارات الكاميرا في المخرجات البصرية، فيما يُفترض أن تقود أحداث المشهد إلى أصوات متسقة معها، مثل وقع الخطوات والاصطدامات والحوار والموسيقى. 1
11
تمثل EchoWM‑Flash النسخة ذات البث السببي بأربع خطوات، وغايتها خفض عدد خطوات أخذ العينات مع الإبقاء على توليد تفاعلي سريع الاستجابة. وفي نتائج ورقة البحث على 158 حالة ضمن WBench Navigation، سجّل EchoWM متوسط 81.7، بينما سجّل EchoWM‑Flash 81.0. وبلغت درجتا التفاعل والاتساق المعلنتان لـ EchoWM 87.2 و89.8 على الترتيب، في حين حققت Flash درجة تفاعل بلغت 87.9. 1
هذه مؤشرات معلنة من المطورين وورقة البحث، ولا تمثل تحققاً مستقلاً من جاهزية النموذجين لكل استخدامات الإنتاج الفوري. كما يسجل مستودع WBench منفصلاً نتيجة 81.6 لـ JoyAI‑Echo‑1.5 (WM)، و81.0 لنسخة Flash ذات الخطوات الأربع، وهو ما يفسر الفرق البسيط بين 81.6 و81.7 في التقارير المتاحة. 15
يدعم EchoWM الاستكشاف عبر جولات متعددة عبر تكييف التوليد اعتماداً على نافذة قصيرة من السياق السمعي البصري السابق. وهذا يتيح متابعة تسلسل التنقل، لكنه لا يعادل الاحتفاظ بتمثيل ثلاثي الأبعاد صريح ودائم للعالم.
ولهذا التفريق أثر عملي: ففي غياب ذاكرة ثلاثية الأبعاد مستمرة، قد يتراكم الانحراف المكاني أو البصري خلال الاستكشافات الطويلة. وتشير النتائج المعلنة من JD إلى أداء قوي في التفاعل والاتساق ضمن الاختبار، إلا أن الاستمرارية المبنية على السياق تظل قيداً محتملاً عند التنقل لفترات طويلة. 1
11
تصف الورقة البحثية محركاً لبيانات العوالم وخط تدريب مرحلياً يستخدم سجلات اللعب، ولقطات لعب بشرية، ومحاكاة مبنية على Unreal Engine تربط الوضعيات بالحركة، إضافة إلى فيديوهات من الإنترنت. والهدف هو وصل حركة الكاميرا القابلة للتحكم بالديناميكيات البصرية وتوليد الصوت المتزامن في نموذج واحد. 1
وترتبط الورقة بمستودع الشفرة البرمجية العام jd-opensource/JoyAI-Echo، ما يجعل الإصدار مهماً للباحثين والمطورين الذين يختبرون أنظمة نماذج العوالم التفاعلية. 1
قُدّم EchoWM كجزء من مسعى أوسع لدى JD للذكاء الاصطناعي المادي، يشمل البيانات والحوسبة والنماذج وعمليات الخدمات اللوجستية. وقالت JD Cloud إنها تخطط لبناء عنقود حوسبة محلي يضم 100,000 وحدة GPU لتدريب النماذج الكبيرة والاستدلال وأحمال الذكاء الاصطناعي المتجسد، وجمع أكثر من 10 ملايين ساعة من الفيديو لأنشطة بشرية في العالم الواقعي. 18
22
وفي الجانب التشغيلي من هذا التوجه، تنسّق منصة Meta Brain 3.0 التابعة لـ JD Logistics القرارات في التخزين والنقل والتسليم. ووفقاً للشركة، خفّض النظام زمن حساب المسارات المثلى لمئات الملايين من الطرود من دقائق إلى ثوانٍ. 18
22
لذلك، يُفهم إصدار EchoWM على نحو أدق بوصفه خطوة في النماذج المفتوحة وبنية البحث والتطوير للذكاء الاصطناعي التفاعلي والمادي، لا إعلاناً للتمويل. وأبرز فكرته التقنية هي جمع التنقل القابل للتحكم بالكاميرا مع توليد الفيديو والصوت معاً، مع بقاء اتساق العالم على المدى الطويل تحدياً مفتوحاً. 1
11
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أعلنت JD في مؤتمر JDD 2026 إتاحة JoyAI‑EchoWM ونسخته الأخف EchoWM‑Flash مفتوحَي المصدر.
أعلنت JD في مؤتمر JDD 2026 إتاحة JoyAI‑EchoWM ونسخته الأخف EchoWM‑Flash مفتوحَي المصدر. تحوّل واجهة «نية الكاميرا» الموحدة أوامر لوحة المفاتيح أو وحدة التحكم إلى مسارات حركة مستمرة بست درجات حرية، لاستكشاف منظور الشخص الأول ولقطات الشخص الثالث.
يأتي الإصدار ضمن توجه JD للذكاء الاصطناعي المادي، إلى جانب خطة عنقود حوسبة محلي من 100,000 وحدة GPU وجمع أكثر من 10 ملايين ساعة من فيديوهات أنشطة بشرية واقعية.