انتقل يو كاي تشنغ من أبحاث AutoML وإدراك المركبات ذاتية القيادة إلى نماذج العالم والذكاء الفيزيائي. تقوم رؤية Awomo على التنبؤ بحالة منظمة من المفاهيم الفيزيائية القابلة لإعادة التركيب بدل إعادة إنتاج المشهد بكسلًا بكسل.
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
لم يكن تحول يو كاي تشنغ رفضًا للإدراك البصري أو للبيانات واسعة النطاق. بل قاده العمل على نماذج العالم إلى استنتاج مختلف: عندما يستطيع النظام توليد مشاهد واقعية، فإن الاستمرار في توقع كل بكسل قد يصبح هدفًا وسيطًا مكلفًا لا يخدم التحكم واتخاذ القرار مباشرة. البديل الذي تقترحه Awomo هو أن تكون «الحالة المتنبأ بها» سجلًا منظمًا لمفاهيم فيزيائية—أجسام، حالات، علاقات، أفعال وتغيرات سببية—يمكن للوكيل إعادة تركيبها والتخطيط داخلها من دون الحاجة إلى رسم فيديو كامل في كل خطوة. 1
10
بدأ يو كاي تشنغ مسيرته البحثية في مجال التعلم الآلي الآلي أو AutoML، أي تطوير أنظمة تساعد في تصميم خوارزميات التعلم وتحسينها. وبعد حصوله على الدكتوراه، انضم إلى أكاديمية DAMO التابعة لعلي بابا عبر برنامج «علي بابا ستار»، ثم انتقل إلى أبحاث الإدراك البصري للقيادة الذاتية.
كان من أبرز أعماله إطار BEVFusion، الذي يجمع بيانات كاميرات السيارات وبيانات الليدار—وهو مستشعر يعتمد على نبضات الليزر لبناء معلومات ثلاثية الأبعاد—في تمثيل موحد من منظور علوي للبيئة. وقد وُصفت هذه المساهمة لاحقًا بأنها من الأعمال واسعة الاستشهاد في مجال دمج المستشعرات متعددة الوسائط. 10
في عام 2023، انتقل يو إلى جامعة ويستليك وأسّس مختبر الذكاء الذاتي AutoLab. بدأ الفريق أولًا باستكشاف نماذج عالم توليدية للقيادة الذاتية، ثم حقق المركز الأول في مسابقة للقيادة الذاتية ضمن ECCV عام 2024، وتصدر ترتيب Fail2Drive في عام 2026، وفقًا للتغطية المعاصرة. 10
لكن هذه النجاحات قادته إلى سؤال أكثر جوهرية: إذا كان النموذج يفهم بالفعل ما الذي قد يحدث بعد تنفيذ فعل معين، فلماذا يستهلك قدرًا هائلًا من الحوسبة لإعادة بناء كل التفاصيل المرئية؟ فالسؤال المفيد للروبوت أو السيارة ليس فقط «كيف ستبدو الصورة التالية؟»، بل «ماذا سيتغير إذا تحركت أو اصطدمت أو أمسكت بهذا الجسم؟». 1
10
في أواخر عام 2024، أفادت التقارير بأن الفريق غيّر مساره من توليد البكسلات إلى فضاء كامن رياضي يُتعلَّم من طرف إلى طرف. والفضاء الكامن هو تمثيل داخلي مضغوط لا يطابق الصورة مباشرة، بل يحاول الاحتفاظ بالمعلومات الأكثر فائدة للتنبؤ.
تريد Awomo أن يُحلِّل النموذج المشهد إلى عدد محدود من المفاهيم الفيزيائية القابلة لإعادة الاستخدام، ثم يعيد تركيبها للتنبؤ بالحالة التالية—بما في ذلك تركيبات لم تظهر كاملة في بيانات التدريب. 1
ولا تعني كلمة «ضمني» هنا أن التمثيل غامض أو بلا بنية. فادعاء الشركة هو أن الفضاء الكامن ينبغي أن يشفّر عناصر مثل:
الميزة المنشودة هي التعميم التركيبي: إذا تعلّم النظام مفهومَي «الكوب» و«السقوط» كلٌّ على حدة، فقد يتمكن من الاستدلال على موقف جديد يجمع بينهما، بدل الحاجة إلى مشاهدة أمثلة منفصلة لكل سيناريو كامل. ومن هنا يرى يو أن إضافة مزيد من بيانات نماذج الرؤية-اللغة-الفعل، أو المزيد من العروض البشرية، ستواجه في النهاية عوائد متناقصة عندما يتعلق الأمر بالذكاء الفيزيائي. 1
تنتمي هذه المقاربة إلى العائلة الأوسع نفسها التي ينتمي إليها إطار JEPA المرتبط بيان لوكون: التنبؤ بتمثيل داخلي بدل إعادة بناء البكسلات مباشرة. 1
لكن Awomo تدّعي اختلافًا دلاليًا ومعماريًا. فبحسب طرح يو، لا يحدد JEPA بصورة صريحة ما الذي ينبغي أن تمثله المتغيرات داخل الفضاء الكامن، بينما يحاول «نموذج العالم المفاهيمي» بناء مفردات قابلة للتركيب من المفاهيم الفيزيائية.
مع ذلك، ينبغي التعامل مع هذا الفرق بوصفه فرضية بحثية واعدة، لا ميزة ثبت تفوقها بصورة مستقلة حتى الآن. 1
قالت Awomo إن تجاربها الداخلية خلال عام 2025 أظهرت أن تفكيك المفاهيم وربطها حسّن معدل النجاح في المهام المعقدة مقارنة بخطوط أساس قائمة على التعلم بالتقليد والتعلم المعزز، مع خفض تكلفة التنبؤ. 1
لكن التقارير العامة المتاحة لا تتضمن بروتوكولًا تجريبيًا كاملًا، أو أحجام النماذج، أو توزيع المهام، أو معدلات نجاح رقمية مفصلة، أو فواصل ثقة، أو دراسات إزالة للعناصر، أو شيفرة مصدرية، أو إعادة تنفيذ مستقلة. لذلك فإن حجم التفوق المعلن لا يزال غير مدعوم علنًا بأدلة كافية. 1
ويشرح مثال «التقاط كوب يسقط أثناء إغلاق باب» الفائدة المقصودة من هذا النهج: تمثيل عدة انتقالات متزامنة في الحالة والقيود السببية التي تربط بينها، بدل اختيار حركة اعتمادًا على أنماط محفوظة من مجموعة عروض سابقة. لكنه يظل مثالًا تحفيزيًا من طرح يو، وليس نتيجة معيارية موثقة. 1
ترى هذه الرؤية أن نماذج VLA—أي النماذج التي تربط الرؤية واللغة بالفعل—يمكنها التعلم من عدد كبير من التعليمات والعروض، لكنها قد تبقى مقيدة بما رأته كوحدات كاملة من السيناريوهات. وكلما زادت تعقيدات العالم الفيزيائي، قد يصبح جمع أمثلة لكل مجموعة ممكنة من الأجسام والحالات والعلاقات والأفعال مكلفًا إلى حد كبير.
في المقابل، يفترض النهج المفاهيمي أن يتعلم النظام اللبنات الأساسية والعلاقات السببية بينها، ثم يستخدمها لبناء حالات جديدة. وهذا لا يعني أن التعميم سيحدث تلقائيًا، بل يحدد نوع القدرة التي تريد Awomo اختبارها: الانتقال من حفظ الأمثلة إلى تركيب سيناريوهات غير مألوفة داخل فضاء داخلي قابل للتخطيط.
تحولت الأبحاث إلى شركة Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd.، التي تستخدم العلامة التجارية Awomo. وسُجلت الشركة في منطقة شيهو بمدينة هانغتشو في 8 يناير 2026، وتقول إنها تستهدف الذكاء الفيزيائي في مجالات القيادة الذاتية، والروبوتات، والمعدات الصناعية، والأجهزة الذكية، وتوليد بيانات المحاكاة. 11
وتصف التقارير النواة الأولى للفريق بأنها ضمت يو وكبير العلماء تونغ، قبل أن تتوسع من فريق AutoLab في جامعة ويستليك. أما وصف بعض الزملاء بأنهم «عباقرة أثبتوا أنفسهم باستمرار»، فهو تعبير ترويجي لا يمثل مقياسًا مستقلًا يمكن التحقق منه. 1
وأعلنت Awomo عن إتمام جولات تمويل تأسيسية وملائكية تجاوز مجموعها 100 مليون يوان صيني. وسمّت الشركة من بين المستثمرين: InnoFund، وصندوق Dongfang Jiafu، وZhengxuan Investment، وTianqi Capital، وWestlake Innovation Fund، وJinma Investment. 13
قدّمت تغطية أغسطس 2026 نسخة Awomo-v0.1 بوصفها أول إصدار علني من مشروع نموذج العالم المفاهيمي، وأشارت إلى تقييمها على RoboTwin 2.0، وهو إطار محاكاة ومعيار لتوليد البيانات وتقييم مهام المناولة الروبوتية الثنائية، أي المهام التي تستخدم ذراعين أو يدين روبوتيتين. 1
3
يوفر ذلك منصة تقييم علنية مبكرة، لكنه لا يثبت وحده قدرة النموذج على التعميم مع روبوتات حقيقية، أو مستوى السلامة، أو التفوق على البدائل الرائدة. ولتقييم أكثر صرامة، ستكون هناك حاجة إلى نتائج معيارية منشورة، وخطوط أساس موحدة، وتفاصيل تجريبية قابلة لإعادة الإنتاج، ونتائج انتقال من المحاكاة إلى العالم الحقيقي.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
انتقل يو كاي تشنغ من أبحاث AutoML وإدراك المركبات ذاتية القيادة إلى نماذج العالم والذكاء الفيزيائي.
انتقل يو كاي تشنغ من أبحاث AutoML وإدراك المركبات ذاتية القيادة إلى نماذج العالم والذكاء الفيزيائي. تقوم رؤية Awomo على التنبؤ بحالة منظمة من المفاهيم الفيزيائية القابلة لإعادة التركيب بدل إعادة إنتاج المشهد بكسلًا بكسل.
تتشابه الفكرة مع JEPA في التنبؤ داخل الفضاء الكامن، لكنها تحاول تحديد محتوى هذا الفضاء بوصفه مجموعة من الأجسام والحالات والعلاقات والأفعال والتغيرات السببية.