الإطلاق الكامل لـXiaomi Robotics U0 جرى في 15 يوليو/تموز 2026، وهو نموذج عالمي متجسّد مفتوح بـ38 مليار معلمة لإنتاج وتعديل بيانات تدريب اصطناعية للروبوتات، وليس نموذجاً لإصدار أوامر الحركة. يتضمن المشروع الأوزان وأدوات الاستدلال وواجهات Gradio ومسارات AR وFlashAR بترخيص Apache 2.0؛ ثم أضيفت في سبتمبر/أيلول أوزان 4B...
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
تاريخ السؤال يخلط بين تحديثين. فقد أُعلن الإصدار الكامل من Xiaomi-Robotics-U0 في 15 يوليو/تموز 2026، بينما أعلن مستودع المشروع في سبتمبر/أيلول إضافة أوزان أصغر بحجم 4B وأوزان للنماذج التسلسلية، إلى جانب كود تدريب FSDP. 7
9
ببساطة، Xiaomi-Robotics-U0 هو نظام توليدي مفتوح لإنتاج بيانات اصطناعية قابلة للتحكم لتدريب الروبوتات. يستطيع إنشاء مشاهد مرئية تتمحور حول الروبوت أو تعديلها، مع محاولة الحفاظ على ما يهم التدريب، مثل منظور الكاميرا وسياق المناولة واتساق المشهد. لكنه ليس سياسة تحكم تحول ملاحظات الروبوت مباشرةً إلى أفعال وحركات. 1
6
النموذج الرئيسي U0 هو نموذج عالمي متعدد الوسائط وذاتي الانحدار، يضم 38 مليار معلمة. ويتضمن الإصدار المفتوح أوزان النموذج، وكود المصدر والاستدلال، وإعدادات قابلة للتركيب، وواجهات Gradio، وتصحيحات للاستدلال الذاتي الانحدار وFlashAR/vLLM. ويحمل المستودع ترخيص Apache-2.0. 2
4
9
وفي سبتمبر/أيلول، أدرجت شاومي ثلاثة إصدارات إضافية: Xiaomi-Robotics-U0-4B وXiaomi-Robotics-U0-Sequence وXiaomi-Robotics-U0-4B-Sequence، فضلاً عن كود تدريب FSDP. لذلك لم يعد اسم U0 يقتصر على نقطة تحقق واحدة كبيرة، بل يشير إلى عائلة نماذج آخذة في التوسع. 9
فكرة U0 الأساسية هي جمع مهام متعددة في بنية واحدة. ووفقاً لشاومي، يدعم النموذج:
وتبرز فائدته العملية في توسيع البيانات: يمكن البدء بمسار أو ملاحظة حقيقية لروبوت، ثم تغيير الخلفية أو الإضاءة أو المواد أو الأشياء للحصول على أمثلة تدريب جديدة، بدلاً من إعادة جمع كل حالة في العالم الحقيقي. 3
7
وهذا ما يميّزه عن مولد صور تقليدي هدفه إنتاج صورة جذابة بذاتها؛ إذ تركز شاومي هنا على تغيير مضبوط مع الاحتفاظ بالهندسة وسياق التفاعل اللذين يحتاجهما الروبوت. 3
7
U0 نموذج بصري ذاتي الانحدار: يولّد رموزاً بصرية منفصلة بالتتابع، بدلاً من عملية إزالة الضجيج التكرارية المرتبطة عادةً بنماذج الانتشار في توليد الصور. وتشير التقارير إلى أن أساسه يجمع EMU3.5 وQwen-3-32B، ويستخدم محلّل رموز بصرية منفصلاً ومشتركاً عبر المهام المدعومة. 4
7
هذه الطريقة تلائم التعامل مع الصور والملاحظات والتسلسلات الزمنية كسلاسل من الرموز، لكن توليد صور عالية الدقة يكون مكلفاً حين يجب إنتاج الرموز واحداً بعد آخر. ولهذا السبب تقرن شاومي النموذج بمسار استدلال مُسرّع. 1
5
FlashAR+ هي آلية شاومي لتسريع فك ترميز الرموز البصرية. فبدلاً من توليد كل رمز بصورة متسلسلة صارمة، تعتمد توليداً متوازياً على الأقطار المضادة. وفوقها، يُستخدم vLLM لإدارة البادئات الشرطية والتجميع وإدارة ذاكرة KV المقسمة إلى صفحات، مع الإبقاء على قاعدة فك ترميز FlashAR+. 1
9
أفادت شاومي بأن FlashAR مع vLLM ولّد صورة في 5.44 ثوانٍ على معالج H20 واحد، ووصفت ذلك بأنه أسرع 82.86 مرة من تطبيقها الأصلي للاستدلال الذاتي الانحدار بنمط eager، وأسرع 3.04 مرات من FlashAR eager. 7
لكن المقارنة هنا مهمة: الرقم يقيس الأداء أمام خط أساس ذاتي الانحدار خاص بشاومي وفي إعدادها المُعلن. ولا يعني أن U0 أسرع 83 مرة من مولدات الصور القائمة على الانتشار، أو من جميع خطوط إنتاج بيانات الروبوتات، أو من أنظمة الفيديو الرائدة. فالعتاد، وإعدادات الصورة، والتجميع، ومسار النموذج، ونوع الحمل التشغيلي كلها تغير الأداء الفعلي. 1
7
يدعم المستودع نمطي eager وvLLM لاستدلال AR وFlashAR، لكن ذلك لا يضمن دعماً أو أداءً متطابقين لكل الإمكانات عبر كل محرك. ومن يخطط لاستخدام سير عمل زمني أو متعدد الوسائط متخصص، عليه اختبار نقطة التحقق ومسار الاستدلال المقصودين عملياً. 9
| فئة النظام | الغرض الأساسي | موقع U0 بينها |
|---|---|---|
| سياسات الروبوت | تحويل ملاحظات الروبوت إلى أفعال | U0 أداة لإنتاج البيانات وتوسيعها قبل التدريب، لا بديل عن سياسة التحكم. وتتمثل قيمته المعلنة لاحقاً في تحسين تدريب السياسات أمام تغير توزيع البيانات. |
| النماذج العالمية أو نماذج البيانات المتمحورة حول الروبوت | إنتاج مشاهد الروبوت وملاحظاته ومساراته أو بيانات شبيهة بالمحاكاة | تقول شاومي إن الفارق هو نموذج واحد يجمع تركيب المشهد ونقله وتحريره ومحاكاة التسلسل الموجهة للفيديو. |
| مولدات الصور العامة | إنشاء الصور وتحريرها لأغراض واسعة | يدعم U0 النص إلى الصورة والصورة إلى الصورة، لكن تركيز شاومي هو الاتساق المتجسّد، لا ادعاء تفوق عام ومستقل في جودة الصور. |
| مولدات الفيديو العامة | فيديو واقعي أو سينمائي متعدد الأغراض | قدرة الفيديو في U0 موجهة للروبوتات، ولا تُثبت تفوقه على نماذج الفيديو العامة الرائدة في جودة الفيديو المفتوح الاستخدام. |
تقول شاومي إن U0 جاء أولاً في معيار WorldArena، وسط 126 نموذجاً مشاركاً في التقييم المُعلن، وتبرز امتثال التعليمات وجودة التفاعل والاتساق بين زوايا الرؤية. كما تقول صفحة المشروع الرسمية إنه يتصدر أكثر من 100 نموذج. 7
10
وفي اختبارات الروبوتات اللاحقة، أفادت شاومي بأن إضافة بيانات اصطناعية مولدة بواسطة U0 رفعت نسبة النجاح خارج التوزيع على روبوت حقيقي من 36.9% إلى 63.2%، في حالات مثل الإضاءة أو الخلفيات غير المألوفة. 6
7
تدعم هذه النتائج بالدرجة الأولى استخدام U0 كموسّع للبيانات الاصطناعية، لكنها تبقى نتائج صادرة عن المشروع نفسه. فصدارة WorldArena وحدها لا تثبت تفوقاً في كل روبوت أو سياسة أو مهمة أو محاكي أو معيار عام للصور والفيديو. ولإعادة الإنتاج بشكل مستقل، يلزم معرفة إصدار النموذج الدقيق، والمطالبات، وإعدادات أخذ العينات، وبروتوكول التقييم، وطريقة احتساب النتائج، وإصدارات النماذج المقارنة. 7
10
يُسهّل ترخيص Apache-2.0 للمستودع والأوزان وأدوات الاستدلال وصول المطورين إلى U0، شرط توافر قدرة حوسبة كافية. ومع ذلك، ينبغي مراجعة الترخيص ووثائق كل نقطة تحقق، والتحقق من مصدر البيانات وشروط استخدام بيانات التدريب الأصلية والبيانات الاصطناعية الناتجة. 4
9
الفيديو جزء من مجموعة القدرات المعلنة، لكن المواد المتاحة لا تثبت أن نقاط تحقق الفيديو ومسارات تسريعها وبيانات تدريبها وإجراءات تقييمها كانت متكاملة وقابلة لإعادة الإنتاج بالقدر نفسه عند إطلاق يوليو/تموز. لذلك تبدو مسارات الصور ونقل المشاهد هي الأكثر توثيقاً، ومن الأفضل التحقق من سير عمل الفيديو المحدد قبل البناء عليه. 4
6
أهمية Xiaomi-Robotics-U0 لا تأتي من كونه بديلاً عن التحكم بالروبوت أو نماذج الوسائط العامة، بل من فتحه خط إنتاج موحّداً وكبيراً، ذاتي الانحدار، لإنتاج بيانات بصرية اصطناعية قابلة للتحكم ومرتبطة فعلياً باحتياجات الروبوتات. ويوفر النموذج الرئيسي بـ38 مليار معلمة، والأوزان الأصغر اللاحقة، والأدوات العامة، ومسار FlashAR+/vLLM نقطة انطلاق عملية للباحثين وفرق الروبوتات لتوسيع البيانات. 7
9
أما أبرز الأرقام المعلنة — تسريع داخلي بمقدار 82.86 مرة، وصدارة WorldArena، ورفع نجاح السياسة خارج التوزيع من 36.9% إلى 63.2% — فهي مشجعة، لكن يجب اختبارها على الروبوت والعتاد وحجم العمل وبروتوكول التقييم المستهدف قبل تعميمها. 7
10
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
الإطلاق الكامل لـXiaomi Robotics U0 جرى في 15 يوليو/تموز 2026، وهو نموذج عالمي متجسّد مفتوح بـ38 مليار معلمة لإنتاج وتعديل بيانات تدريب اصطناعية للروبوتات، وليس نموذجاً لإصدار أوامر الحركة.
الإطلاق الكامل لـXiaomi Robotics U0 جرى في 15 يوليو/تموز 2026، وهو نموذج عالمي متجسّد مفتوح بـ38 مليار معلمة لإنتاج وتعديل بيانات تدريب اصطناعية للروبوتات، وليس نموذجاً لإصدار أوامر الحركة. يتضمن المشروع الأوزان وأدوات الاستدلال وواجهات Gradio ومسارات AR وFlashAR بترخيص Apache 2.0؛ ثم أضيفت في سبتمبر/أيلول أوزان 4B ونماذج تسلسلية وكود تدريب FSDP.
تقول شاومي إن النموذج تصدّر WorldArena وحسّن نجاح سياسة روبوت حقيقي خارج التوزيع من 36.9% إلى 63.2%، لكنها نتائج معلنة من المشروع وليست إثباتاً مستقلاً لتفوّق شامل.