تقول شاومي إن Pro وFlash أكملا 30 خطوة تدريب بالتعلّم المعزّز لكل منهما في أقل من ستة أيام، بتكلفة تقارب 2.62 مليون دولار و850 ألف دولار على التوالي.[2] استخدم كل تحديث 1,568 طلبًا و16 محاولة لكل طلب؛ أي 25,088 مسارًا محتملًا في الخطوة، ونحو 750 ألفًا لكل نموذج عبر 30 خطوة، لا للنموذجين مجتمعين.[2][4] النتائج المرحل...
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
تقول شاومي إن Pro وFlash أكملا 30 خطوة تدريب بالتعلّم المعزّز لكل منهما في أقل من ستة أيام، بتكلفة تقارب 2.62 مليون دولار و850 ألف دولار على التوالي.[2]
استخدم كل تحديث 1,568 طلبًا و16 محاولة لكل طلب؛ أي 25,088 مسارًا محتملًا في الخطوة، ونحو 750 ألفًا لكل نموذج عبر 30 خطوة، لا للنموذجين مجتمعين.[2][4]
النتائج المرحلية ومؤشرات النجاح في اللوحة تصف تشغيل شاومي وتقييمها؛ ولا تمثل تدقيقًا مستقلًا في كامل عملية تطوير النموذج.[18][25][45]
What does Xiaomi’s public MiMo-V2.6 Pro and Flash reinforcement-learning post-training dashboard show about the live runs’ steps, tokens, reIllustration; not a screenshot of Xiaomi’s training dashboard.
موجّه الذكاء الاصطناعي
Create a landscape editorial hero image for this Studio Global article: What does Xiaomi’s public MiMo-V2.6 Pro and Flash reinforcement-learning post-training dashboard show about the live runs’ steps, tokens, re. Article summary: Xiaomi’s dashboard exposed unusually detailed *post-training* reinforcement-learning telemetry for MiMo-V2.6 Pro and Flash—not their pretraining runs or a complete audit of every job on its infrastructure. The runs have . Topic tags: general, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, cha
openai.com
لم تكتفِ شاومي بنشر نتيجة نهائية لنموذجي MiMo-V2.6 Pro وFlash. فقد أتاحت لوحة عامة لمتابعة بيانات مرحلة التدريب اللاحق بالتعلّم المعزّز أثناء تشغيلها. وهذه نافذة على التشغيلين المعروضين، وليست سجلًا لتدريب النموذجين الأولي أو لكل ما جرى على بنية الشركة الحاسوبية.118
ماذا كان يظهر على اللوحة؟
عرضت اللوحة خطوات التدريب المكتملة، ومحاولات توليد الإجابات الجارية، وأعداد الرموز النصية المعالَجة، ومنحنيات المكافأة، ومعدلات اجتياز المهام، وزمن الخطوات، والتكلفة المتراكمة، إلى جانب تقييمات برمجية في مراحل وسيطة. وقد يختلف عدّاد خطوات التدريب عن عدّاد التوليد لأن إنتاج المحاولات كان يجري بصورة غير متزامنة مع تحديث النموذج.11822
ولم تقتصر البيانات على النتائج الجيدة: فقد وصفت تقارير حالات إعادة تشغيل محددة، وأخطاء نفاد ذاكرة المعالجات الرسومية، ومشكلات في مجموعات البيانات. كما تميّز تعريفات المؤشرات بين إخفاق المهمة وإخفاق المحاولة بسبب مشكلة في البنية التحتية. لكن ظهور هذه الحالات لا يثبت أن اللوحة عرضت كل حادثة تشغيلية.1823
في لقطة مبكرة، كان النموذجان عند خطوة التدريب العاشرة، بينما كانت خطوة التوليد السادسة عشرة جارية. وأظهرت اللقطة نحو 2.2 مليار رمز لكل خطوة في Pro و2.6 مليار في Flash، مع إنفاق متراكم يقارب 741 ألف دولار و322 ألف دولار على التوالي. هذه أرقام عند لحظة محددة، وليست التكلفة النهائية أو معدل إنفاق يوميًا ثابتًا.25
كيف نُظّمت المحاولات وتقييمها؟
استخدم كل تحديث 1,568 طلبًا، مع 16 محاولة لكل طلب؛ أي 25,088 مسارًا محتملًا للخطوة الواحدة. وأتاح التنفيذ غير المتزامن تداخل توليد المحاولات وتنفيذ المهام مع تقييمها وتحديث النموذج. وشمل التدريب مهام لوكلاء الذكاء الاصطناعي في البرمجة والعمل العام والمهام البصرية والأمن السيبراني، عبر بيئات وأطر تشغيل متعددة، بدل الاقتصار على نوع واحد من المهام.41019
ولم يكن التقييم مجرد حكم بالنجاح أو الفشل. فالنهج الموصوف يجمع نتائج الاختبارات القابلة للتنفيذ بمعايير جودة خاصة بكل مهمة، ويقارن المحاولات المرتبطة بالمهمة نفسها؛ وبذلك يمكن التمييز بين حلّين ناجحين متفاوتين في الجودة. ولهذا التقييم تكلفة حاسوبية أيضًا: يضع عرض لتقرير شاومي التقني حصته عند نحو 12.7% من تكلفة تدريب Pro بالتعلّم المعزّز.4447
أما وصف الخطوة بأنها تعالج «نحو ملياري رمز» فكان تقديرًا للحجم، لا سقفًا ثابتًا؛ إذ أوردت تقارير لاحقة أعدادًا أعلى من الرموز لكل خطوة.41920
ماذا تعني المكافآت ونتائج DeepSWE والتكلفة النهائية؟
تقيس مكافأة التدريب المسارات المستخدمة لتحديث النموذج، وليست بحد ذاتها اختبارًا مستقلًا لقدراته. وتعرّف اللوحة المؤشر dynsam/avg@n بأنه متوسط نسبة المحاولات الناجحة لكل طلب ضمن الطلبات المختارة في الخطوة. أما نسخته dynsam/avg@n_no_infra فتستبعد المحاولات التي فشلت لأسباب تتعلق بالبنية التحتية. تفيد المقارنة بينهما في عدم الخلط بين تعطل بيئة التشغيل وإخفاق النموذج، لكن أيًا منهما لا يقيس أداءه في جميع المهام الممكنة.18
وسجلت اللقطة المبكرة في اختبار DeepSWE v1.1 نتيجتي 62.24 لـPro و60.77 لـFlash؛ وهما نتيجتان لمرحلة وسيطة. وأعلنت شاومي لاحقًا أن نتيجتي نهاية التشغيل بلغتا نحو 72.6 و65.7 على التوالي. ينبغي قراءة هذه الأرقام ضمن إعداد التقييم الذي استخدمته شاومي، لا باعتبارها نتائج مستقلة أُعيد إنتاجها على لوحة صدارة عامة.251745
وبحسب شاومي، أكمل كل نموذج 30 خطوة في أقل من ستة أيام. وبلغت تكلفة تشغيل التعلم المعزّز المعلنة نحو 2.62 مليون دولار لـPro و850 ألف دولار لـFlash، أي قرابة 3.47 مليون دولار معًا. ومن الأدق فهم رقم «نحو 750 ألف مسار» على أنه لكل نموذج: فضرب 25,088 مسارًا محتملًا في 30 خطوة يعطي 752,640 مسارًا لكل تشغيل. ولا تشمل هذه النفقات المعلنة التدريب الأولي أو سائر أعمال تطوير النموذجين.244445
ما الذي تكشفه الشفافية، وما الذي يبقى مجهولًا؟
ما ميّز اللوحة عن الاكتفاء بإصدار نموذج مكتمل هو إظهار بيانات تدريب وتشغيل متتابعة أثناء سير العمل. وأعلنت شاومي بعد ذلك إتاحة أوزان Pro وFlash، ونموذج مُقطَّر بحجم 9 مليارات معلمة، وتقرير تقني، وأكثر من 7,000 بيئة مهام للتعلّم المعزّز، وإطار عمل لهذه المرحلة، وأدوات تشغيل مصغّرة قابلة للتركيب.115
لكن اللوحة لا تتيح، وحدها، التحقق استقلالًا من أن العرض كان متصلًا دون انقطاع أو انتقاء، ولا تكشف كل الأعمال التي ربما جرت بالتوازي على البنية التحتية. كذلك فإن الإعلان عن النموذج المُقطَّر لا يثبت أن عمليات تقطير غير معلنة جرت خلف تشغيلَي Pro وFlash المعروضين، أو أن تكلفتها دخلت في الأرقام المنشورة لهما.18152
Studio Global AI
مواصلة البحث الخاص بك
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
ما هي الإجابة المختصرة على "داخل لوحة تدريب MiMo-V2.6: ماذا تكشف أرقام شاومي؟"؟
تقول شاومي إن Pro وFlash أكملا 30 خطوة تدريب بالتعلّم المعزّز لكل منهما في أقل من ستة أيام، بتكلفة تقارب 2.62 مليون دولار و850 ألف دولار على التوالي.[2]
ما هي النقاط الأساسية التي يجب التحقق منها أولاً؟
تقول شاومي إن Pro وFlash أكملا 30 خطوة تدريب بالتعلّم المعزّز لكل منهما في أقل من ستة أيام، بتكلفة تقارب 2.62 مليون دولار و850 ألف دولار على التوالي.[2] استخدم كل تحديث 1,568 طلبًا و16 محاولة لكل طلب؛ أي 25,088 مسارًا محتملًا في الخطوة، ونحو 750 ألفًا لكل نموذج عبر 30 خطوة، لا للنموذجين مجتمعين.[2][4]
ماذا يجب أن أفعل بعد ذلك في الممارسة العملية؟
النتائج المرحلية ومؤشرات النجاح في اللوحة تصف تشغيل شاومي وتقييمها؛ ولا تمثل تدقيقًا مستقلًا في كامل عملية تطوير النموذج.[18][25][45]