Xiaomi दो अधूरे MiMo V2.6 RL रन—Pro और Flash—की चुनिंदा टेलीमेट्री सार्वजनिक कर रहा है: हर स्टेप में करीब 2 अरब टोकन और 1,568 प्रॉम्प्ट × 16 रोलआउट। मुख्य तकनीकी संकेत यह है कि कंपनी केवल मॉडल कंप्यूट नहीं, बल्कि बहु कार्य एजेंट वातावरण और मूल्यांकन/ग्रेडर कंप्यूट भी बड़े पैमाने पर बढ़ा रही है। डैशबोर्ड प्रगति, खर्च...
प्रकाशितकर्ताGPT-5.6 Terra से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is Xiaomi’s public MiMo-V2.6 reinforcement-learning post-training livestream at mimo.xiaomi.com/rl/, what does it reveal about the para. Article summary: Xiaomi’s MiMo-V2.6 page is an unusual public dashboard for *ongoing* RL post-training, not a release of a finished model. It exposes selected trainer-log telemetry for parallel unreleased Pro and Flash runs—reward and be. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Xiaomi की MiMo टीम ने मॉडल विकास का एक असामान्य हिस्सा सार्वजनिक किया है: दो अभी जारी न हुए मॉडलों—MiMo-V2.6-Pro और MiMo-V2.6-Flash—के रिइन्फोर्समेंट लर्निंग (RL) पोस्ट-ट्रेनिंग का डैशबोर्ड। केवल अंतिम बेंचमार्क तालिका जारी करने के बजाय, इस पेज पर रिवॉर्ड कर्व, रोलआउट की संख्या, स्टेप टाइमिंग, चलता हुआ कंप्यूट-खर्च, मूल्यांकन परिणाम और इन्फ्रास्ट्रक्चर घटनाओं जैसी चुनिंदा टेलीमेट्री दिखाई जा रही है। 1
8
इसका बड़ा निष्कर्ष यह नहीं है कि डैशबोर्ड किसी अंतिम मॉडल-परिणाम को साबित करता है। असली बात यह है कि Xiaomi बड़े पैमाने के एजेंटिक RL संचालन—रोलआउट, वातावरण, सत्यापन, ग्रेडिंग, अपडेट, विफलताएं और खर्च—को सार्वजनिक रूप से देखने लायक प्रक्रिया मान रहा है।
सार्वजनिक पेज पर आई रिपोर्टों के अनुसार, Pro और Flash के समानांतर रन 15 सितंबर, 2026 को शुरू हुए। मॉडल अभी प्रशिक्षण में हैं; Xiaomi ने इनमें से किसी की अंतिम स्पेसिफिकेशन, कीमत या सार्वजनिक उपलब्धता की घोषणा नहीं की है। 1
8
बताई गई बैच कॉन्फ़िगरेशन काफी बड़ी है: 1,568 प्रॉम्प्ट और हर प्रॉम्प्ट पर 16 रोलआउट, यानी करीब 25,000 रोलआउट, तथा हर RL स्टेप में लगभग 2 अरब टोकन। Xiaomi के अनुसार यह प्रणाली पूरी तरह असिंक्रोनस है। 24
यह केवल स्थिर टेक्स्ट-पेयर पर चलने वाला साधारण प्रेफरेंस-ऑप्टिमाइज़ेशन लूप नहीं लगता। MiMo टीम की प्रमुख लुओ फूली ने स्केलिंग के तीन आयाम बताए:
व्यावहारिक रूप से, यह ऐसे पाइपलाइन की ओर इशारा करता है जिसमें मॉडल कोई कार्रवाई या समाधान बनाता है, उसे कार्य-परिवेश में चलाता है, वेरिफ़ायर या रूब्रिक से फीडबैक पाता है और उसी के आधार पर अपडेट होता है। इस पैमाने पर रोलआउट बनाना और इवैल्यूएटर चलाना, ऑप्टिमाइज़र जितना ही महत्वपूर्ण परिचालन काम हो सकता है।
पूरी तरह असिंक्रोनस RL प्रणाली में रोलआउट जनरेशन, वातावरण में निष्पादन, स्कोरिंग और मॉडल अपडेट एक-दूसरे के साथ चलते रह सकते हैं; हर घटक को सबसे धीमे कार्य का इंतजार नहीं करना पड़ता। मिश्रित एजेंट वर्कलोड में यह खास तौर पर उपयोगी है, क्योंकि कुछ काम जल्दी पूरे होते हैं, जबकि कुछ में लंबे टूल-उपयोग या महंगी ग्रेडिंग की जरूरत पड़ती है।
ग्रेडर कंप्यूट पर Xiaomi का जोर भी महत्वपूर्ण है। एजेंटिक कार्य में अंतिम नतीजा अक्सर कई कार्रवाइयों की श्रृंखला पर निर्भर होता है, न कि एक उत्तर पर। उस श्रृंखला में किस कार्रवाई को कितना रिवॉर्ड मिलना चाहिए—जिसे Xiaomi एजेंटिक इन-ग्रुप क्रेडिट असाइनमेंट कहता है—वह प्रशिक्षण प्रणाली का केंद्रीय हिस्सा बन जाता है। 24
इसलिए डैशबोर्ड एक परिचालन सबक देता है: एजेंटों के लिए RL को बड़ा करने का अर्थ सिर्फ ज्यादा ट्रेनिंग GPU जोड़ना नहीं है। उपयोगी फीडबैक के लिए पर्याप्त एनवायरनमेंट, रोलआउट और वेरिफ़ायर क्षमता भी चाहिए।
सार्वजनिक डैशबोर्ड पर आधारित शुरुआती रिपोर्टों में Pro शुरू होने के करीब 36 घंटे बाद दोनों रन का संयुक्त खर्च 10.8 लाख डॉलर से अधिक बताया गया—औसतन लगभग 30,000 डॉलर प्रति घंटा। 4 अन्य स्नैपशॉट में Pro के लिए करीब 8.3 लाख डॉलर और Flash के लिए 3.6 लाख डॉलर दिखे। साथ ही, Pro को नोड VRAM समस्या के बाद रीस्टार्ट करना पड़ा और Flash को स्टेप 15 पर डेटासेट त्रुटि के बाद फिर से शुरू किया गया।
9
ये आंकड़े ध्यान खींचते हैं, लेकिन इन्हें सावधानी से समझना चाहिए:
फिर भी, काउंटर एक बात स्पष्ट करता है: Xiaomi इसे हल्का-फुल्का पोस्ट-ट्रेनिंग प्रयोग नहीं, बल्कि महंगा और इन्फ्रास्ट्रक्चर-प्रधान ऑनलाइन RL प्रयास बता रहा है।
डैशबोर्ड में रिवॉर्ड कर्व और प्रशिक्षण के दौरान कोडिंग मूल्यांकन भी बताए गए हैं। एक रिपोर्टेड स्नैपशॉट में DeepSWE v1.1 पर Pro का स्कोर 63.72 और Flash का 60.77 था। 9
ये उपयोगी डायग्नॉस्टिक संकेत हैं, अंतिम क्षमता-दावे नहीं। बढ़ती रिवॉर्ड कर्व बेहतर कार्य-समाप्ति से मेल खा सकती है, लेकिन यह टास्क मिश्रण, सांख्यिकीय उतार-चढ़ाव, ग्रेडर के व्यवहार, रिवॉर्ड-ऑप्टिमाइज़ेशन या बेंचमार्क एक्सपोज़र में बदलाव का नतीजा भी हो सकती है। इसी तरह, रन के बीच का बेंचमार्क स्कोर अंतिम मॉडल परिणाम नहीं कहलाता, जब तक मूल्यांकन प्रोटोकॉल, सैंपलिंग सेटिंग, कंटैमिनेशन नियंत्रण और अंतिम चेकपॉइंट चुनने की प्रक्रिया प्रकाशित तथा स्वतंत्र रूप से जांची न जाए।
सही निष्कर्ष यह है: स्ट्रीम से दर्शक प्रशिक्षण संकेतों को बदलते हुए देख सकते हैं। लेकिन इससे यह अपने-आप साबित नहीं होता कि तैयार MiMo-V2.6 मॉडल दिखाए गए मूल्यांकन सेटअप के बाहर कितना सामान्यीकरण करेगा।
लुओ फूली के मुताबिक, टीम ने करीब आधा साल एक सवाल पर काम किया: रिइन्फोर्समेंट लर्निंग को आखिर कितना स्केल किया जा सकता है। उन्होंने MiMo-V2.6 को अभी उसके RL रन के बीच में बताया और कहा कि Xiaomi आने वाले हफ्तों में विवरण “धीरे-धीरे” ओपन-सोर्स करेगा। 24
यह आगे तकनीकी जानकारी साझा करने की महत्वपूर्ण प्रतिबद्धता है, लेकिन इसे पूर्ण पुनरुत्पादकता रिलीज़ नहीं मानना चाहिए। इस बयान में प्रशिक्षण डेटा, प्रॉम्प्ट, ग्रेडर वेट्स, एनवायरनमेंट इम्प्लीमेंटेशन, ऑप्टिमाइज़र स्टेट, हर चेकपॉइंट या पूरे क्लस्टर लॉग जारी करने का वादा अपने-आप शामिल नहीं है।
MiMo-V2.6 की पारदर्शिता का केंद्र प्रक्रिया की दृश्यता है: भाषा और एजेंट पोस्ट-ट्रेनिंग के चल रहे रन की चुनिंदा ऑपरेशनल टेलीमेट्री।
Xiaomi-Robotics-U0 अलग प्रकार की परियोजना और अलग तरह की ओपननेस थी। इसे एम्बॉडीड इंटेलिजेंस के लिए 38 अरब पैरामीटर वाला ऑटोरेग्रेसिव वर्ल्ड फाउंडेशन मॉडल बताया गया है। यह टेक्स्ट-टू-इमेज जनरेशन, इमेज एडिटिंग, एम्बॉडीड सीन जनरेशन, एम्बॉडीड ट्रांसफर और एम्बॉडीड वीडियो जनरेशन जैसे कार्यों को एकीकृत करता है। 25
34 Xiaomi के सार्वजनिक रिपॉजिटरी में उस काम से जुड़ी मॉडल और फ्रेमवर्क सामग्री का विवरण मौजूद है।
32
अंतर सीधे तौर पर समझा जा सकता है:
दोनों उपयोगी हो सकते हैं, लेकिन कोई भी तरीका अपने-आप किसी नतीजे को शुरू से अंत तक दोहराने के लिए पर्याप्त सामग्री नहीं देता।
MiMo स्ट्रीम सामान्य अंतिम बेंचमार्क घोषणा से ज्यादा जानकारी देती है, लेकिन कई अहम अनिश्चितताएं बनी रहती हैं।
सार्वजनिक डैशबोर्ड लगभग रियल-टाइम हो सकता है, फिर भी उसमें देरी, बाद में जोड़े गए मान, संशोधित डेटा, ठहराव, रीस्टार्ट या मैनुअल हस्तक्षेप हो सकते हैं। इसका होना असामान्य खुलासे का प्रमाण है, निर्बाध लाइव निरंतरता का क्रिप्टोग्राफ़िक प्रमाण नहीं।
प्रॉम्प्ट, रोलआउट, टोकन और लागत की सार्वजनिक गिनती यह साबित नहीं करती कि कहीं अघोषित टीचर-मॉडल आउटपुट, स्वामित्व वाला डेटा, फ़िल्टर किया गया मानव डेटा, छिपा बेंचमार्क एक्सपोज़र या अन्य ऑफ-डैशबोर्ड इनपुट नहीं हैं।
पूरी तरह प्रकाशित मूल्यांकन हार्नेस, स्थिर टेस्ट सेट, सैंपलिंग सेटिंग, कई सीड और स्वतंत्र पुनरुत्पादन के बिना न तो रिवॉर्ड कर्व और न ही अंतरिम DeepSWE परिणाम मॉडल की अंतिम सामान्य क्षमता तय कर सकते हैं।
डैशबोर्ड प्रगति और घटनाएं दिखा सकता है, लेकिन पूरा टास्क मिश्रण, रिवॉर्ड वेटिंग, ग्रेडर की विश्वसनीयता, हार्डवेयर सूची, लागत की सटीक पद्धति, डेटा की उत्पत्ति या अंतिम चेकपॉइंट चुनने के मानदंड उजागर करना जरूरी नहीं है।
Xiaomi का MiMo-V2.6 डैशबोर्ड बड़े पैमाने के एजेंटिक RL के लिए एक दुर्लभ सार्वजनिक ऑब्ज़र्वेबिलिटी प्रयोग है। इसकी बताई गई कॉन्फ़िगरेशन—हर स्टेप में करीब 2 अरब टोकन, 1,568 प्रॉम्प्ट, हर प्रॉम्प्ट पर 16 असिंक्रोनस रोलआउट, मिश्रित एनवायरनमेंट और ग्रेडर-साइड का उल्लेखनीय काम—दिखाती है कि कंपनी RL स्केलिंग को केवल मॉडल-ट्रेनिंग नहीं, बल्कि सिस्टम्स की समस्या भी मान रही है। 24
रिपोर्टेड खर्च, रिवॉर्ड कर्व, बेंचमार्क स्नैपशॉट और दिख रही विफलताएं इस प्रक्रिया को बाद में लिखी गई लॉन्च पोस्ट की तुलना में ज्यादा जांचने योग्य बनाते हैं। फिर भी, ये अधूरे रन की चुनिंदा और स्वयं-रिपोर्ट की गई टेलीमेट्री हैं। डैशबोर्ड परिचालन पारदर्शिता का मजबूत संकेत है—न कि निरंतर लाइव ट्रेनिंग, पूर्ण प्रशिक्षण-उत्पत्ति या अंतिम मॉडल गुणवत्ता का स्वतंत्र प्रमाण।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Xiaomi दो अधूरे MiMo V2.6 RL रन—Pro और Flash—की चुनिंदा टेलीमेट्री सार्वजनिक कर रहा है: हर स्टेप में करीब 2 अरब टोकन और 1,568 प्रॉम्प्ट × 16 रोलआउट।
Xiaomi दो अधूरे MiMo V2.6 RL रन—Pro और Flash—की चुनिंदा टेलीमेट्री सार्वजनिक कर रहा है: हर स्टेप में करीब 2 अरब टोकन और 1,568 प्रॉम्प्ट × 16 रोलआउट। मुख्य तकनीकी संकेत यह है कि कंपनी केवल मॉडल कंप्यूट नहीं, बल्कि बहु कार्य एजेंट वातावरण और मूल्यांकन/ग्रेडर कंप्यूट भी बड़े पैमाने पर बढ़ा रही है।
डैशबोर्ड प्रगति, खर्च और कुछ विफलताएं असामान्य रूप से खुलकर दिखाता है, लेकिन इससे लाइव निरंतरता, डेटा की उत्पत्ति या अंतिम मॉडल क्षमता स्वतंत्र रूप से सिद्ध नहीं होती।