Xiaomi mostra pubblicamente una parte della telemetria di due run RL non concluse, MiMo V2.6 Pro e MiMo V2.6 Flash: circa 2 miliardi di token per step, con 1.568 prompt e 16 roll out ciascuno. Il punto tecnico più rilevante è la scalabilità dell'intero sistema: calcolo del modello, ambienti agentici multi task e cap...
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Xiaomi’s public MiMo-V2.6 reinforcement-learning post-training livestream at mimo.xiaomi.com/rl/, what does it reveal about the para. Article summary: Xiaomi’s MiMo-V2.6 page is an unusual public dashboard for *ongoing* RL post-training, not a release of a finished model. It exposes selected trainer-log telemetry for parallel unreleased Pro and Flash runs—reward and be. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Xiaomi ha reso pubblico un aspetto insolito dello sviluppo di modelli di IA: un cruscotto dedicato al post-addestramento con reinforcement learning (RL) di due modelli non ancora distribuiti, MiMo-V2.6-Pro e MiMo-V2.6-Flash. Invece di limitarsi a pubblicare una tabella di benchmark a lavoro concluso, la pagina espone una parte della telemetria: curve di ricompensa, numero di roll-out, tempi degli step, stime dei costi di calcolo, risultati di valutazione ed eventi dell'infrastruttura. 1
8
Il messaggio principale non è che il cruscotto certifichi il risultato finale dei modelli. È che Xiaomi considera osservabile pubblicamente la macchina operativa dell'RL agentico su larga scala: generazione dei roll-out, ambienti di esecuzione, verifica, valutazione, aggiornamenti, errori e spesa computazionale.
Secondo le ricostruzioni della pagina pubblica, le run parallele Pro e Flash sono iniziate il 15 settembre 2026. Il cruscotto segue l'avanzamento mentre i modelli sono ancora in addestramento; Xiaomi non ha annunciato specifiche definitive, prezzi o disponibilità pubblica per nessuno dei due. 1
8
La configurazione resa nota è considerevole: 1.568 prompt con 16 roll-out per prompt, cioè circa 25.000 roll-out, e all'incirca 2 miliardi di token per ogni step RL. Xiaomi afferma che il sistema opera in modalità interamente asincrona. 24
Luo Fuli, responsabile del team MiMo, ha indicato tre dimensioni della scalabilità:
In pratica, la descrizione pubblica fa pensare a una pipeline nella quale i modelli producono azioni o soluzioni, le eseguono in ambienti di compito, ricevono feedback da verificatori o rubriche e vengono quindi aggiornati in base a quel feedback. A questa scala, produrre roll-out ed eseguire i valutatori può essere importante quanto l'ottimizzatore stesso.
Un sistema RL completamente asincrono permette alla generazione dei roll-out, all'esecuzione negli ambienti, al punteggio e agli aggiornamenti del modello di procedere senza costringere ogni componente ad attendere il compito più lento. È un'impostazione particolarmente rilevante per carichi agentici misti: alcune attività possono terminare rapidamente, altre richiedono un uso più lungo di strumenti o una valutazione più costosa.
Anche l'enfasi di Xiaomi sul calcolo destinato ai valutatori è significativa. Nei compiti agentici, il risultato finale può dipendere da una sequenza di azioni e non da una sola risposta. Attribuire la ricompensa lungo quella sequenza — ciò che Xiaomi chiama agentic in-group credit assignment — diventa quindi una componente del sistema di addestramento, non un dettaglio accessorio. 24
La lezione operativa del cruscotto è questa: scalare l'RL per gli agenti non significa soltanto aggiungere GPU per l'addestramento. Servono anche ambienti, capacità di generare roll-out e verificatori in numero sufficiente per alimentare il ciclo con feedback utili.
Le prime segnalazioni basate sul cruscotto indicavano una spesa complessiva superiore a 1,08 milioni di dollari in circa 36 ore dall'avvio di Pro, ossia in media circa 30.000 dollari l'ora per le due run. 4 Altre istantanee riportavano circa 830.000 dollari per Pro e 360.000 per Flash; Pro sarebbe stata riavviata per un problema di VRAM su un nodo, mentre Flash sarebbe ripartita dopo un errore nel dataset allo step 15.
9
Sono numeri d'impatto, ma richiedono cautela:
Resta però un punto evidente: Xiaomi presenta l'iniziativa come un impegnativo sforzo di RL online, ad alta intensità infrastrutturale, non come un leggero esperimento di post-addestramento.
Il cruscotto includerebbe curve di ricompensa e valutazioni di programmazione effettuate durante l'addestramento. In una delle istantanee riportate, DeepSWE v1.1 segnava 63,72 per Pro e 60,77 per Flash. 9
Sono indicatori diagnostici, non affermazioni conclusive sulle capacità. Una curva di ricompensa in crescita può essere coerente con un miglior completamento dei compiti, ma può anche riflettere cambiamenti nel mix di attività, varianza, comportamento del valutatore, ottimizzazione della ricompensa o esposizione ai benchmark. Allo stesso modo, un punteggio ottenuto a metà run non è un risultato finale finché non sono documentati e verificati in modo indipendente protocollo di valutazione, impostazioni di campionamento, controlli sulla contaminazione e criteri di selezione del checkpoint finale.
La lettura corretta è quindi: la diretta consente di osservare l'evoluzione dei segnali di addestramento. Da sola, non dimostra quanto un MiMo-V2.6 completato saprà generalizzare fuori dall'impostazione di valutazione mostrata.
Luo Fuli ha dichiarato che il team ha dedicato quasi sei mesi a una domanda: fino a che punto il reinforcement learning possa essere scalato. Ha descritto MiMo-V2.6 come ancora nel mezzo della run RL e ha detto che Xiaomi pubblicherà dettagli in open source «pezzo per pezzo» nelle settimane successive. 24
È un impegno rilevante verso ulteriori informazioni tecniche, ma non va scambiato per una promessa di riproducibilità completa. La dichiarazione non garantisce, di per sé, la pubblicazione di tutti i dati di addestramento, prompt, pesi dei valutatori, implementazioni degli ambienti, stato dell'ottimizzatore, ogni checkpoint o log completi del cluster.
La trasparenza di MiMo-V2.6 riguarda la visibilità del processo: Xiaomi espone una selezione di dati operativi di una run di post-addestramento per linguaggio e agenti ancora in corso.
Xiaomi-Robotics-U0 era invece un progetto differente, con un diverso tipo di apertura. Il modello robotico è descritto come un modello fondazionale del mondo autoregressivo da 38 miliardi di parametri per l'intelligenza embodied, che riunisce generazione testo-immagine, editing di immagini, generazione di scene embodied, trasferimento embodied e generazione di video embodied. 25
34 Il repository pubblico di Xiaomi descrive materiali relativi a modello e framework rilasciati per quel lavoro.
32
La distinzione è semplice:
Entrambe le forme possono essere utili. Nessuna delle due fornisce automaticamente tutto il necessario per riprodurre da zero il risultato completo.
La diretta di MiMo è più informativa di un tradizionale annuncio finale di benchmark, ma lascia aperte questioni importanti.
Un cruscotto pubblico può essere quasi in tempo reale pur includendo aggiornamenti ritardati, valori inseriti successivamente, correzioni, pause, riavvii o interventi manuali. La sua esistenza testimonia una divulgazione insolita, non costituisce prova crittografica di continuità ininterrotta.
Il conteggio pubblico di prompt, roll-out, token e costi non prova l'assenza di output da modelli insegnanti non dichiarati, dati proprietari, dati umani filtrati, esposizione nascosta ai benchmark o altri input esterni al cruscotto.
Senza un harness di valutazione integralmente pubblicato, set di test congelati, impostazioni di campionamento, semi ripetuti e replicazioni indipendenti, né le curve di ricompensa né i risultati intermedi di DeepSWE possono stabilire la capacità generale finale dei modelli.
Il cruscotto può mostrare progressi e incidenti senza rivelare il mix completo di attività, la pesatura delle ricompense, l'affidabilità dei valutatori, l'inventario hardware, il metodo esatto di calcolo dei costi, la provenienza dei dati o i criteri finali per scegliere il checkpoint.
Il cruscotto di MiMo-V2.6 è un raro esperimento pubblico di osservabilità dell'RL agentico su vasta scala. La configurazione dichiarata — circa 2 miliardi di token per step, 1.568 prompt, 16 roll-out asincroni per prompt, ambienti misti e lavoro sostanziale lato valutazione — mostra che Xiaomi considera la scalabilità dell'RL un problema di sistemi oltre che di addestramento del modello. 24
Spesa riportata, curve di ricompensa, istantanee dei benchmark e guasti visibili rendono il processo più ispezionabile di un annuncio pubblicato a posteriori. Rimangono però dati selezionati e auto-riportati relativi a run non concluse: il cruscotto è una forte evidenza di trasparenza operativa, non una verifica indipendente della continuità della diretta, della provenienza completa dell'addestramento o della qualità finale del modello.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaomi mostra pubblicamente una parte della telemetria di due run RL non concluse, MiMo V2.6 Pro e MiMo V2.6 Flash: circa 2 miliardi di token per step, con 1.568 prompt e 16 roll out ciascuno.
Xiaomi mostra pubblicamente una parte della telemetria di due run RL non concluse, MiMo V2.6 Pro e MiMo V2.6 Flash: circa 2 miliardi di token per step, con 1.568 prompt e 16 roll out ciascuno. Il punto tecnico più rilevante è la scalabilità dell'intero sistema: calcolo del modello, ambienti agentici multi task e capacità di valutazione, con ricompense basate su test e rubriche.
Il cruscotto rende visibili avanzamento, costi e alcuni errori operativi, ma le metriche auto riportate non dimostrano continuità della diretta, provenienza completa dei dati o qualità finale dei modelli.