Xiaomi afferma che Pro e Flash hanno completato 30 passi di apprendimento per rinforzo ciascuno in meno di sei giorni, con costi rispettivi di circa 2,62 milioni e 850.000 dollari.[2] Ogni aggiornamento prevedeva 1.568 prompt e 16 tentativi per prompt: 25.088 traiettorie potenziali per passo, pari a 752.640 per mode...
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What does Xiaomi’s public MiMo-V2.6 Pro and Flash reinforcement-learning post-training dashboard show about the live runs’ steps, tokens, re. Article summary: Xiaomi’s dashboard exposed unusually detailed *post-training* reinforcement-learning telemetry for MiMo-V2.6 Pro and Flash—not their pretraining runs or a complete audit of every job on its infrastructure. The runs have . Topic tags: general, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, cha
La particolarità della dashboard pubblica di Xiaomi non era mostrare soltanto il risultato finale di MiMo-V2.6, ma permettere di seguire due sessioni di apprendimento per rinforzo (RL) nella fase di post-training: una per Pro e una per Flash. I dati restano però quelli resi disponibili da Xiaomi; non costituiscono una vista completa dell’addestramento iniziale o di ogni attività svolta sulla sua infrastruttura.1
18
Le viste di Pro e Flash riportavano i passi di addestramento completati, i rollout — i tentativi generati dal modello per svolgere un compito — ancora in corso, i token elaborati, le curve delle ricompense, i tassi di riuscita, i tempi per passo, i costi accumulati e le valutazioni intermedie sulle attività di programmazione. Il contatore dei passi di training poteva non coincidere con quello dei rollout perché la generazione dei tentativi procedeva in modo asincrono rispetto agli aggiornamenti del modello.1
18
22
Erano visibili anche alcuni segnali operativi: resoconti della dashboard citano riavvii, errori di memoria sulle GPU e problemi con i dataset. Le definizioni delle metriche distinguono inoltre i tentativi falliti per motivi infrastrutturali dagli insuccessi nello svolgimento del compito. Questo aiuta a interpretare i grafici, senza dimostrare che ogni incidente sia stato pubblicato.18
23
Una rilevazione iniziale mostrava entrambi i modelli al passo di training 10, mentre era in corso il passo di rollout 16. Indicava circa 2,2 miliardi di token per passo per Pro e 2,6 miliardi per Flash, con spese accumulate rispettivamente di circa 741.000 e 322.000 dollari. Erano cifre fotografate in quel momento: non costi finali né tariffe giornaliere costanti.25
Ogni aggiornamento partiva da 1.568 prompt, con 16 tentativi per prompt: in totale 25.088 traiettorie potenziali per passo. L’impostazione asincrona consentiva di sovrapporre la generazione e l’esecuzione dei compiti alla valutazione dei risultati e agli aggiornamenti del modello. Nella stessa sessione erano mescolati compiti per agenti di programmazione, agenti generalisti, attività visive e di cybersicurezza, eseguiti con diversi harness, cioè sistemi che organizzano l’esecuzione e la verifica dei compiti.4
10
19
La valutazione non si fermava a «riuscito» o «fallito». L’approccio descritto da Xiaomi combinava l’esito di test eseguibili con criteri specifici per il compito e confronti tra tentativi relativi allo stesso prompt. Così anche due soluzioni che superavano i test potevano ricevere giudizi di qualità diversi. Questa valutazione richiedeva a sua volta risorse di calcolo: secondo un resoconto del rapporto tecnico, rappresentava circa il 12,7% del costo RL di Pro.44
47
La prima indicazione di «circa 2 miliardi di token per passo» descriveva l’ordine di grandezza, non una quota fissa: resoconti successivi riportano volumi per passo più elevati.4
19
20
La ricompensa del training riassume le traiettorie usate per aggiornare il modello: non è, da sola, un test indipendente delle sue capacità. Nella dashboard, dynsam/avg@n indica la media, sui prompt campionati, della frazione di tentativi riusciti per ciascun prompt. La variante dynsam/avg@n_no_infra esclude i tentativi falliti per problemi infrastrutturali. Confrontarle aiuta a non scambiare un rollout interrotto per un errore del modello, ma nessuna delle due misura le prestazioni su tutti i compiti possibili.18
Nella rilevazione iniziale, i punteggi DeepSWE v1.1 erano 62,24 per Pro e 60,77 per Flash: valutazioni di checkpoint intermedi, non risultati finali. Xiaomi ha poi riportato circa 72,6 per Pro e 65,7 per Flash al termine delle sessioni. Anche questi numeri vanno letti nel contesto della procedura di valutazione di Xiaomi, non come risultati di una classifica pubblica riprodotti in modo indipendente.25
17
45
Secondo Xiaomi, entrambe le sessioni si sono concluse con 30 passi ciascuna in meno di sei giorni. I costi dichiarati per questa fase RL sono di circa 2,62 milioni di dollari per Pro e 850.000 dollari per Flash, ossia circa 3,47 milioni complessivi. La cifra di circa 750.000 traiettorie va letta per modello: 25.088 traiettorie potenziali per passo moltiplicate per 30 passi fanno 752.640 per ciascuna sessione. Queste spese dichiarate non comprendono il pretraining né tutti gli altri costi di sviluppo.2
4
44
45
A differenza di una pubblicazione che rende disponibili soltanto i modelli finiti, la dashboard ha esposto serie temporali e alcuni dati operativi mentre Pro e Flash erano in addestramento. Xiaomi ha successivamente annunciato i pesi di Pro e Flash, un modello distillato da 9 miliardi di parametri, un rapporto tecnico, oltre 7.000 ambienti di compiti RL, un framework RL completo e mini-harness componibili.1
15
Resta una distinzione importante: le fonti disponibili non verificano in modo indipendente che la trasmissione dei dati sia stata continua e priva di filtri, né mostrano tutte le attività contemporanee sull’infrastruttura. Inoltre, l’esistenza del modello distillato da 9 miliardi di parametri non prova che traffico di distillazione non dichiarato fosse nascosto dietro le due sessioni mostrate o incluso nei loro costi.18
15
2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaomi afferma che Pro e Flash hanno completato 30 passi di apprendimento per rinforzo ciascuno in meno di sei giorni, con costi rispettivi di circa 2,62 milioni e 850.000 dollari.[2]
Xiaomi afferma che Pro e Flash hanno completato 30 passi di apprendimento per rinforzo ciascuno in meno di sei giorni, con costi rispettivi di circa 2,62 milioni e 850.000 dollari.[2] Ogni aggiornamento prevedeva 1.568 prompt e 16 tentativi per prompt: 25.088 traiettorie potenziali per passo, pari a 752.640 per modello nell’arco di 30 passi.[4][2]
Costi e punteggi mostrati durante il lavoro erano valori provvisori. La dashboard rendeva visibile una parte del post training, non il pretraining né tutte le attività sull’infrastruttura Xiaomi.[1][18][25]