Een eindscore vertelt weinig over hoe een AI-model tijdens de training vooruitging. Xiaomi gaf met zijn openbare MiMo-V2.6-dashboard een ongebruikelijk kijkje in twee lopende runs: die van Pro en Flash. Het ging om natraining met reinforcement learning (RL), waarbij het model leert van beoordeelde pogingen om taken uit te voeren. Het dashboard liet niet de eerdere basistraining zien, en evenmin alle werkzaamheden op Xiaomi’s infrastructuur.
1
18
Welke cijfers waren te volgen?
Voor beide modellen toonde het dashboard voltooide trainingsstappen, rollouts — pogingen waarbij het model een taak uitvoert — aantallen verwerkte tokens, beloningscurves, slagingspercentages, tijd per stap, oplopende kosten en tussentijdse scores op programmeertaken. De teller voor rollouts kon voorlopen op die voor trainingsstappen, omdat nieuwe pogingen asynchroon werden gegenereerd terwijl modelupdates nog liepen.
1
18
22
Ook operationele problemen waren deels zichtbaar. Verslagen noemen herstarts, fouten doordat het GPU-geheugen vol raakte en problemen met datasets. De definities van de dashboardcijfers maken bovendien onderscheid tussen mislukte taken en pogingen die door infrastructuurproblemen verloren gingen. Dat betekent niet dat elk incident openbaar is gemaakt.
18
23
Een vroege momentopname liet beide modellen op trainingsstap 10 zien, terwijl rolloutstap 16 bezig was. Ze vermeldde ongeveer 2,2 miljard tokens per stap voor Pro en 2,6 miljard voor Flash, met tot dan toe circa $ 741.000 en $ 322.000 aan kosten. Dat waren tussenstanden, geen eindbedragen of vaste kosten per dag.
25
Hoe verliep de training?
Per modelupdate werden 1.568 prompts gebruikt, met 16 pogingen per prompt: in totaal 25.088 mogelijke trajecten per stap. Het systeem kon nieuwe pogingen en de uitvoering van taken laten doorlopen terwijl andere pogingen werden beoordeeld en het model werd bijgewerkt. Xiaomi combineerde onder meer programmeer-, algemene agent-, visuele en cybersecuritytaken, verdeeld over verschillende harnesses: de omgevingen en hulpmiddelen waarmee een AI-agent een taak uitvoert.
4
10
19
De beoordeling was meer dan een simpel geslaagd-of-gezakt-oordeel. Volgens de beschrijving van Xiaomi’s aanpak werden uitkomsten van uitvoerbare tests gecombineerd met taakspecifieke beoordelingscriteria en vergelijkingen tussen pogingen voor dezelfde taak. Daardoor konden twee geslaagde oplossingen toch verschillend worden gewaardeerd. Ook die beoordeling vergde rekenkracht: volgens een bespreking van het technische rapport was ze goed voor ongeveer 12,7% van de RL-kosten van Pro.
44
47
De aanvankelijke aanduiding van ‘ongeveer 2 miljard tokens per stap’ was een orde van grootte, geen vast maximum. Latere verslagen noemen hogere aantallen per stap.
4
19
20
Wat zeggen de beloningen, DeepSWE-scores en kosten?
Een trainingsbeloning beschrijft de trajecten die voor een modelupdate zijn gebruikt. Het is geen onafhankelijke test van wat het model in het algemeen kan. De dashboardmaat dynsam/avg@n berekent per geselecteerde prompt welk deel van de pogingen slaagt en neemt daarvan het gemiddelde. Bij dynsam/avg@n_no_infra tellen pogingen die door infrastructuurproblemen mislukten niet mee. Het verschil helpt voorkomen dat een kapotte uitvoeromgeving wordt aangezien voor een fout van het model. Geen van beide maten bestrijkt alle mogelijke taken.
18
De vroege momentopname meldde op de programmeerevaluatie DeepSWE v1.1 scores van 62,24 voor Pro en 60,77 voor Flash. Dat waren tussentijdse metingen. Xiaomi rapporteerde later ongeveer 72,6 voor Pro en 65,7 voor Flash na afloop van de runs. Ook die eindcijfers horen bij Xiaomi’s eigen testopzet; ze zijn niet hetzelfde als onafhankelijk gereproduceerde resultaten op een openbaar klassement.
25
17
45
Volgens Xiaomi rondden beide modellen elk 30 stappen af in minder dan zes dagen. De gemelde kosten bedroegen circa $ 2,62 miljoen voor Pro en $ 850.000 voor Flash, samen ongeveer $ 3,47 miljoen voor deze RL-runs. Het genoemde totaal van ongeveer 750.000 trajecten moet op basis van de opgegeven batchgrootte per model worden gelezen: 25.088 mogelijke trajecten per stap × 30 stappen = 752.640 per run. De bedragen omvatten niet de eerdere basistraining of alle andere kosten van modelontwikkeling.
2
4
44
45
Wat maakt dit openbaar, en wat blijft onbekend?
Waar een modelrelease vaak vooral het eindproduct laat zien, bood dit dashboard een tijdlijn van trainingscijfers en geselecteerde operationele gebeurtenissen terwijl de runs nog bezig waren. Xiaomi heeft inmiddels ook de gewichten van Pro en Flash, een gedistilleerd 9B-model, een technisch rapport, meer dan 7.000 RL-taakomgevingen, een volledig RL-framework en combineerbare mini-harnesses aangekondigd.
1
15
Die openheid kent grenzen. De beschikbare bronnen verifiëren niet onafhankelijk dat de openbare weergave onafgebroken en ongefilterd live was, of dat alle gelijktijdige activiteiten op de infrastructuur zichtbaar waren. De release van een gedistilleerd 9B-model bewijst evenmin dat achter de getoonde Pro- en Flash-jobs verborgen distillatieverkeer liep of dat zulke werkzaamheden in de gerapporteerde kosten zaten.
18
15
2