Xiaomi lod offentligheden følge dele af den afsluttende træning af AI-modellerne MiMo-V2.6 Pro og Flash. Et dashboard viste løbende målinger fra de to kørsler med forstærkningslæring – en metode, hvor modellen trænes ud fra vurderinger af dens forsøg på at løse opgaver. Det var ikke et indblik i modellernes grundtræning eller i alt, hvad der foregik på Xiaomis infrastruktur.
1
18
Hvad kunne man se?
Dashboardet viste afsluttede træningstrin, igangværende forsøg, antal behandlede tokens, belønningskurver, andele af løste opgaver, tidsforbrug, akkumulerede udgifter og foreløbige resultater på kodeopgaver. Tællerne for træning og forsøg behøvede ikke at følges ad: Forsøgene blev genereret asynkront, mens modellen blev opdateret.
1
18
22
Der var også tegn på driftsproblemer. Omtaler af dashboardet beskrev blandt andet genstarter, GPU-fejl som følge af utilstrækkelig hukommelse og problemer med datasæt. Xiaomis definitioner af målingerne skelner desuden mellem mislykkede opgaveløsninger og forsøg, der gik tabt på grund af infrastrukturen. Det viser udvalgte problemer, ikke nødvendigvis dem alle.
18
23
Et tidligt øjebliksbillede viste begge modeller ved træningstrin 10, mens forsøg knyttet til trin 16 var i gang. På det tidspunkt lød tallene på cirka 2,2 mia. tokens pr. trin for Pro og 2,6 mia. for Flash. De akkumulerede udgifter var omkring 741.000 og 322.000 USD. Det var status på et bestemt tidspunkt – hverken slutpriser eller faste udgifter pr. dag.
25
Hvordan foregik træning og bedømmelse?
Hver modelopdatering tog udgangspunkt i 1.568 opgaver med 16 forsøg på hver, altså 25.088 mulige forløb pr. trin. I det asynkrone system kunne generering og udførelse af opgaver foregå sideløbende med bedømmelse og modelopdateringer. Træningen blandede blandt andet kodeopgaver, generelle agentopgaver, visuelle opgaver og cybersikkerhedsopgaver på tværs af flere rammer for, hvordan agenterne løste dem.
4
10
19
Et forsøg blev ikke blot bedømt som bestået eller dumpet. Den beskrevne metode kombinerede resultater fra test, der kunne køres automatisk, med kriterier for den enkelte opgave og sammenligninger mellem forsøg på samme opgave. Dermed kunne to vellykkede løsninger få forskellige kvalitetsvurderinger. Bedømmelsen krævede også regnekraft: Ifølge en gennemgang af Xiaomis tekniske rapport udgjorde den cirka 12,7 % af Pro-modellens udgifter til forstærkningslæring.
44
47
En tidlig beskrivelse på »omkring 2 mia. tokens pr. trin« angav størrelsesordenen, ikke en fast grænse. Senere opgørelser angiver højere tal pr. trin.
4
19
20
Hvad betyder belønninger, DeepSWE-scorer og slutpriser?
Træningsbelønningen beskriver de forsøg, som indgik i en modelopdatering. Den er ikke i sig selv en uafhængig test af modellens evner. Xiaomis måling dynsam/avg@n er gennemsnittet af andelen af vellykkede forsøg for hver udvalgt opgave. Varianten dynsam/avg@n_no_infra ser bort fra forsøg, der mislykkedes af infrastrukturelle årsager. Forskellen kan hjælpe med at skelne mellem en fejl i systemet og en opgave, modellen ikke kunne løse – men ingen af målingerne dækker alle tænkelige opgaver.
18
I det tidlige øjebliksbillede fik Pro 62,24 og Flash 60,77 i DeepSWE v1.1, en evaluering af softwareudviklingsopgaver. Det var resultater fra mellemstadier i træningen. Xiaomi rapporterede senere slutresultater på omkring 72,6 for Pro og 65,7 for Flash. Også slutresultaterne skal læses i lyset af Xiaomis evalueringsopsætning, ikke som uafhængigt efterprøvede placeringer på en offentlig rangliste.
25
17
45
Ifølge Xiaomi afsluttede hver model 30 trin på under seks dage. De rapporterede udgifter var cirka 2,62 mio. USD for Pro og 850.000 USD for Flash – tilsammen omkring 3,47 mio. USD for de to kørsler med forstærkningslæring. Ud fra batchstørrelsen giver 25.088 mulige forløb ganget med 30 trin 752.640 pr. model. Xiaomis angivelse af cirka 750.000 forløb bør derfor læses som et tal for hver model, ikke de to tilsammen. Udgifterne omfatter ikke grundtræning eller alt andet arbejde med modellerne.
2
4
44
45
Hvor går grænsen for indblikket?
Forskellen fra en almindelig modeludgivelse var, at dashboardet viste en tidsserie af trænings- og driftsdata, mens arbejdet stod på – ikke kun det færdige resultat. Xiaomi har siden annonceret modelvægte til Pro og Flash, en destilleret 9B-model, en teknisk rapport, mere end 7.000 opgavemiljøer til forstærkningslæring samt et samlet træningssystem og modulære rammer til opgaverne.
1
15
Det offentlige dashboard er dog stadig Xiaomis egen visning. De tilgængelige kilder dokumenterer ikke uafhængigt, at visningen var uafbrudt og ufiltreret, eller at den dækkede al samtidig aktivitet på infrastrukturen. Udgivelsen af en destilleret 9B-model er heller ikke bevis for, at skjult trafik knyttet til destillering kørte bag de viste Pro- og Flash-job eller indgik i deres rapporterede udgifter.
18
15
2