Xiaomi lät allmänheten följa delar av efterträningen av AI-modellerna MiMo-V2.6 Pro och Flash. I en öppen panel visades data från två körningar med förstärkningsträning, ofta förkortad RL, medan arbetet pågick. Det är mer insyn än enbart ett färdigt modellsläpp ger. Men panelen visar Xiaomis redovisning av just dessa körningar – inte modellernas tidigare grundträning eller allt som skedde på företagets infrastruktur.
1
18
Vad gick att se?
Panelen följde bland annat avslutade träningssteg, pågående försök, antal bearbetade token, belöningskurvor, andelen lösta uppgifter, tidsåtgång, ackumulerade kostnader och löpande utvärderingar av kodningsförmåga. Räknaren för träningssteg behövde inte sammanfalla med räknaren för pågående försök: försöken genererades asynkront, samtidigt som träningen uppdaterades.
1
18
22
Även vissa driftproblem syntes. Rapporter beskriver omstarter, GPU-fel på grund av otillräckligt minne och problem med dataunderlaget. Xiaomis mått skiljer dessutom mellan misslyckade uppgiftsförsök och försök som gått förlorade av tekniska skäl. Det gör siffrorna lättare att tolka, men visar inte att varje incident redovisades.
18
23
En tidig ögonblicksbild visade båda modellerna efter träningssteg 10, medan försök för steg 16 pågick. Den angav omkring 2,2 miljarder token per steg för Pro och 2,6 miljarder för Flash, samt dittills upparbetade kostnader på cirka 741 000 respektive 322 000 dollar. Det var läget vid en viss tidpunkt – varken slutkostnader eller fasta dygnstakter.
25
Hur var träningen upplagd?
Varje uppdatering använde 1 568 uppgifter med 16 försök per uppgift: 25 088 möjliga körningar per steg. Den asynkrona uppläggningen gjorde att modellen kunde generera och utföra uppgifter medan andra försök bedömdes och träningsuppdateringar genomfördes. I samma träningskörning blandades bland annat programmering, allmänna agentuppgifter, visuella uppgifter och cybersäkerhet, utförda i flera olika uppgiftsmiljöer.
4
10
19
Bedömningen var mer nyanserad än godkänt eller underkänt. Enligt beskrivningarna vägdes resultat från körbara tester samman med uppgiftsspecifika bedömningskriterier och jämförelser mellan försök på samma uppgift. Två fungerande lösningar kunde därmed få olika kvalitetsbedömning. Bedömningen krävde också beräkningsresurser: en genomgång av Xiaomis tekniska rapport anger att den stod för cirka 12,7 procent av Pros RL-kostnad.
44
47
Den tidiga uppgiften om ”ungefär 2 miljarder token per steg” beskrev storleksordningen, inte en fast gräns. Senare redovisningar anger högre antal token per steg.
4
19
20
Vad betyder belöningar, DeepSWE-poäng och kostnader?
En träningsbelöning avser de försök som användes för en uppdatering. Den är inte i sig ett oberoende test av vad modellen klarar. Panelens dynsam/avg@n är genomsnittet av andelen lyckade försök för varje utvald uppgift. Varianten dynsam/avg@n_no_infra räknar bort försök som misslyckats av infrastrukturskäl. Skillnaden kan hjälpa läsaren att inte missta ett tekniskt fel för ett modellmisslyckande; inget av måtten täcker alla tänkbara uppgifter.
18
I den tidiga ögonblicksbilden fick Pro 62,24 och Flash 60,77 på DeepSWE v1.1, en utvärdering av mjukvaruutvecklingsuppgifter. Det var resultat från mellanliggande kontrollpunkter. Xiaomi angav senare cirka 72,6 för Pro och 65,7 för Flash efter körningarna. Även slutsiffrorna bör läsas utifrån Xiaomis testupplägg, inte som oberoende reproducerade resultat på en offentlig topplista.
25
17
45
Enligt Xiaomi slutfördes 30 steg per modell på mindre än sex dagar. De rapporterade RL-kostnaderna var cirka 2,62 miljoner dollar för Pro och 850 000 dollar för Flash – sammanlagt ungefär 3,47 miljoner dollar. Uppgiften om omkring 750 000 körningar bör läsas som per modell: 25 088 möjliga körningar per steg gånger 30 steg blir 752 640 för vardera modellen. Kostnaderna omfattar inte grundträningen eller allt annat utvecklingsarbete.
2
4
44
45
Vad vet vi fortfarande inte?
Det utmärkande med panelen var tidsserierna från träning och drift under pågående körningar, snarare än enbart färdiga modellfiler. Xiaomi har därefter tillkännagett vikter för Pro och Flash, en destillerad 9B-modell, en teknisk rapport, fler än 7 000 RL-uppgiftsmiljöer och verktyg för RL-träning.
1
15
Insynen är ändå begränsad. De tillgängliga källorna verifierar inte oberoende att panelen uppdaterades utan avbrott eller urval, och de visar inte all samtidig aktivitet på infrastrukturen. Att en destillerad 9B-modell har släppts bevisar inte heller att dold trafik för destillering pågick bakom de visade Pro- och Flash-körningarna eller ingick i deras redovisade kostnader.
18
15
2