Veřejný panel Xiaomi umožnil sledovat dvě souběžné fáze následného tréninku posilovacím učením (RL) modelů MiMo‑V2.6 Pro a Flash. Vedle výsledků ukazoval i to, jak trénink postupuje a kolik podle vykazovaných údajů stojí. Nezobrazoval však předtrénování modelů ani veškerou činnost výpočetní infrastruktury Xiaomi. Údaje je proto třeba číst jako záznam zveřejněný firmou, ne jako nezávislý audit.
1
18
Co bylo na panelu vidět?
Pro oba modely panel sledoval dokončené tréninkové kroky, právě probíhající generování pokusů, počty zpracovaných tokenů, křivky odměn, úspěšnost na úlohách, délku kroků, průběžné náklady i mezivýsledky testů zaměřených na programování. Počítadlo tréninkových kroků se nemuselo shodovat s počítadlem generovaných pokusů: pokusy vznikaly asynchronně, souběžně s aktualizacemi modelu.
1
18
22
Zprávy o panelu zmiňovaly také vybrané restarty, chyby způsobené nedostatkem paměti GPU a problémy s datovými sadami. Definice metrik navíc rozlišují mezi neúspěchem při řešení úlohy a pokusem ztraceným kvůli infrastruktuře. To je užitečný kontext, nikoli důkaz, že se na panelu objevila každá provozní potíž.
18
23
Jeden z raných záznamů zachycoval oba modely na desátém dokončeném tréninkovém kroku, zatímco běžel 16. krok generování pokusů. Uváděl přibližně 2,2 miliardy tokenů na krok u Pro a 2,6 miliardy u Flash; dosavadní výdaje činily asi 741 tisíc USD, respektive 322 tisíc USD. Šlo o stav v daném okamžiku, ne o konečný účet ani neměnnou denní sazbu.
25
Jak trénink a hodnocení fungovaly?
Každá aktualizace pracovala s 1 568 zadáními a 16 pokusy na zadání — tedy s 25 088 potenciálními průběhy úloh. Asynchronní uspořádání dovolovalo, aby generování odpovědí a provádění úloh běželo souběžně s hodnocením a aktualizacemi modelu. Trénink kombinoval programátorské, obecné agentní, vizuální i kyberbezpečnostní úlohy v několika prostředích pro práci agentů; nešlo o optimalizaci na jediný druh úlohy.
4
10
19
Hodnocení nebylo omezené na otázku, zda pokus prošel testem. Popsaný postup spojoval výsledky spustitelných testů s kritérii pro konkrétní úlohy a porovnával pokusy mezi sebou. I dvě úspěšná řešení tak mohla získat různé hodnocení kvality. Samotné hodnocení vyžadovalo výpočetní výkon: podle rozboru technické zprávy představovalo zhruba 12,7 % nákladů na RL trénink modelu Pro.
44
47
Původní údaj „zhruba dvě miliardy tokenů na krok“ byl odhadem měřítka, nikoli pevně stanoveným limitem. Pozdější popisy uvádějí vyšší počty tokenů na krok.
4
19
20
Co znamenají odměny, skóre DeepSWE a konečné náklady?
Tréninková odměna popisuje průběhy úloh použité při aktualizaci modelu; sama o sobě není nezávislým testem jeho schopností. Metriku dynsam/avg@n Xiaomi definuje jako průměr podílu úspěšných pokusů pro každé vybrané zadání. Varianta dynsam/avg@n_no_infra vynechává pokusy, které selhaly z infrastrukturních důvodů. Porovnání obou hodnot pomáhá neplést si poruchu prostředí s chybou modelu. Ani jedna však neměří výkon na všech možných úlohách.
18
Zmíněný raný záznam uváděl v testu DeepSWE v1.1 skóre 62,24 pro Pro a 60,77 pro Flash. Šlo o mezivýsledky, nikoli o konečné hodnocení. Po dokončení tréninku Xiaomi uvedlo přibližně 72,6 pro Pro a 65,7 pro Flash. I tato čísla je nutné chápat v kontextu hodnoticího postupu Xiaomi, nikoli jako nezávisle zopakované výsledky veřejného žebříčku.
25
17
45
Podle Xiaomi dokončil každý model 30 kroků za méně než šest dní. Firma vyčíslila náklady přibližně na 2,62 milionu USD u Pro a 850 tisíc USD u Flash, tedy dohromady asi 3,47 milionu USD za uvedené běhy RL. Zmínku o přibližně 750 tisících průběhů úloh je vhodné vztahovat ke každému modelu zvlášť: 25 088 potenciálních průběhů na krok krát 30 kroků dává 752 640 na jeden běh. Vykázané částky nezahrnují předtrénování ani veškerou další práci na vývoji modelů.
2
4
44
45
V čem je zveřejnění neobvyklé — a co nevíme?
Na rozdíl od zveřejnění až hotového modelu panel ukazoval vývoj tréninkových a provozních údajů v čase, ještě během běhů Pro a Flash. Xiaomi následně oznámilo vydání vah těchto modelů, destilovaného modelu s 9 miliardami parametrů, technické zprávy, více než 7 000 prostředí s RL úlohami, kompletního rámce pro RL a kombinovatelných menších prostředí pro práci agentů.
1
15
Větší otevřenost má své hranice. Dostupné podklady nezávisle nepotvrzují nepřerušený a nefiltrovaný živý přenos všech údajů ani neukazují veškerou souběžnou činnost infrastruktury. Vydání destilovaného modelu také samo o sobě nedokazuje, že za zobrazenými běhy Pro a Flash probíhal další nezveřejněný provoz související s destilací nebo že byl započítán do jejich nákladů.
18
15
2