Publiczny panel Xiaomi MiMo-V2.6 dawał wgląd w dwa trwające treningi po wstępnym wytrenowaniu modeli: Pro i Flash doskonalono metodą uczenia przez wzmacnianie (RL). To więcej niż pojedynczy wynik ogłoszony po zakończeniu prac, lecz nadal dane prezentowane przez Xiaomi. Panel nie pokazywał wstępnego treningu modeli ani wszystkich prac prowadzonych na infrastrukturze firmy.
1
18
Co było widać na panelu?
Osobne widoki Pro i Flash pokazywały ukończone kroki treningu, generowanie prób rozwiązania zadań (tzw. rollouty), liczbę przetworzonych tokenów, wykresy nagrody, skuteczność w zadaniach, czas kroków, narastające koszty oraz wyniki pośrednich testów programistycznych. Liczniki kroków treningu i rolloutów nie musiały wskazywać tej samej wartości: generowanie prób odbywało się asynchronicznie względem aktualizacji modelu.
1
18
22
Relacje o panelu wymieniały też wybrane ponowne uruchomienia, błędy braku pamięci na GPU i problemy ze zbiorami danych. Definicje metryk odróżniały nieudaną próbę rozwiązania zadania od próby utraconej z przyczyn technicznych. Nie oznacza to jednak, że ujawniono każde zdarzenie infrastrukturalne.
18
23
We wczesnym zrzucie oba modele miały za sobą 10 kroków treningu, podczas gdy licznik rolloutów wskazywał krok 16. Raportowano wtedy około 2,2 mld tokenów na krok dla Pro i 2,6 mld dla Flash, a narastające wydatki wynosiły odpowiednio około 741 tys. i 322 tys. dolarów. Był to stan na dany moment, nie końcowy rachunek ani stałe tempo wydatków.
25
Jak wyglądał jeden krok treningu?
Każda aktualizacja wykorzystywała 1568 zadań wejściowych i 16 prób na każde z nich — razem 25 088 możliwych przebiegów. Asynchroniczny system pozwalał prowadzić generowanie i wykonywanie zadań równolegle z ich oceną i aktualizacjami modelu. W jednym treningu mieszano zadania programistyczne, ogólne zadania dla agentów AI, zadania wizualne i z cyberbezpieczeństwa. Korzystano przy tym z różnych środowisk i mechanizmów uruchamiania zadań, zamiast ćwiczyć model tylko na jednym ich rodzaju.
4
10
19
Ocena nie sprowadzała się do odpowiedzi „zaliczone” lub „niezaliczone”. Opisywana przez Xiaomi metoda łączyła wyniki testów wykonywalnych z kryteriami jakości właściwymi dla danego zadania oraz porównywaniem prób dotyczących tego samego problemu. Dzięki temu dwie poprawne odpowiedzi mogły dostać różne oceny jakości. Sama ocena też zużywała moc obliczeniową: według omówienia raportu technicznego odpowiadała za około 12,7% kosztu treningu RL modelu Pro.
44
47
Początkowe określenie „około 2 mld tokenów na krok” opisywało skalę, a nie niezmienny limit. Późniejsze relacje podawały wyższe wartości dla poszczególnych kroków.
4
19
20
Jak czytać nagrody, wyniki DeepSWE i koszty?
Nagroda treningowa nie jest niezależnym testem możliwości modelu: dotyczy prób użytych w danej aktualizacji. Metryka dynsam/avg@n oznacza średnią — po zadaniach wylosowanych w tym kroku — z odsetka udanych prób dla każdego zadania. Wariant dynsam/avg@n_no_infra wyłącza próby nieudane z przyczyn infrastrukturalnych. Porównanie obu wartości pomaga nie pomylić awarii środowiska z błędem modelu, ale żadna z nich nie opisuje skuteczności we wszystkich możliwych zadaniach.
18
We wspomnianym wczesnym zrzucie wyniki DeepSWE v1.1 wynosiły 62,24 dla Pro i 60,77 dla Flash. Były to oceny pośrednich wersji modeli. Xiaomi podało później wyniki końcowe około 72,6 dla Pro i 65,7 dla Flash. Należy je interpretować w kontekście sposobu testowania zastosowanego przez firmę, a nie jako niezależnie odtworzone wyniki publicznego rankingu.
25
17
45
Według Xiaomi oba treningi zakończyły się po 30 krokach każdy, w mniej niż sześć dni. Firma podała koszt około 2,62 mln dolarów dla Pro i 850 tys. dolarów dla Flash — łącznie około 3,47 mln dolarów za opisane treningi RL. Deklarowane około 750 tys. przebiegów najlepiej rozumieć jako liczbę na model: 25 088 możliwych przebiegów na krok pomnożone przez 30 daje 752 640 dla każdego treningu. Koszty te nie obejmują wstępnego treningu ani wszystkich pozostałych prac nad modelami.
2
4
44
45
Co ujawniono, a co pozostaje niewiadomą?
Najważniejszą różnicą względem publikacji samych gotowych modeli było udostępnianie w czasie trwania prac szeregów danych o treningu i działaniu infrastruktury. Xiaomi ogłosiło później udostępnienie wag Pro i Flash, mniejszego modelu destylowanego 9B, raportu technicznego, ponad 7 tys. środowisk z zadaniami RL, kompletnego frameworka RL oraz modułowych narzędzi do uruchamiania zadań.
1
15
Ta przejrzystość ma granice. Dostępne źródła nie potwierdzają niezależnie, że transmisja danych była nieprzerwana i niefiltrowana, ani nie pokazują wszystkich równoległych działań infrastruktury. Samo udostępnienie modelu destylowanego 9B nie dowodzi, że nieujawnione zadania związane z jego destylacją działały za kulisami widocznych treningów Pro i Flash lub zostały wliczone w ich koszty.
18
15
2