Xiaomi hat das Nachtraining seiner beiden Modelle MiMo-V2.6-Pro und MiMo-V2.6-Flash mit Reinforcement Learning (RL) über ein öffentliches Dashboard begleitet. Zu sehen waren nicht nur spätere Endergebnisse, sondern auch Kennzahlen während der laufenden Durchgänge. Entscheidend für die Einordnung: Das Dashboard dokumentiert Xiaomis Pro- und Flash-Läufe. Es zeigt weder das vorherige Basistraining noch sämtliche Vorgänge auf der Infrastruktur des Unternehmens.
1
18
Was war während des Trainings zu sehen?
Die Ansichten für Pro und Flash zeigten abgeschlossene Trainingsschritte, laufende Rollouts – also Versuche, eine Aufgabe zu bearbeiten –, verarbeitete Tokens, Belohnungswerte, Erfolgsquoten, Laufzeiten, aufgelaufene Kosten und Zwischenbewertungen bei Programmieraufgaben. Weil die Rollouts asynchron erzeugt wurden, mussten ihre Schrittzähler nicht mit den bereits abgeschlossenen Modell-Updates übereinstimmen.
1
18
22
Hinzu kamen Hinweise auf den Betrieb: Berichte beschreiben ausgewählte Neustarts, Speicherfehler bei Grafikprozessoren und Probleme mit Datensätzen. Xiaomis Kennzahlendefinitionen unterscheiden außerdem zwischen gescheiterten Aufgabenversuchen und Versuchen, die an Infrastrukturproblemen scheiterten. Das ist nützlich für die Fehlersuche, belegt aber nicht, dass jeder Vorfall öffentlich angezeigt wurde.
18
23
Eine frühe Momentaufnahme zeigte beide Modelle bei Trainingsschritt 10, während Rollout-Schritt 16 lief. Sie nannte rund 2,2 Milliarden Tokens pro Schritt für Pro und 2,6 Milliarden für Flash sowie bis dahin aufgelaufene Ausgaben von etwa 741.000 und 322.000 US-Dollar. Das waren Zwischenstände – weder die endgültigen Kosten noch eine dauerhaft gültige Ausgabenrate.
25
Wie funktionierten Aufgaben, Rollouts und Bewertung?
Für jedes Modell-Update waren 1.568 Aufgabenstellungen mit jeweils 16 Versuchen vorgesehen: 25.088 mögliche Lösungsverläufe pro Schritt. Durch die asynchronen Rollouts konnten Erzeugung und Ausführung von Lösungsversuchen parallel zu Bewertung und Modell-Updates stattfinden. Die Durchgänge mischten unter anderem Programmier-, allgemeine Agenten-, Bildverarbeitungs- und Cybersicherheitsaufgaben in verschiedenen Ausführungsumgebungen, statt nur einen Aufgabentyp zu trainieren.
4
10
19
Ein bestandener Test war nicht das einzige Bewertungskriterium. Der beschriebene Ansatz verband ausführbare Tests mit aufgabenspezifischen Bewertungsrastern und Vergleichen zwischen Versuchen zur selben Aufgabe. So konnten auch erfolgreiche Lösungen unterschiedlich bewertet werden. Diese Bewertung benötigte selbst Rechenleistung: Einer Auswertung des technischen Berichts zufolge entfielen etwa 12,7 Prozent der RL-Kosten von Pro darauf.
44
47
Die anfangs genannten „rund zwei Milliarden Tokens pro Schritt“ waren eine Größenordnung, kein festes Limit. Spätere Berichte nennen höhere Tokenzahlen je Schritt.
4
19
20
Wie lassen sich Erfolgsquoten und DeepSWE-Werte lesen?
Eine Trainingsbelohnung bewertet Lösungsverläufe, die für ein Modell-Update verwendet wurden. Sie ist kein unabhängiger Fähigkeitstest. Xiaomi definiert dynsam/avg@n als Durchschnitt darüber, welcher Anteil der Versuche pro ausgewählter Aufgabenstellung erfolgreich war. Die Variante dynsam/avg@n_no_infra lässt Versuche außer Betracht, die aus Infrastrukturgründen scheiterten. Der Vergleich hilft, technische Ausfälle nicht vorschnell als Modellfehler zu deuten. Beide Werte beziehen sich aber auf die ausgewählten Aufgaben, nicht auf sämtliche denkbaren Anwendungen.
18
In der frühen Momentaufnahme lagen die DeepSWE-v1.1-Werte bei 62,24 für Pro und 60,77 für Flash. Das waren Bewertungen von Zwischenständen. Für die abgeschlossenen Läufe meldete Xiaomi später etwa 72,6 für Pro und 65,7 für Flash. Diese Zahlen sind im Kontext von Xiaomis eigener Testumgebung zu lesen; sie sind keine unabhängig reproduzierten Ergebnisse einer öffentlichen Bestenliste.
25
17
45
Was kosteten die abgeschlossenen Läufe – und was bleibt offen?
Nach Xiaomis Angaben beendeten beide Modelle jeweils 30 Schritte in weniger als sechs Tagen. Die gemeldeten RL-Kosten betragen rund 2,62 Millionen US-Dollar für Pro und 850.000 US-Dollar für Flash, zusammen etwa 3,47 Millionen US-Dollar. Die Angabe von ungefähr 750.000 Lösungsverläufen ist am besten pro Modell zu verstehen: 25.088 mögliche Verläufe pro Schritt mal 30 Schritte ergeben jeweils 752.640. Die Kosten beziehen sich auf die ausgewiesenen RL-Läufe, nicht auf das vorherige Basistraining oder die gesamte Modellentwicklung.
2
4
44
45
Der Unterschied zu einer bloßen Modellveröffentlichung liegt in den zeitlichen Verlaufsdaten: Xiaomi machte Trainings- und Betriebskennzahlen sichtbar, während Pro und Flash noch liefen. Inzwischen hat das Unternehmen die Gewichte von Pro und Flash, ein destilliertes 9B-Modell, einen technischen Bericht, mehr als 7.000 RL-Aufgabenumgebungen sowie ein RL-Framework und kombinierbare kleinere Ausführungsumgebungen angekündigt.
1
15
Öffentlich einsehbar bedeutet nicht vollständig überprüfbar. Die verfügbaren Quellen belegen weder eine durchgehend ungefilterte Live-Übertragung noch zeigen sie alle gleichzeitig laufenden Infrastrukturarbeiten. Auch aus der Veröffentlichung des destillierten 9B-Modells folgt nicht, dass während der angezeigten Pro- und Flash-Läufe ein nicht ausgewiesener Destillationsprozess im Hintergrund lief oder in deren gemeldeten Kosten enthalten war.
18
15
2