Selon Xiaomi, Pro et Flash ont chacun achevé 30 étapes d’entraînement par renforcement en moins de six jours, pour environ 2,62 millions et 850 000 dollars respectivement.[2] Chaque mise à jour prévoyait 1 568 consignes et 16 tentatives par consigne, soit 25 088 trajectoires potentielles. Les coûts et scores affiché...
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What does Xiaomi’s public MiMo-V2.6 Pro and Flash reinforcement-learning post-training dashboard show about the live runs’ steps, tokens, re. Article summary: Xiaomi’s dashboard exposed unusually detailed *post-training* reinforcement-learning telemetry for MiMo-V2.6 Pro and Flash—not their pretraining runs or a complete audit of every job on its infrastructure. The runs have . Topic tags: general, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, cha
Xiaomi n’a pas seulement publié les résultats de MiMo-V2.6 Pro et Flash : l’entreprise a ouvert un tableau de bord montrant des données de leur post-entraînement par apprentissage par renforcement, pendant que les deux exécutions étaient en cours. C’est une fenêtre inhabituelle sur cette phase de travail, mais elle reste une fenêtre choisie par Xiaomi. Elle ne montre ni le pré-entraînement des modèles ni l’ensemble des activités de son infrastructure.1
18
Pour Pro et Flash, le tableau de bord indiquait notamment les étapes d’entraînement terminées, les tentatives de génération en cours — les rollouts —, les volumes de tokens, les courbes de récompense, les taux de réussite aux tâches, la durée des étapes, les dépenses cumulées et des évaluations intermédiaires en programmation. Le compteur des rollouts pouvait être en avance sur celui de l’entraînement, car leur génération se déroulait de façon asynchrone par rapport aux mises à jour du modèle.1
18
22
Des comptes rendus signalent aussi des redémarrages, des erreurs de mémoire sur les GPU et des problèmes de jeux de données. Les définitions des métriques distinguent les échecs aux tâches des tentatives perdues à cause de l’infrastructure. Cela aide à interpréter les courbes, sans prouver que tous les incidents ont été rendus visibles.18
23
Un relevé effectué tôt dans les deux exécutions plaçait Pro et Flash à l’étape d’entraînement 10, tandis que l’étape de rollout 16 était en cours. Il faisait état d’environ 2,2 milliards de tokens par étape pour Pro et 2,6 milliards pour Flash, ainsi que de dépenses cumulées d’environ 741 000 et 322 000 dollars. Ces montants décrivaient un instant précis : ce n’étaient ni les coûts finaux ni des tarifs journaliers constants.25
Chaque mise à jour utilisait 1 568 consignes, avec 16 tentatives pour chacune, soit 25 088 trajectoires potentielles. La génération asynchrone permettait de faire avancer l’exécution des tâches en parallèle de leur évaluation et des mises à jour du modèle. L’entraînement réunissait plusieurs types de tâches confiées à des agents — programmation, tâches générales, vision et cybersécurité — et plusieurs environnements d’exécution, plutôt que de se concentrer sur un seul exercice.4
10
19
L’évaluation ne se limitait pas à « réussi » ou « échoué ». D’après la méthode décrite, elle associait les résultats de tests exécutables à des grilles propres aux tâches et à des comparaisons entre tentatives portant sur une même consigne. Deux réponses qui passent les tests pouvaient ainsi recevoir des appréciations différentes. Cette évaluation consommait elle-même des ressources de calcul : une analyse du rapport technique de Xiaomi l’estime à environ 12,7 % du coût de l’entraînement par renforcement de Pro.44
47
La formule initiale d’« environ 2 milliards de tokens par étape » donnait un ordre de grandeur, pas un quota fixe. Des comptes rendus ultérieurs font état de volumes plus élevés.4
19
20
La récompense d’entraînement porte sur les trajectoires utilisées pour mettre à jour le modèle : ce n’est pas, à elle seule, un test indépendant de ses capacités. Xiaomi définit dynsam/avg@n comme la moyenne, sur les consignes échantillonnées, de la proportion de tentatives réussies pour chacune. Sa variante _no_infra écarte les tentatives qui ont échoué pour des raisons d’infrastructure. Comparer les deux évite d’attribuer automatiquement au modèle un échec technique, mais aucune de ces mesures ne décrit ses performances sur toutes les tâches possibles.18
Le relevé précoce donnait à Pro et Flash des scores DeepSWE v1.1 de 62,24 et 60,77. Il s’agissait d’évaluations intermédiaires. Xiaomi a ensuite annoncé des résultats de fin d’exécution d’environ 72,6 pour Pro et 65,7 pour Flash. Ces chiffres doivent toujours être lus dans le cadre du protocole d’évaluation de Xiaomi, et non comme des résultats d’un classement public reproduits indépendamment.25
17
45
Selon Xiaomi, chaque modèle a terminé 30 étapes en moins de six jours. Le coût déclaré s’élève à environ 2,62 millions de dollars pour Pro et 850 000 dollars pour Flash, soit 3,47 millions de dollars pour les deux exécutions. Le total évoqué d’environ 750 000 trajectoires se comprend par modèle : 25 088 trajectoires potentielles par étape, multipliées par 30, donnent 752 640. Ces dépenses concernent les exécutions d’apprentissage par renforcement déclarées, pas le pré-entraînement ni tous les autres travaux de développement.2
4
44
45
Depuis, Xiaomi a annoncé les poids de Pro et Flash, un modèle distillé de 9 milliards de paramètres, un rapport technique, plus de 7 000 environnements de tâches pour l’apprentissage par renforcement, un framework couvrant cette phase de bout en bout et des mini-environnements d’exécution combinables. La particularité du tableau de bord demeure l’accès à des séries de mesures pendant les exécutions, plutôt qu’aux seuls modèles finis.1
15
Cette transparence a toutefois une limite nette : les sources disponibles ne permettent pas de vérifier indépendamment que le flux a été continu et non filtré, ni de voir toutes les activités menées en parallèle sur l’infrastructure. La publication d’un modèle distillé de 9 milliards de paramètres ne démontre pas non plus qu’un travail de distillation non affiché se déroulait derrière les exécutions Pro et Flash, ou qu’il entrait dans leurs coûts déclarés.18
15
2
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Selon Xiaomi, Pro et Flash ont chacun achevé 30 étapes d’entraînement par renforcement en moins de six jours, pour environ 2,62 millions et 850 000 dollars respectivement.[2]
Selon Xiaomi, Pro et Flash ont chacun achevé 30 étapes d’entraînement par renforcement en moins de six jours, pour environ 2,62 millions et 850 000 dollars respectivement.[2] Chaque mise à jour prévoyait 1 568 consignes et 16 tentatives par consigne, soit 25 088 trajectoires potentielles.
Les coûts et scores affichés en cours de route étaient provisoires ; le tableau de bord ne constitue ni un audit complet de l’infrastructure ni une validation indépendante des performances.[18][25][45]