Xiaomi viser offentligt udvalgte data fra to igangværende MiMo V2.6 RL kørsler, Pro og Flash: omkring 2 mia. Det væsentlige tekniske signal er, at Xiaomi skalerer både modelberegning, agentmiljøer og beregning til vurdering og belønning af modellernes løsninger.
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Xiaomi’s public MiMo-V2.6 reinforcement-learning post-training livestream at mimo.xiaomi.com/rl/, what does it reveal about the para. Article summary: Xiaomi’s MiMo-V2.6 page is an unusual public dashboard for *ongoing* RL post-training, not a release of a finished model. It exposes selected trainer-log telemetry for parallel unreleased Pro and Flash runs—reward and be. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Xiaomis MiMo-hold har gjort en usædvanlig del af modeludviklingen offentlig: et dashboard for reinforcement learning (RL) i eftertræningen af to endnu ikke lancerede modeller, MiMo-V2.6-Pro og MiMo-V2.6-Flash. I stedet for kun at offentliggøre en færdig benchmarktabel viser siden udvalgt træningstelemetri, herunder belønningskurver, antal rollouts, tid pr. trin, løbende beregningsomkostninger, evalueringsresultater og hændelser i infrastrukturen. 1
8
Det vigtigste er ikke, at dashboardet beviser et endeligt modelresultat. Det er, at Xiaomi behandler driften af agentbaseret RL i stor skala – rollouts, miljøer, verificering, bedømmelse, opdateringer, fejl og udgifter – som noget, der er værd at gøre synligt for offentligheden.
Ifølge omtalen af den offentlige side begyndte de parallelle Pro- og Flash-kørsler den 15. september 2026. Dashboardet følger træningen, mens modellerne stadig er under udvikling. Xiaomi har endnu ikke oplyst endelige specifikationer, priser eller offentlig adgang til nogen af modellerne. 1
8
Den oplyste batchkonfiguration er betydelig: 1.568 prompts med 16 rollouts pr. prompt – altså cirka 25.000 rollouts – og omtrent 2 mia. tokens pr. RL-trin. Xiaomi oplyser, at systemet kører fuldt asynkront. 24
Det er væsentligt, fordi der ikke er tale om en enkel præferenceoptimeringssløjfe baseret på statiske tekstpar. Luo Fuli, som leder MiMo-holdet, beskriver tre områder, der skaleres:
I praksis peger den offentlige beskrivelse på en pipeline, hvor modeller genererer handlinger eller løsninger, udfører dem i opgavemiljøer, får feedback fra testere eller vurderingskriterier og derefter opdateres på baggrund af den feedback. I den skala kan produktion af rollouts og afvikling af evalueringer være lige så vigtig operationelt som selve optimeringsalgoritmen.
Et fuldt asynkront RL-system gør det muligt at lade generering af rollouts, kørsel i miljøer, scoring og modelopdateringer fortsætte, uden at alle dele skal vente på den langsomste opgave. Det er især relevant ved blandede agentarbejdsopgaver, hvor nogle opgaver afsluttes hurtigt, mens andre kræver længere brug af værktøjer eller dyrere bedømmelse.
Xiaomis fokus på beregning til bedømmelse er også interessant. I agentopgaver kan et slutresultat afhænge af en sekvens af handlinger frem for ét enkelt svar. At fordele belønning på tværs af den sekvens – det Xiaomi kalder agentic in-group credit assignment – bliver dermed en del af træningssystemet og ikke blot et efterfølgende lag. 24
Dashboardet illustrerer derfor en praktisk pointe: Skal RL for agenter skaleres, er det ikke nok blot at tilføje flere trænings-GPU'er. Der skal også være tilstrækkelig kapacitet til miljøer, rollouts og verifikatorer, så træningssløjfen løbende får brugbar feedback.
Tidlige omtaler baseret på det offentlige dashboard anslog de samlede udgifter til over 1,08 mio. dollar i løbet af cirka 36 timer efter Pro-kørslens start – i gennemsnit omkring 30.000 dollar i timen på tværs af de to kørsler. 4 Andre øjebliksbilleder angav cirka 830.000 dollar for Pro og 360.000 dollar for Flash. De viste også en Pro-genstart knyttet til VRAM på en node og en Flash-genstart efter en datafejl ved trin 15.
9
Tallene er opsigtsvækkende, men de skal læses med forbehold:
Alligevel er én ting tydelig: Xiaomi fremstiller dette som en dyr og infrastrukturtung online-RL-indsats – ikke som et let posttræningsforsøg.
Dashboardet omfatter efter sigende belønningskurver og løbende evalueringer af kodning. I et rapporteret øjebliksbillede lå DeepSWE v1.1 på 63,72 for Pro og 60,77 for Flash. 9
Det er nyttige diagnostiske signaler, ikke endelige påstande om kapabilitet. En stigende belønningskurve kan være forenelig med bedre opgaveløsning, men kan også afspejle ændringer i opgavemiks, variation, bedømmernes adfærd, optimering mod belønningen eller eksponering for benchmarket. Tilsvarende er en score midt i træningen ikke et endeligt modelresultat, medmindre evalueringsprotokol, samplingindstillinger, kontroller mod dataforurening og den endelige udvælgelse af checkpoint dokumenteres og kontrolleres uafhængigt.
Den rimelige læsning er derfor: Streamen lader observatører se træningssignaler udvikle sig. Den viser ikke i sig selv, hvor godt en færdig MiMo-V2.6-model vil generalisere uden for den viste evaluering.
Luo Fuli siger, at holdet brugte næsten et halvt år på ét spørgsmål: Hvor langt kan reinforcement learning skaleres? Hun beskriver MiMo-V2.6 som værende midt i RL-kørslen og siger, at Xiaomi vil open source detaljer "stykke for stykke" i de kommende uger. 24
Det er et væsentligt tilsagn om yderligere teknisk indsigt, men det bør ikke læses som løfte om en komplet reproducerbarhedsudgivelse. Udtalelsen lover ikke i sig selv alle træningsdata, prompts, vægte til bedømmere, miljøimplementeringer, optimeringstilstande, samtlige checkpoints eller fulde klyngelogfiler.
MiMo-V2.6's transparens handler om synlighed i processen. Xiaomi viser udvalgt operationel telemetri fra en igangværende eftertræning af sprog- og agentmodeller.
Xiaomi-Robotics-U0 var et andet projekt og en anden form for åbenhed. Robotmodellen beskrives som en autoregressiv verdensgrundmodel med 38 mia. parametre til kropsliggjort intelligens. Den samler blandt andet tekst-til-billede-generering, billedredigering, generering af kropsliggjorte scener, embodied transfer og generering af kropsliggjort video. 25
34 Xiaomis offentlige repository beskriver udgivne model- og frameworkmaterialer til projektet.
32
Forskellen kan opsummeres sådan:
Begge dele kan være værdifulde. Ingen af dem giver automatisk alt, hvad der kræves for at reproducere hele resultatet fra bunden.
MiMo-streamen er mere afslørende end en traditionel offentliggørelse af slutbenchmarks, men der er stadig væsentlige ubesvarede spørgsmål.
Et offentligt dashboard kan være tæt på realtid og stadig indeholde forsinkede opdateringer, efterfyldte tal, korrigerede data, pauser, genstarter eller manuelle indgreb. Dets eksistens er tegn på usædvanlig åbenhed – ikke kryptografisk bevis for ubrudt kontinuitet.
Offentlige tal for prompts, rollouts, tokens og omkostninger beviser ikke fraværet af uoplyste output fra lærermodeller, proprietære data, filtrerede menneskeskabte data, skjult benchmarkeksponering eller andre input uden for dashboardet.
Uden et fuldt offentliggjort evalueringsmiljø, fastfrosne testsæt, samplingindstillinger, gentagelser med flere seeds og uafhængig replikation kan hverken belønningskurver eller foreløbige DeepSWE-resultater afgøre modellernes endelige, generelle kapabilitet.
Dashboardet kan vise fremdrift og fejl uden at afsløre hele opgavemikset, belønningsvægte, bedømmernes pålidelighed, hardwareinventar, præcis omkostningsmetode, dataproveniens eller kriterierne for valg af endeligt checkpoint.
Xiaomis MiMo-V2.6-dashboard er et sjældent eksperiment i offentlig observerbarhed af agentbaseret RL i stor skala. Den oplyste konfiguration – cirka 2 mia. tokens pr. trin, 1.568 prompts, 16 asynkrone rollouts pr. prompt, blandede miljøer og omfattende arbejde på bedømmersiden – viser, at Xiaomi betragter skalering af RL som lige så meget et systemproblem som et modeltræningsproblem. 24
De rapporterede omkostninger, belønningskurver, benchmarkøjebliksbilleder og synlige fejl gør processen mere gennemskuelig end et traditionelt lanceringsindlæg efter afsluttet træning. Men der er fortsat tale om udvalgt, selvrapporteret telemetri fra ufærdige kørsler. Dashboardet er stærkt belæg for operationel transparens – ikke et uafhængigt bevis på kontinuerlig live-træning, fuld dataproveniens eller den endelige modelkvalitet.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaomi viser offentligt udvalgte data fra to igangværende MiMo V2.6 RL kørsler, Pro og Flash: omkring 2 mia.
Xiaomi viser offentligt udvalgte data fra to igangværende MiMo V2.6 RL kørsler, Pro og Flash: omkring 2 mia. Det væsentlige tekniske signal er, at Xiaomi skalerer både modelberegning, agentmiljøer og beregning til vurdering og belønning af modellernes løsninger.
Dashboardet er usædvanligt åbent om fremdrift og enkelte fejl, men kurverne kan ikke i sig selv dokumentere ubrudt live træning, dataproveniens eller endelig modelydelse.