Xiaomi visar utvald telemetri från två ännu ofärdiga MiMo V2.6 körningar, Pro och Flash: omkring 2 miljarder token per steg för 1 568 promptar × 16 utrullningar. Den tekniska huvudpoängen är att Xiaomi skalar inte bara modellberäkning, utan också agentmiljöer, testinfrastruktur och beräkningskapacitet för utvärderin...
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Xiaomi’s public MiMo-V2.6 reinforcement-learning post-training livestream at mimo.xiaomi.com/rl/, what does it reveal about the para. Article summary: Xiaomi’s MiMo-V2.6 page is an unusual public dashboard for *ongoing* RL post-training, not a release of a finished model. It exposes selected trainer-log telemetry for parallel unreleased Pro and Flash runs—reward and be. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Xiaomis MiMo-team har öppnat en ovanlig del av modellutvecklingen för allmänheten: en instrumentpanel för RL-efterträningen – förstärkningsinlärning – av de ännu ej släppta modellerna MiMo-V2.6-Pro och MiMo-V2.6-Flash. I stället för att bara publicera en tabell med slutliga benchmarkresultat visar sidan utvald träningsdata: belöningskurvor, antal utrullningar, tidsåtgång per steg, löpande beräkningskostnader, utvärderingsresultat och infrastrukturhändelser. 1
8
Det viktigaste är inte att panelen bevisar hur bra de färdiga modellerna blir. Det är att Xiaomi gör driften av storskalig, agentbaserad RL – utrullningar, miljöer, verifiering, betygsättning, uppdateringar, avbrott och kostnader – till något som kan följas offentligt.
Enligt rapporteringen startade de parallella Pro- och Flash-körningarna den 15 september 2026. Instrumentpanelen följer träningen medan modellerna fortfarande utvecklas; Xiaomi har ännu inte meddelat slutliga specifikationer, priser eller när modellerna blir tillgängliga för allmänheten. 1
8
Den redovisade batchkonfigurationen är omfattande: 1 568 promptar med 16 utrullningar per prompt, alltså cirka 25 000 utrullningar, och ungefär 2 miljarder token per RL-steg. Xiaomi uppger att systemet är helt asynkront. 24
Det här beskrivs alltså inte som en enkel optimeringsloop baserad på statiska par av textsvar. Luo Fuli, som leder MiMo-teamet, beskriver tre skalningsdimensioner:
I praktiken tyder beskrivningen på en kedja där modeller tar fram lösningar eller handlingar, kör dem i uppgiftsmiljöer, får återkoppling från verifierare eller bedömningsmallar och sedan uppdateras utifrån den återkopplingen. I den här skalan kan det vara minst lika viktigt att skapa utrullningar och köra utvärderingar som att optimera själva modellen.
Ett helt asynkront RL-system låter generering av utrullningar, exekvering i miljöer, poängsättning och modelluppdateringar fortsätta utan att alla delar måste vänta på den långsammaste uppgiften. Det är särskilt relevant för blandade agentarbetslaster: vissa uppgifter blir snabbt klara, medan andra kräver längre användning av verktyg eller mer beräkningskrävande bedömning.
Xiaomis fokus på beräkningskapacitet för bedömning är också betydelsefullt. I agentuppgifter kan slutresultatet bero på en hel kedja av handlingar, inte på ett enda svar. Att fördela belöningen över den kedjan – det som Xiaomi kallar agentbaserad kreditallokering inom gruppen – blir då en del av träningssystemet, snarare än ett tillägg i efterhand. 24
Instrumentpanelen förmedlar därmed en operativ lärdom: att skala RL för agenter handlar inte bara om fler GPU:er för träning. Det kräver också tillräcklig kapacitet i miljöer, utrullningar och verifiering för att träningsloopen ska få användbar återkoppling.
Tidiga rapporter, baserade på den offentliga panelen, angav samlade utgifter på över 1,08 miljoner dollar under ungefär 36 timmar efter att Pro startade – i snitt omkring 30 000 dollar i timmen för de två körningarna. 4 Andra ögonblicksbilder visade cirka 830 000 dollar för Pro och 360 000 dollar för Flash. De visade också en omstart av Pro kopplad till VRAM i en nod samt en omstart av Flash efter ett datasetfel vid steg 15.
9
Siffrorna sticker ut, men bör läsas försiktigt:
Ändå är en sak tydlig: Xiaomi framställer detta som en dyr, infrastrukturtung satsning på online-RL – inte som ett litet efterträningsexperiment.
Panelen uppges innehålla belöningskurvor och kodutvärderingar mitt under träningen. I en rapporterad ögonblicksbild fick Pro 63,72 och Flash 60,77 på DeepSWE v1.1. 9
Detta är användbara diagnossignaler, inte slutliga påståenden om modellkapacitet. En stigande belöningskurva kan vara förenlig med bättre uppgiftslösning, men kan också påverkas av förändrad uppgiftsmix, variation, bedömares beteende, optimering mot belöningen eller exponering mot benchmarken. På samma sätt är ett benchmarkresultat mitt i körningen inte ett slutresultat utan dokumentation av utvärderingsprotokoll, samplingsinställningar, kontroller mot datakontaminering och hur slutlig kontrollpunkt väljs.
Den rimliga tolkningen är att sändningen låter utomstående följa hur träningssignaler utvecklas. Den visar inte i sig hur väl en färdig MiMo-V2.6-modell generaliserar utanför den redovisade utvärderingsmiljön.
Luo Fuli säger att teamet ägnade nästan ett halvår åt en fråga: hur långt förstärkningsinlärning kan skalas. Hon beskriver MiMo-V2.6 som mitt i sin RL-körning och säger att Xiaomi ska öppenpublicera detaljer ”bit för bit” under de kommande veckorna. 24
Det är ett betydelsefullt löfte om ytterligare teknisk insyn, men det bör inte tolkas som ett fullständigt reproducerbarhetspaket. Uttalandet lovar inte i sig alla träningsdata, promptar, vikter för bedömare, miljöimplementationer, optimeringstillstånd, samtliga kontrollpunkter eller kompletta klusterloggar.
MiMo-V2.6:s transparens handlar om insyn i processen. Xiaomi visar utvald driftstelemetri från en pågående efterträning för språk- och agentmodeller.
Xiaomi-Robotics-U0 var ett annat slags projekt och en annan sorts öppenhet. Robotikmodellen beskrivs som en autoregressiv världsfundamentmodell med 38 miljarder parametrar för förkroppsligad intelligens. Den samlar uppgifter som text-till-bild-generering, bildredigering, generering av förkroppsligade scener, överföring mellan sådana scener och generering av förkroppsligad video. 25
34 Xiaomis publika kodförråd beskriver släppta modell- och ramverksmaterial för projektet.
32
Skillnaden är i korthet:
Båda kan vara värdefulla. Ingen av formerna innebär automatiskt att utomstående kan reproducera hela resultatet från grunden.
MiMo-sändningen är mer avslöjande än ett vanligt pressmeddelande med slutliga benchmarkresultat, men flera viktiga osäkerheter kvarstår.
En publik instrumentpanel kan ligga nära realtid och ändå innehålla fördröjda uppdateringar, data som fylls på i efterhand, korrigerade värden, pauser, omstarter eller manuella ingrepp. Att panelen finns är belägg för ovanlig öppenhet – inte kryptografiskt bevis för en oavbruten träningskörning.
Offentliga siffror för promptar, utrullningar, token och kostnader bevisar inte frånvaron av oredovisade utdata från lärarmodeller, proprietära data, filtrerade mänskliga data, dold benchmarkexponering eller andra inslag utanför panelen.
Utan en fullt publicerad utvärderingsmiljö, frysta testuppsättningar, samplingsinställningar, upprepade slumpfrön och oberoende replikering kan varken belöningskurvor eller preliminära DeepSWE-resultat avgöra modellernas slutliga generella förmåga.
Panelen kan visa framsteg och incidenter utan att avslöja hela uppgiftsmixen, viktningen av belöningar, bedömarnas tillförlitlighet, hårdvaruinventariet, exakt kostnadsmetod, dataproveniens eller kriterierna för att välja slutlig kontrollpunkt.
Xiaomis MiMo-V2.6-panel är ett sällsynt offentligt observabilitetsexperiment för storskalig agentbaserad RL. Den redovisade konfigurationen – ungefär 2 miljarder token per steg, 1 568 promptar, 16 asynkrona utrullningar per prompt, blandade miljöer och omfattande bedömningsarbete – visar att Xiaomi ser skalning av RL som lika mycket ett systemproblem som ett rent modellträningsproblem. 24
De redovisade kostnaderna, belöningskurvorna, benchmarkögonblicksbilderna och synliga felen gör processen mer möjlig att granska än en lanseringspost i efterhand. Men det är fortfarande utvald och självrapporterad telemetri från oavslutade körningar. Panelen är starka belägg för operativ transparens – inte ett oberoende bevis på kontinuerlig direktsänd träning, fullständig träningsproveniens eller slutlig modellkvalitet.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaomi visar utvald telemetri från två ännu ofärdiga MiMo V2.6 körningar, Pro och Flash: omkring 2 miljarder token per steg för 1 568 promptar × 16 utrullningar.
Xiaomi visar utvald telemetri från två ännu ofärdiga MiMo V2.6 körningar, Pro och Flash: omkring 2 miljarder token per steg för 1 568 promptar × 16 utrullningar. Den tekniska huvudpoängen är att Xiaomi skalar inte bara modellberäkning, utan också agentmiljöer, testinfrastruktur och beräkningskapacitet för utvärdering och betygsättning.
Instrumentpanelen ger ovanligt god insyn i drift och vissa fel, men kurvorna kan inte bevisa oavbruten direktsändning, full dataproveniens eller oberoende verifierad slutprestanda.