Xiaomi veřejně zobrazuje vybranou telemetrii dvou nedokončených RL běhů MiMo V2.6, Pro a Flash: zhruba 2 miliardy tokenů na krok, 1 568 promptů a 16 rolloutů na každý prompt. Podstatné není jen škálování výpočtu modelu.
PublikovalUpraveno pomocí GPT-5.6 TerraObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Xiaomi’s public MiMo-V2.6 reinforcement-learning post-training livestream at mimo.xiaomi.com/rl/, what does it reveal about the para. Article summary: Xiaomi’s MiMo-V2.6 page is an unusual public dashboard for *ongoing* RL post-training, not a release of a finished model. It exposes selected trainer-log telemetry for parallel unreleased Pro and Flash runs—reward and be. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Xiaomi zpřístupnilo nezvyklý pohled do vývoje AI: veřejný dashboard sleduje reinforcement learning (RL, posilované učení) při dodatečném tréninku dvou dosud nevydaných modelů, MiMo-V2.6-Pro a MiMo-V2.6-Flash. Místo obvyklé tabulky výsledků až po dokončení projektu stránka ukazuje vybranou provozní telemetrii — křivky odměn, počty rolloutů, délku kroků, průběžné odhady výpočetních nákladů, vyhodnocení i události v infrastruktuře. 1
8
Hlavní sdělení není, že dashboard už prokazuje kvalitu hotového modelu. Ukazuje především to, že Xiaomi považuje provoz rozsáhlého agentního RL — generování rolloutů, běh prostředí, ověřování, hodnocení, aktualizace, chyby i spotřebu výpočtů — za něco, co má smysl sledovat veřejně.
Podle zpráv oba paralelní běhy Pro a Flash začaly 15. září 2026. Modely jsou stále ve fázi tréninku a Xiaomi pro žádný z nich zatím neoznámilo konečné parametry, cenu ani veřejnou dostupnost. 1
8
Zveřejněná konfigurace jedné dávky je značná: 1 568 promptů se 16 rollouts na každý prompt, tedy přibližně 25 000 rolloutů, a asi 2 miliardy tokenů na jeden RL krok. Xiaomi uvádí, že systém funguje plně asynchronně. 24
Nejde tedy o jednoduchou optimalizaci preferencí nad statickými dvojicemi textů. Luo Fuli, vedoucí týmu MiMo, popsala škálování ve třech směrech:
Prakticky to znamená, že model vytváří akce či řešení, provádí je v prostředí úlohy, získává zpětnou vazbu z ověřovačů nebo hodnoticích pravidel a podle ní se aktualizuje. V tomto měřítku mohou být generování rolloutů a provoz hodnotitelů stejně důležité jako samotný optimalizátor.
Plně asynchronní RL systém dovoluje, aby generování rolloutů, provádění úloh v prostředí, bodování i aktualizace modelu běžely souběžně. Jednotlivé části tak nemusejí čekat na nejpomalejší úlohu. To je zvlášť podstatné u smíšených agentních pracovních zátěží: některé úlohy skončí rychle, jiné vyžadují delší práci s nástroji nebo nákladnější vyhodnocení.
Důležitý je i deklarovaný důraz na výpočty hodnotitelů. U agentních úloh nezáleží jen na jedné finální odpovědi, ale často na celé posloupnosti kroků. Rozdělit odměnu mezi tyto kroky — Xiaomi to označuje jako agentní přiřazování zásluh v rámci skupiny — se proto stává přímo součástí trénovacího systému. 24
Dashboard tak ilustruje širší poučení: škálování RL pro agenty není jen otázkou přidání GPU pro trénink. Je nutné mít také dostatek kapacity v prostředích, pro rollouty a pro ověřování, aby trénink dostával použitelnou zpětnou vazbu.
První reporty založené na veřejném dashboardu uváděly společnou útratu přes 1,08 milionu dolarů během zhruba 36 hodin od startu Pro, tedy v průměru asi 30 000 dolarů za hodinu napříč oběma běhy. 4 Jiné snímky dashboardu uváděly přibližně 830 000 dolarů pro Pro a 360 000 dolarů pro Flash. Zároveň zaznamenaly restart Pro spojený s VRAM uzlu a restart Flash po chybě datové sady v kroku 15.
9
Čísla jsou výrazná, ale je nutné je vykládat opatrně:
Jednu věc ale počítadlo nákladů zdůrazňuje jasně: Xiaomi tento projekt prezentuje jako drahý, infrastrukturně náročný online RL běh, nikoli jako malý post-tréninkový experiment.
Dashboard podle zpráv obsahuje křivky odměn a průběžná hodnocení programování. Jeden ze zveřejněných snímků uváděl pro benchmark DeepSWE v1.1 skóre 63,72 pro Pro a 60,77 pro Flash. 9
Jsou to užitečné diagnostické ukazatele, ne konečná tvrzení o schopnostech. Rostoucí křivka odměn může odpovídat lepšímu plnění úloh, ale může také souviset se změnou skladby úloh, rozptylem výsledků, chováním hodnotitele, optimalizací přímo na odměnu nebo expozicí benchmarku. Stejně tak průběžné skóre benchmarku není finálním výsledkem, dokud nejsou zdokumentovány vyhodnocovací postupy, nastavení vzorkování, kontrola kontaminace benchmarku a způsob výběru finálního checkpointu — ideálně i nezávisle ověřeny.
Správná interpretace zní: stream dovoluje sledovat vývoj trénovacích signálů. Sám však neukazuje, jak dobře bude hotový MiMo-V2.6 fungovat mimo zobrazené vyhodnocovací prostředí.
Luo Fuli uvedla, že tým strávil téměř půl roku zkoumáním jediné otázky: kam až lze RL škálovat. MiMo-V2.6 podle ní zůstává uprostřed RL běhu a Xiaomi má v následujících týdnech zveřejňovat technické podrobnosti postupně. 24
Jde o podstatný příslib dalšího technického zveřejňování, nikoli však automaticky o kompletní balíček pro reprodukci výsledku. Tvrzení samo o sobě neslibuje uvolnění všech trénovacích dat, promptů, vah hodnotitelů, implementací prostředí, stavů optimalizátoru, všech checkpointů ani kompletních clusterových logů.
Transparentnost MiMo-V2.6 je především transparentností procesu: Xiaomi ukazuje vybranou provozní telemetrii z probíhajícího dodatečného tréninku jazykových a agentních modelů.
Xiaomi-Robotics-U0 byl jiný projekt i jiný druh otevřenosti. Jde o 38miliardový autoregresní základní world model pro vtělenou inteligenci, který spojuje úlohy jako generování obrázků z textu, úpravy obrázků, generování scén pro robotiku, přenos do jiného ztělesnění a generování videí s vtělenou interakcí. 25
34 Veřejný repozitář Xiaomi k tomuto projektu popisuje zpřístupněné modelové a frameworkové materiály.
32
Rozdíl lze shrnout jednoduše:
Obě formy mohou být užitečné. Ani jedna sama o sobě automaticky neposkytuje vše potřebné k reprodukci kompletního výsledku od začátku.
Stream MiMo ukazuje víc než běžné oznámení konečných benchmarků, zásadní nejistoty ale zůstávají.
Veřejný dashboard může být téměř v reálném čase, přesto může obsahovat zpožděné aktualizace, zpětně doplněné nebo opravené hodnoty, pauzy, restarty či manuální zásahy. Jeho existence dokládá neobvykle otevřený přístup, ne kryptografický důkaz nepřerušeného běhu.
Veřejné počty promptů, rolloutů, tokenů a nákladů neprokazují, že se nepoužívají nezveřejněné výstupy učitelských modelů, proprietární data, filtrovaná lidská data, skrytá expozice benchmarkům či jiné vstupy mimo dashboard.
Bez plně zveřejněného hodnoticího frameworku, zmrazených testovacích sad, nastavení vzorkování, opakovaných seedů a nezávislé replikace nemohou ani reward křivky, ani průběžné výsledky DeepSWE rozhodnout o finální obecné schopnosti modelů.
Dashboard může ukazovat postup i incidenty, aniž by odhalil úplnou skladbu úloh, váhy odměn, spolehlivost hodnotitelů, hardwarový inventář, přesnou metodiku výpočtu nákladů, původ dat či kritéria pro volbu konečného checkpointu.
Dashboard MiMo-V2.6 je vzácným experimentem s veřejnou pozorovatelností rozsáhlého agentního RL. Zveřejněná konfigurace — zhruba 2 miliardy tokenů na krok, 1 568 promptů, 16 asynchronních rolloutů na prompt, kombinovaná prostředí a náročná práce hodnotitelů — ukazuje, že Xiaomi vnímá škálování RL stejně jako problém systémového provozu, ne jen jako samotné učení modelu. 24
Uváděné náklady, reward křivky, benchmarkové snímky i viditelné chyby činí proces kontrolovatelnějším než běžné oznámení po dokončení tréninku. Pořád však jde o vybranou, firmou uváděnou telemetrii z nedokončených běhů. Dashboard je silným dokladem provozní otevřenosti — nikoli nezávislým důkazem souvislého živého tréninku, úplného původu trénovacích dat nebo finální kvality modelu.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaomi veřejně zobrazuje vybranou telemetrii dvou nedokončených RL běhů MiMo V2.6, Pro a Flash: zhruba 2 miliardy tokenů na krok, 1 568 promptů a 16 rolloutů na každý prompt.
Xiaomi veřejně zobrazuje vybranou telemetrii dvou nedokončených RL běhů MiMo V2.6, Pro a Flash: zhruba 2 miliardy tokenů na krok, 1 568 promptů a 16 rolloutů na každý prompt. Podstatné není jen škálování výpočtu modelu. Tým uvádí také kombinaci více agentních prostředí a vysoké výpočetní nároky na hodnotitele, kteří přidělují odměny podle testů a hodnoticích pravidel.
Dashboard neobvykle otevřeně ukazuje provozní postup i některé chyby, sám o sobě však nedokládá nepřerušený živý běh, původ všech dat ani nezávisle ověřenou schopnost finálního modelu.