Xiaomi a TileRT v červnu 2026 představili MiMo V2.5 Pro UltraSpeed – historicky první model s bilionem parametrů, který na jediném standardním 8 GPU serveru překonal dekódovací rychlost 1000 tokenů za sekundu. Tohoto milníku bylo dosaženo kombinací tří klíčových technik: FP4 smíšené přesné kvantizace u expertních vr...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
Dne 8. června 2026 tým Xiaomi MiMo ve spolupráci s partnerem pro inferenci TileRT uvedl na trh MiMo-V2.5-Pro-UltraSpeed, vysokorychlostní inferenční režim pro rodinu modelů MiMo-V2.5-Pro . Hlavním tahákem je jediné tvrzení: model s jedním bilionem (1 000 miliard) parametrů dosahuje rychlosti přes 1 000 tokenů za sekundu – což Xiaomi označuje za první počin v tomto měřítku – a to na jediném standardním komoditním uzlu s 8 GPU, nikoli na speciálním hardwaru
.
Xiaomi a TileRT ohlásili trvalou propustnost nad 1 000 tokenů za sekundu, přičemž demonstrace ukazovaly špičky až kolem 1 200 tokenů za sekundu, na standardním serveru s 8 GPU . Tento úspěch boří to, co Xiaomi nazývá „nemožným trojúhelníkem“ v oboru – současné dosažení rychlosti, výkonu a kompatibility s univerzálními GPU
. Generální ředitel Xiaomi, Lei Jun, na sociálních sítích vyzdvihl tento milník jako první případ v oboru, kdy model s bilionem parametrů překonal hranici 1 000 tokenů/s
.
Režim UltraSpeed není novou třídou modelu, ale inženýrsky řízeným servírovacím režimem navrstveným na model MiMo-V2.5-Pro. Ten je architekturou Mixture-of-Experts (směs expertů) s 1,02 biliony parametrů, 42 miliardami aktivních parametrů a kontextovým oknem o velikosti 1 milionu tokenů .
Oficiální dokumentace Xiaomi popisuje komplexní co-design modelu a systému, který kombinuje tři koordinované techniky k dosažení propustnosti přes 1 000 tokenů/s .
Pouze expertní vrstvy architektury MoE jsou kvantizovány na přesnost FP4, zatímco všechny ostatní vrstvy si zachovávají původní přesnost . Kvantizačně uvědomělý trénink (QAT) snižuje paměťovou stopu modelu a tlak na přenosovou kapacitu paměti s cílem zachovat kvalitu téměř bez ztrát
. Tento selektivní přístup zabraňuje degradaci ne-expertních komponent, které jsou citlivější na ztrátu přesnosti.
DFlash nahrazuje tradiční autoregresní generování návrhů blokovou maskovanou paralelní predikcí . Návrhový model využívá klouzavou okenní pozornost (SWA), aby udržel náklady na predikci téměř konstantní, místo aby se škálovaly s délkou sekvence
. K vylepšení míry akceptace se používá optimalizátor Muon a sebedestilace, což přímo zvyšuje propustnost inference
. V kódovacích scénářích zprávy uvádějí průměrnou akceptovanou délku kolem 6,30 tokenů na jeden ověřovací krok
.
Systém TileRT opouští konvenční model spouštění kernelů pro jednotlivé operátory a přechází na persistentní kernel engine, kde výpočetní pipeline zůstává rezidentní na GPU . Prefetching celé pipeline překrývá přesuny dat s výpočtem, čímž dramaticky snižuje nečinné cykly GPU
. Systém také rozkládá komunikaci, přesun dat a tenzorové výpočty mezi různé warpy s dedikovanými rolemi, čímž z GPU efektivně vytváří plynule běžící heterogenní výkonný systém
.
Zkušební cena UltraSpeed API je stanovena přesně na 3násobek standardní ceny výstupu modelu MiMo-V2.5-Pro . Pro české vývojáře, kteří obvykle využívají mezinárodní ceny v dolarech, to znamená:
Ceny vstupů se řídí stejným trojnásobným násobitelem. Při využití cache vyjde vstup na $0.0108 za milion tokenů, bez cache pak $1.305 za milion tokenů . Xiaomi toto nastavení propaguje heslem „3× vyšší cena, 10× lepší výstupní zážitek“, čímž zdůrazňuje zhruba desetinásobné zvýšení propustnosti za trojnásobnou cenu tokenu
.
Zkušební období UltraSpeed API je explicitně časově omezeno: od 9. června do 23. června 2026, do 23:59 . Přístup je založen na žádosti kvůli omezeným vysokorychlostním inferenčním zdrojům, přičemž prioritu mají firemní a profesionální vývojářské případy užití
.
Schválení uživatelé získají během dvoutýdenního okna bezplatný chatovací zážitek, který podléhá pravidlům férovosti: maximálně 10 úspěšných zařazení do fronty na účet za den, limit 30 minut na jednu relaci a automatické uvolnění zdrojů po 5 minutách nečinnosti . Xiaomi negarantuje rychlost vyřízení žádosti ani míru schválení
.
Základní model, označovaný jako MiMo-V2.5-Pro-FP4-DFlash, byl spolu s oznámením UltraSpeed uvolněn jako open-source . FP4 kvantizované váhy a DFlash modelové checkpointy jsou dostupné na platformě HuggingFace, což je v souladu s dokumentací Xiaomi, která FP4 kvantizaci a DFlash spekulativní dekódování označuje jako klíčové systémové komponenty
.
Režim UltraSpeed demonstruje, že inference modelů s bilionem parametrů při interaktivních rychlostech může běžet na komoditní infrastruktuře bez potřeby speciálních čipů. To je zásadní odklon od přístupu spoléhání se na specializovaný hardware, který je vidět jinde v oboru . Pro vývojáře, kteří budují aplikace s agenty citlivými na latenci, pipeline pro volání nástrojů nebo generování kódu v reálném čase, představuje kombinace vysoké propustnosti a kontextového okna o velikosti milionu tokenů praktickou cestu k rychlejším a schopnějším produkčním systémům – za předpokladu, že se jim podaří získat přístup během omezeného zkušebního okna.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Xiaomi a TileRT v červnu 2026 představili MiMo V2.5 Pro UltraSpeed – historicky první model s bilionem parametrů, který na jediném standardním 8 GPU serveru překonal dekódovací rychlost 1000 tokenů za sekundu.
Xiaomi a TileRT v červnu 2026 představili MiMo V2.5 Pro UltraSpeed – historicky první model s bilionem parametrů, který na jediném standardním 8 GPU serveru překonal dekódovací rychlost 1000 tokenů za sekundu. Tohoto milníku bylo dosaženo kombinací tří klíčových technik: FP4 smíšené přesné kvantizace u expertních vrstev MoE, blokového maskovaného paralelního spekulativního dekódování DFlash a persistentního kernel enginu Ti...
Základní model MiMo V2.5 Pro FP4 DFlash byl zároveň uvolněn jako open source s FP4 váhami a DFlash checkpointy dostupnými na HuggingFace, což je v souladu se snahou Xiaomi o dostupnou vysokorychlostní inferenci.