Xiaomi och TileRT meddelade i juni 2026 lanseringen av MiMo V2.5 Pro UltraSpeed – den första biljonparametersmodellen som passerar 1 000 tokens per sekund i avkodningshastighet på en enda standard 8‑GPU‑server, helt u... Hastighetsrekordet bygger på tre samordnade tekniker: FP4‑kvantisering med blandad precision för...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
Den 8 juni 2026 släppte Xiaomis MiMo-team och inferenspartnern TileRT MiMo-V2.5-Pro-UltraSpeed, ett högpresterande inferensläge för modellfamiljen MiMo-V2.5-Pro . Tillkännagivandet kretsade kring en enda milstolpe: en biljonparametersmodell som levererar över 1 000 tokens per sekund – något Xiaomi beskriver som en första gång i den skalan – och allt körs på en standardnod med åtta vanliga GPU:er i stället för specialdesignad hårdvara
.
Xiaomi och TileRT rapporterade en uthållig genomströmning över 1 000 tokens per sekund, med demonstrationstoppar nära 1 200 tokens per sekund, på en vanlig 8‑GPU‑server . Bedriften krossar vad Xiaomi kallar branschens "omöjliga triangel" mellan hastighet, kapacitet och kompatibilitet med generella GPU:er
. MiMo:s vd Lei Jun lyfte fram milstolpen i ett inlägg och beskrev det som branschens första gång över 1 000 tokens/s på en biljonparametersmodell
.
UltraSpeed-läget är ingen ny modellklass, utan ett teknikdrivet serveringsläge ovanpå MiMo-V2.5-Pro: en MoE‑arkitektur (Mixture-of-Experts) med 1,02 biljoner parametrar, 42 miljarder aktiva parametrar och ett kontextfönster på 1 miljon tokens .
Xiaomis officiella dokumentation beskriver en heltäckande samdesign av modell och system som kombinerar tre koordinerade tekniker för att pressa genomströmningen förbi 1 000 tokens/s .
Endast MoE‑expertskikten kvantiseras till FP4‑precision, medan alla övriga lager behåller sin ursprungliga precision . Kvantiseringsmedveten träning (QAT) minskar modellens minnesfotavtryck och bandbreddstryck med målet att behålla kvaliteten nära förlustfri nivå
. Detta selektiva angreppssätt undviker att försämra icke‑expertkomponenter som är känsligare för precisionsförluster.
DFlash ersätter traditionell autoregressiv utkastgenerering med blockbaserad maskerad parallellprediktion . Utkastmodellen använder sliding‑window attention (SWA) för att hålla prediktionskostnaden nära konstant, i stället för att skala med sekvenslängden
. En Muon‑optimerare och självdestillering används för att förbättra acceptansfrekvensen, vilket direkt ökar inferensgenomströmningen
. I kodningsscenarier rapporteras en genomsnittlig accepterad längd om cirka 6,30 tokens per verifieringssteg
.
TileRT‑systemet överger den konventionella modellen med per‑operator kernel‑anrop till förmån för en persistent kernel‑motor där beräkningspipelinen förblir resident på GPU:n . Full pipeline‑prefetching överlappar dataförflyttning med beräkning och minskar dramatisk GPU‑cykler som går i tomgång
. Systemet bryter också ned kommunikation, dataförflyttning och tensorberäkning över olika warps med dedikerade roller, vilket i praktiken förvandlar GPU:n till ett kontinuerligt flödande, heterogent exekveringssystem
.
Testpriset för UltraSpeed‑API:et är satt till exakt 3× standardpriset för MiMo-V2.5-Pro för output .
Input‑prissättningen följer samma 3× multiplikator, med cache‑träff‑input på $0,0108 per miljon tokens och cache‑miss‑input på $1,305 per miljon tokens . Xiaomi marknadsför detta som "3× priset, 10× outputupplevelsen" och betonar att man får ungefär tio gånger högre genomströmning för tre gånger tokenkostnaden
.
Testperioden för UltraSpeed är tydligt tidsbegränsad: 9 juni till 23 juni 2026 klockan 23:59 . Tillgången är ansökningsbaserad på grund av begränsade höghastighets‑inferensresurser, med prioritet för företag och professionella utvecklingsfall
.
Godkända användare får en kostnadsfri chattupplevelse under tvåveckorsfönstret, under rättviseregler: högst 10 lyckade köposter per konto och dag, en sessionsgräns på 30 minuter och automatisk resursfrigivning efter 5 minuters inaktivitet . Xiaomi garanterar varken granskningstider eller godkännandegrad
.
Den underliggande modellen, benämnd MiMo-V2.5-Pro-FP4-DFlash, släpptes som öppen källkod samtidigt som UltraSpeed‑tillkännagivandet . De FP4‑kvantiserade vikterna och DFlash‑modellcheckpointsen finns tillgängliga på HuggingFace, i linje med Xiaomis dokumentation som identifierar FP4‑kvantisering och DFlash spekulativ avkodning som centrala systemkomponenter
.
UltraSpeed‑läget visar att inferens på biljonparametersnivå vid interaktiva hastigheter kan köras på vanlig infrastruktur utan specialkretsar – ett avsteg från den specialhårdvaruintensiva ansats som syns på andra håll i branschen . För utvecklare som bygger latenskänsliga agenttillämpningar, verktygsanropande pipelines eller realtidskodgenerering innebär kombinationen av hög genomströmning och ett kontextfönster på 1 miljon tokens en praktisk väg mot snabbare och mer kapabla produktionssystem – förutsatt att de får tillgång under den begränsade testperioden.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Xiaomi och TileRT meddelade i juni 2026 lanseringen av MiMo V2.5 Pro UltraSpeed – den första biljonparametersmodellen som passerar 1 000 tokens per sekund i avkodningshastighet på en enda standard 8‑GPU‑server, helt u...
Xiaomi och TileRT meddelade i juni 2026 lanseringen av MiMo V2.5 Pro UltraSpeed – den första biljonparametersmodellen som passerar 1 000 tokens per sekund i avkodningshastighet på en enda standard 8‑GPU‑server, helt u... Hastighetsrekordet bygger på tre samordnade tekniker: FP4‑kvantisering med blandad precision för MoE‑expertskikten, DFlash blockspecifikativ parallell‑prediktion samt TileRT:s persistenta kernel‑motor med warp‑special...
Den underliggande modellen MiMo V2.5 Pro FP4 DFlash släpptes som öppen källkod i samband med lanseringen, med FP4‑vikter och DFlash‑checkpoints tillgängliga på HuggingFace.