Xiaomi en TileRT presenteerden in juni 2026 MiMo V2.5 Pro UltraSpeed, het eerste biljoenenparametermodel dat meer dan 1.000 tokens per seconde decodeert op één enkele server met 8 standaard GPU's. De recordbrekende snelheid is te danken aan drie technieken die nauw samenwerken: FP4 gemengde precisiequantisatie (geri...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
Op 8 juni 2026 onthulden Xiaomi's MiMo-team en inferentiepartner TileRT de MiMo-V2.5-Pro-UltraSpeed-modus . De kern van de aankondiging: een model met een biljoen (1.000 miljard) parameters dat meer dan 1.000 tokens per seconde genereert – volgens Xiaomi een primeur op deze grote schaal – en dat op één enkel standaard 8-GPU-knooppunt in plaats van op gespecialiseerde hardware
.
Xiaomi en TileRT rapporteerden een duurzame doorvoersnelheid van meer dan 1.000 tokens per seconde, met demo's die piekten tot bijna 1.200 tokens per seconde, op een standaard server met 8 GPU's . De prestatie doorbreekt wat Xiaomi de "onmogelijke driehoek" van de industrie noemt: snelheid, capaciteit en compatibiliteit met generieke GPU's
. MiMo-CEO Lei Jun bestempelde de mijlpaal in een socialmediapost als de eerste keer dat de industrie de 1.000 tokens/s-grens overschrijdt op een biljoenenparametermodel
.
De UltraSpeed-modus is geen nieuwe modelklasse, maar een door engineering gedreven inferentiemodus bovenop MiMo-V2.5-Pro. Dat is een Mixture-of-Experts-architectuur met 1,02 biljoen parameters, 42 miljard actieve parameters en een contextvenster van 1 miljoen tokens .
Xiaomi's officiële documentatie beschrijft een full-stack co-design van model en systeem dat drie gecoördineerde technieken combineert om de doorvoersnelheid voorbij de 1.000 tokens/s te stuwen .
Alleen de expertlagen in de MoE-architectuur (Mixture of Experts) worden gequantiseerd naar FP4-precisie, terwijl alle andere lagen hun oorspronkelijke precisie behouden . Quantisatiebewuste training (QAT) verkleint de geheugenvoetafdruk en bandbreedtedruk van het model, met als doel de kwaliteit vrijwel verliesvrij te houden
. Deze selectieve aanpak voorkomt dat niet-expertcomponenten, die gevoeliger zijn voor precisieverlies, worden aangetast.
DFlash vervangt de traditionele autoregressieve conceptgeneratie door gemaskeerde parallelle voorspelling op blokniveau . Het conceptmodel gebruikt sliding-window attention (SWA) om de voorspellingskosten nagenoeg constant te houden, in plaats van te laten schalen met de sequentielengte
. Een Muon-optimizer en zelfdestillatie worden ingezet om de acceptatiegraad te verhogen, wat direct leidt tot een hogere inferentiedoorvoer
. In codeerscenario's wijzen rapporten op een gemiddelde geaccepteerde lengte van ongeveer 6,30 tokens per verificatiestap
.
Het TileRT-systeem verlaat het conventionele model van per-operator kernel-lanceringen en kiest voor een persistente kernel-engine waarbij de rekencarrousel continu op de GPU aanwezig blijft . Full-pipeline prefetching overlapt gegevensverplaatsing en berekening, waardoor inactieve GPU-cycli drastisch worden verminderd
. Het systeem ontleedt ook communicatie, gegevensverplaatsing en tensorberekeningen over verschillende warps, elk met een eigen toegewezen rol. Zo verandert de GPU effectief in een continu stromend, heterogeen uitvoeringssysteem
.
De proefprijs voor de UltraSpeed-API is exact 3× de standaard outputprijs van MiMo-V2.5-Pro .
De inputprijs volgt dezelfde 3×-vermenigvuldiger: input bij een cache-hit kost $0,0108 per miljoen tokens, input bij een cache-miss kost $1,305 per miljoen tokens . Xiaomi zet dit in de markt als "3× de prijs, 10× de outputervaring" en benadrukt daarmee de ruwweg 10× hogere doorvoersnelheid voor 3× de tokenprijs
.
De UltraSpeed-proefperiode is expliciet in tijd beperkt: van 9 juni tot en met 23 juni 2026, 23:59 uur . Toegang verloopt op aanvraag vanwege de beperkte middelen voor hogesnelheidsinferentie. Voorrang wordt gegeven aan zakelijke en professionele ontwikkeltoepassingen
.
Goedgekeurde gebruikers krijgen een gratis chatervaring gedurende deze twee weken, met inachtneming van eerlijk gebruiksbeleid: maximaal 10 succesvolle wachtrijdeelnames per account per dag, een sessielimiet van 30 minuten en automatische vrijgave van middelen na 5 minuten inactiviteit . Xiaomi geeft geen garanties over de snelheid van beoordeling of het goedkeuringspercentage
.
Het onderliggende model, MiMo-V2.5-Pro-FP4-DFlash, werd gelijktijdig met de UltraSpeed-aankondiging open source uitgebracht . De FP4-gequantiseerde gewichten en DFlash-modelcheckpoints zijn beschikbaar op HuggingFace, in lijn met Xiaomi's documentatie die FP4-quantisatie en DFlash-speculatief decoderen als kerncomponenten aanwijst
.
De UltraSpeed-modus toont aan dat inferentie met biljoenen parameters op interactieve snelheden kan draaien op gangbare infrastructuur, zonder speciale chips – een breuk met de benadering van gespecialiseerde hardware die elders in de industrie te zien is . Voor ontwikkelaars die bouwen aan latentiegevoelige agentische toepassingen, tool-calling-pipelines of realtime codegeneratie, biedt de combinatie van hoge doorvoer en een contextvenster van 1 miljoen tokens een praktisch pad naar snellere, krachtigere productiesystemen — mits ze tijdens de beperkte proefperiode toegang kunnen krijgen.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Xiaomi en TileRT presenteerden in juni 2026 MiMo V2.5 Pro UltraSpeed, het eerste biljoenenparametermodel dat meer dan 1.000 tokens per seconde decodeert op één enkele server met 8 standaard GPU's.
Xiaomi en TileRT presenteerden in juni 2026 MiMo V2.5 Pro UltraSpeed, het eerste biljoenenparametermodel dat meer dan 1.000 tokens per seconde decodeert op één enkele server met 8 standaard GPU's. De recordbrekende snelheid is te danken aan drie technieken die nauw samenwerken: FP4 gemengde precisiequantisatie (gericht op MoE expertlagen), DFlash speculatief decoderen op blokniveau, en een persistente kernel en...
Het onderliggende MiMo V2.5 Pro FP4 DFlash model is direct open source gegaan. De FP4 gewichten en DFlash checkpoints zijn beschikbaar op HuggingFace, volgens Xiaomi's streven naar toegankelijke hogesnelheidsinferentie.