Xiaomin MiMo tiimi ja TileRT julkistivat kesäkuussa 2026 MiMo V2.5 Pro UltraSpeedin – biljoonan parametrin mallin, joka ylitti ensimmäisenä 1000 tokenin sekuntinopeuden yhdellä tavallisella 8 GPU:n palvelimella. Nopeusennätys perustuu kolmeen tekniseen oivallukseen: FP4 sekoitustarkkuuskvantisointiin MoE asiantuntij...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
Xiaomin tekoäly-yksikkö MiMo yhdessä päättelykumppani TileRT:n kanssa julkisti 8. kesäkuuta 2026 MiMo-V2.5-Pro-UltraSpeedin, uuden nopean päättelytilan MiMo-V2.5-Pro-malliperheelle . Julkistuksen ytimessä oli väite, jota Xiaomi kuvailee alan ensimmäiseksi: biljoonan parametrin malli, joka purkaa tekstiä yli 1 000 tokenia sekunnissa (t/s) – ja kaikki tämä tapahtuu yhdellä tavallisella palvelimella, jossa on 8 normaalia GPU-suoritinta, ei räätälöityä piisirua
.
Xiaomi ja TileRT raportoivat ylläpitäneensä yli 1 000 tokenin sekuntinopeutta, ja demoissa päästiin jopa lähes 1 200 tokeniin sekunnissa, tavallisella 8 GPU:n palvelimella . Saavutus murskaa niin sanotun alan "mahdottoman kolmion": nopeuden, kyvykkyyden ja yleiskäyttöisten GPU:iden yhteensopivuuden välillä
. MiMo:n toimitusjohtaja Lei Jun hehkutti virstanpylvästä sosiaalisessa mediassa
.
UltraSpeed ei ole täysin uusi malli, vaan insinööritaidon näyte – nopea palvelutila, joka on rakennettu MiMo-V2.5-Pro:n päälle. Kyseessä on 1,02 biljoonan parametrin "Mixture-of-Experts" (MoE) -arkkitehtuuri, jossa on 42 miljardia aktiivista parametria ja massiivinen miljoonan tokenin konteksti-ikkuna . Suomeksi tämä tarkoittaa, että malli pystyy käsittelemään kerralla hyvin pitkiä tekstejä, mikä on elintärkeää esimerkiksi laajoja kooditiedostoja tai asiakirjoja analysoitaessa.
Xiaomin virallisen dokumentaation mukaan kyseessä on koko järjestelmän kattava malli-järjestelmä-yhteissuunnittelu, jossa kolme tekniikkaa on valjastettu yhteen vauhdin nostamiseksi yli 1 000 t/s:iin .
Vain MoE-arkkitehtuurin "asiantuntijakerrokset" kvantisoidaan äärimmäisen kevyeen FP4-tarkkuuteen, kun taas muut mallin osat säilyttävät alkuperäisen tarkkuutensa . "Kvantisointitietoinen koulutus" (QAT) kutistaa mallin muistivaatimuksia ja muistiväylän painetta radikaalisti pyrkien samalla lähes häviöttömään laatuun
. Tämä valikoiva lähestymistapa välttää heikentämästä komponentteja, jotka ovat herkempiä tarkkuuden menetykselle.
DFlash korvaa perinteisen, sana sanalta etenevän "draft"-ennustuksen lohkotason rinnakkaispurkumenetelmällä . Kevyt draft-malli käyttää liukuikkunahuomiota (SWA), jotta ennustuksen laskentakustannus pysyy lähes vakiona eikä kasva tekstin pituuden myötä
. Ennusteiden oikeellisuusastetta parannetaan Muon-optimoijalla ja "itse-tislaamisella", mikä muuntuu suoraan suuremmaksi päättelyn läpivirtaukseksi. Koodaukseen liittyvissä skenaarioissa mallin on raportoitu hyväksyvän keskimäärin noin 6,30 tokenia yhtä varmennusvaihetta kohden
. Tämä tarkoittaa, että se arvaa useita sanoja kerralla oikein, mikä kiihdyttää vastauksen muodostumista huomattavasti.
TileRT-järjestelmä hylkää perinteisen tavan käynnistää jokainen laskentaoperaatio erikseen GPU:lla. Sen sijaan se käyttää pysyvää kernel-moottoria, jossa koko laskentaputki pysyy aktiivisena GPU:n sisällä . Täydellinen esihaku piilottaa tiedonsiirron laskennan alle, jolloin GPU:n joutojaksot kutistuvat minimiin
. Järjestelmä jakaa viestinnän, tiedonsiirron ja matriisilaskennan eri "warpeille" eli laskentasäiejoukoille, jotka hoitavat kukin omaa tehtäväänsä. Tämä muuttaa GPU:n jatkuvasti virtaavaksi, heterogeeniseksi suoritusjärjestelmäksi
.
UltraSpeed API:n kokeiluhinta on tasan kolminkertainen verrattuna normaaliin MiMo-V2.5-Pro-malliin . Xiaomi markkinoi tätä iskulauseella "3-kertainen hinta, 10-kertainen tuottonopeus", korostaen noin kymmenkertaista nopeushyötyä kolminkertaisella token-hinnalla
.
Syötteen hinnoittelu seuraa samaa kolminkertaista kerrointa: välimuistiosuma 0,0108 dollaria / miljoona tokenia ja välimuistihuti 1,305 dollaria / miljoona tokenia . Tämä hinnoittelu tekee erittäin nopeasta päättelystä taloudellisesti houkuttelevaa esimerkiksi agenttisovelluksille, joissa odottelu on myrkkyä.
UltraSpeed-kokeilu on tiukasti aikarajattu: 9. kesäkuuta – 23. kesäkuuta 2026 klo 23:59 . Resurssien rajallisuuden vuoksi pääsy on hakemuspohjaista, ja etusijalla ovat yritysasiakkaat ja ammattikehittäjät, joilla on todellisia tarpeita huippunopealle päättelylle
.
Hyväksytyt käyttäjät saavat ilmaisen "chat"-kokemuksen kahden viikon ikkunan ajaksi. Oikeudenmukaisuuden takaamiseksi käytössä on rajoituksia: yksi tili voi liittyä jonoon korkeintaan 10 kertaa päivässä, yhden istunnon enimmäiskesto on 30 minuuttia, ja jos istunto on toimettomana yli 5 minuuttia, resurssit vapautetaan automaattisesti . Xiaomi ei takaa hakemusten käsittelyn nopeutta tai hyväksymisprosenttia
.
UltraSpeed-julkistuksen rinnalla Xiaomi julkaisi taustalla olevan MiMo-V2.5-Pro-FP4-DFlash-mallin avoimena lähdekoodina . FP4-kvantisoidut painot ja DFlash-mallin tarkistuspisteet ovat vapaasti ladattavissa HuggingFace-palvelusta, mikä on linjassa Xiaomin dokumentaation kanssa, joka nimeää juuri nämä tekniikat järjestelmän ydinkomponenteiksi
. Tämä on suuri lahja kehittäjäyhteisölle, sillä se mahdollistaa huippunopean päättelyn kokeilun ja jatkokehityksen.
UltraSpeed-tila todistaa, että biljoonan parametrin päättely vuorovaikutteisilla nopeuksilla voidaan saavuttaa tavallisella raudalla – ilman kalliita räätälöityjä tekoälypiirejä. Tämä poikkeaa alan yleisestä trendistä, jossa nopeus on ostettu erikoissiruin . Suomalaisille kehittäjille, jotka rakentavat latenssiherkkiä agenttisovelluksia, työkaluputkia tai reaaliaikaista koodigenerointia, tämä on merkittävä askel kohti nopeampia ja kyvykkäämpiä tuotantojärjestelmiä. Yhdistettynä miljoonan tokenin konteksti-ikkunaan se avaa ovia sovelluksille, jotka aiemmin olivat liian hitaita tai kömpelöitä toteuttaa – olettaen tietysti, että kehittäjä ehtii mukaan tiukan kokeilujakson aikana.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Xiaomin MiMo tiimi ja TileRT julkistivat kesäkuussa 2026 MiMo V2.5 Pro UltraSpeedin – biljoonan parametrin mallin, joka ylitti ensimmäisenä 1000 tokenin sekuntinopeuden yhdellä tavallisella 8 GPU:n palvelimella.
Xiaomin MiMo tiimi ja TileRT julkistivat kesäkuussa 2026 MiMo V2.5 Pro UltraSpeedin – biljoonan parametrin mallin, joka ylitti ensimmäisenä 1000 tokenin sekuntinopeuden yhdellä tavallisella 8 GPU:n palvelimella. Nopeusennätys perustuu kolmeen tekniseen oivallukseen: FP4 sekoitustarkkuuskvantisointiin MoE asiantuntijakerroksille, DFlash rinnakkaispurkumenetelmään ja TileRT:n pysyvään kernel moottoriin, joka pitää laskentaputke...
Taustalla oleva MiMo V2.5 Pro FP4 DFlash malli julkaistiin avoimena lähdekoodina HuggingFace palvelussa, ja sen FP4 painot ja DFlash tarkistuspisteet ovat vapaasti kehittäjien käytettävissä.