Xiaomi dan TileRT mengumumkan MiMo V2.5 Pro UltraSpeed pada Jun 2026, model trilion parameter pertama yang memecah kelajuan decode 1,000 token sesaat pada satu pelayan GPU 8 kad standard, bukannya cip khas. Pencapaian kelajuan ini dicapai melalui tiga teknik terselaras: kuantisasi ketepatan campuran FP4 mensasarkan...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
Pada 8 Jun 2026, pasukan MiMo Xiaomi dan rakan kongsi inferens TileRT melancarkan MiMo-V2.5-Pro-UltraSpeed, sebuah mod inferens berkelajuan tinggi untuk keluarga model MiMo-V2.5-Pro . Pengumuman ini berkisar pada satu dakwaan utama: model 1 trilion parameter mencapai lebih 1,000 token sesaat — yang digambarkan oleh Xiaomi sebagai yang pertama pada skala itu — sambil berjalan pada satu nod komoditi GPU 8-kad standard dan bukannya perkakasan tersuai
.
Xiaomi dan TileRT melaporkan pemprosesan mampan melebihi 1,000 token sesaat, dengan demo memuncak hampir 1,200 token sesaat, pada satu pelayan GPU 8-kad standard . Kejayaan ini menembusi apa yang digelar Xiaomi sebagai "segitiga mustahil" industri iaitu kelajuan, keupayaan, dan keserasian GPU tujuan umum
. Ketua Pegawai Eksekutif MiMo, Lei Jun, mengetengahkan pencapaian ini dalam satu hantaran sosial, menyifatkannya sebagai kali pertama industri melepasi 1,000 token/s pada model trilion parameter
.
Mod UltraSpeed bukanlah kelas model baharu, tetapi mod servis dipacu kejuruteraan yang dilapiskan di atas MiMo-V2.5-Pro, sebuah seni bina Campuran Pakar (Mixture-of-Experts) 1.02 trilion parameter dengan 42 bilion parameter aktif dan tetingkap konteks 1 juta token .
Dokumentasi rasmi Xiaomi menerangkan rekabentuk bersama sistem-model tindanan penuh yang menggabungkan tiga teknik terselaras untuk menolak pemprosesan melepasi 1,000 token/s .
Hanya lapisan pakar MoE (Campuran Pakar) dikuantisasi kepada ketepatan FP4, manakala semua lapisan lain mengekalkan ketepatan asalnya . Latihan sedar kuantisasi (QAT) mengurangkan jejak memori model dan tekanan lebar jalur dengan matlamat mengekalkan kualiti hampir tanpa kehilangan
. Pendekatan terpilih ini mengelakkan kemerosotan komponen bukan pakar yang lebih sensitif terhadap kehilangan ketepatan.
DFlash menggantikan penjanaan draf autoregresif tradisional dengan ramalan selari bertopeng peringkat blok . Model draf menggunakan perhatian tetingkap gelongsor (SWA) untuk mengekalkan kos ramalan hampir malar, bukannya berskala dengan panjang jujukan
. Pengoptimum Muon dan penyulingan kendiri digunakan untuk meningkatkan kadar penerimaan, secara langsung meningkatkan pemprosesan inferens
. Dalam senario pengekodan, laporan menunjukkan purata panjang diterima sekitar 6.30 token setiap langkah verifikasi
.
Sistem TileRT meninggalkan model pelancaran kernel per-operator konvensional demi enjin kernel kekal di mana saluran paip pengiraan kekal residen pada GPU . Prapengambilan saluran paip penuh menindih pergerakan data dengan pengiraan, secara dramatik mengurangkan kitaran GPU terbiar
. Sistem ini juga menguraikan komunikasi, pergerakan data, dan pengiraan tensor merentasi warp yang berbeza dengan peranan khusus, secara berkesan mengubah GPU menjadi sistem pelaksanaan heterogen yang mengalir secara berterusan
.
Harga percubaan API UltraSpeed ditetapkan tepat 3 kali ganda harga output standard MiMo-V2.5-Pro .
Harga input mengikuti pengganda 3x yang sama, dengan input cache-hit pada $0.0108 per juta token dan input cache-miss pada $1.305 per juta token . Xiaomi memasarkan ini sebagai "3 kali ganda harga, 10 kali ganda pengalaman output," menekankan kira-kira 10 kali ganda peningkatan pemprosesan untuk kos token 3 kali ganda
.
Tempoh percubaan UltraSpeed ditetapkan secara jelas: 9 Jun hingga 23 Jun 2026, jam 23:59 . Akses adalah berasaskan permohonan kerana sumber inferens berkelajuan tinggi yang terhad, dengan keutamaan diberikan kepada kes penggunaan perusahaan dan pembangun profesional
.
Pengguna yang diluluskan menerima pengalaman sembang percuma sepanjang tetingkap dua minggu, tertakluk kepada peraturan kesaksamaan: maksimum 10 kali kemasukan giliran berjaya setiap akaun sehari, had sesi 30 minit, dan pelepasan sumber automatik selepas 5 minit melahu . Xiaomi tidak menjamin ketepatan masa semakan atau kadar kelulusan
.
Model asas, yang dirujuk sebagai MiMo-V2.5-Pro-FP4-DFlash, telah dikeluarkan sebagai sumber terbuka bersama pengumuman UltraSpeed . Pemberat terkuantisasi FP4 dan pusat pemeriksaan model DFlash tersedia di HuggingFace, selaras dengan dokumentasi Xiaomi yang mengenal pasti kuantisasi FP4 dan penyahkodan spekulatif DFlash sebagai komponen sistem teras
.
Mod UltraSpeed menunjukkan bahawa inferens model trilion parameter pada kelajuan interaktif boleh berjalan pada infrastruktur komoditi tanpa silikon tersuai, satu pendekatan berbeza daripada kaedah perkakasan khusus yang dilihat di tempat lain dalam industri . Bagi pembangun yang membina aplikasi ejen sensitif kependaman, saluran paip panggilan alat, atau penjanaan kod masa nyata, gabungan pemprosesan tinggi dan tetingkap konteks 1 juta token menandakan laluan praktikal ke arah sistem pengeluaran yang lebih pantas dan lebih berkeupayaan — dengan syarat mereka mendapat akses semasa tetingkap percubaan terhad.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Xiaomi dan TileRT mengumumkan MiMo V2.5 Pro UltraSpeed pada Jun 2026, model trilion parameter pertama yang memecah kelajuan decode 1,000 token sesaat pada satu pelayan GPU 8 kad standard, bukannya cip khas.
Xiaomi dan TileRT mengumumkan MiMo V2.5 Pro UltraSpeed pada Jun 2026, model trilion parameter pertama yang memecah kelajuan decode 1,000 token sesaat pada satu pelayan GPU 8 kad standard, bukannya cip khas. Pencapaian kelajuan ini dicapai melalui tiga teknik terselaras: kuantisasi ketepatan campuran FP4 mensasarkan lapisan pakar MoE, penyahkodan spekulatif selari bertopeng peringkat blok DFlash, dan enjin kernel kekal Ti...
Model asas MiMo V2.5 Pro FP4 DFlash telah disumber terbuka bersama pelancaran ini, dengan pemberat FP4 dan pusat pemeriksaan DFlash tersedia di HuggingFace, selaras dengan usaha Xiaomi untuk inferens kelajuan tinggi y...