Xiaomi i TileRT ogłosiły w czerwcu 2026 r. tryb MiMo V2.5 Pro UltraSpeed – pierwszy na świecie bilionowy model AI, który przekracza prędkość 1000 tokenów/s na standardowym serwerze z 8 GPU, a nie na niestandardowych c...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
8 czerwca 2026 roku zespół Xiaomi MiMo wraz z partnerem inferencyjnym TileRT udostępnili tryb MiMo-V2.5-Pro-UltraSpeed, nowy, ultraszybki tryb wnioskowania dla rodziny modeli MiMo-V2.5-Pro . Ogłoszenie skupiało się wokół jednego, imponującego osiągnięcia: model o bilionie (1 bln) parametrów osiągający stabilnie ponad 1000 tokenów na sekundę – co Xiaomi opisuje jako wynik bez precedensu w tej skali – działający na pojedynczym, standardowym serwerze z 8 procesorami graficznymi (GPU), a nie na niestandardowym sprzęcie
.
Xiaomi i TileRT poinformowały o stabilnej przepustowości powyżej 1000 tokenów na sekundę, a w demonstracjach osiągano szczyty bliskie 1200 tokenów na sekundę, na zwykłym 8-GPU serwerze . To osiągnięcie przełamuje coś, co Xiaomi nazywa branżowym „niemożliwym trójkątem” – jednoczesnego uzyskania szybkości, wysokich możliwości i kompatybilności z ogólnodostępnymi GPU
. Dyrektor generalny MiMo, Lei Jun, osobiście podkreślił ten kamień milowy w mediach społecznościowych, opisując go jako pierwszy w branży przypadek przekroczenia 1000 tokenów/s na bilionowym modelu parametrów
.
Tryb UltraSpeed nie jest nową klasą modelu, lecz trybem serwowania stworzonym dzięki inżynieryjnej optymalizacji, nałożonym na MiMo-V2.5-Pro. To architektura Mixture-of-Experts (MoE) o 1,02 biliona parametrów całkowitych, z 42 miliardami parametrów aktywnych i oknem kontekstowym o długości miliona tokenów .
Oficjalna dokumentacja Xiaomi opisuje pełną kooperację modelu i systemu (full-stack model-system co-design), która łączy trzy zsynchronizowane techniki, aby wypchnąć przepustowość poza 1000 tokenów/s .
Kwantyzacji do precyzji FP4 poddawane są wyłącznie warstwy eksperckie w architekturze MoE (Mixture of Experts), podczas gdy wszystkie pozostałe warstwy zachowują swoją oryginalną precyzję . Trening z uwzględnieniem kwantyzacji (Quantization-Aware Training, QAT) zmniejsza rozmiar modelu i zapotrzebowanie na przepustowość pamięci, starając się zachować jakość działania na niemal bezstratnym poziomie
. To selektywne podejście pozwala uniknąć degradacji komponentów nie-eksperckich, które są bardziej wrażliwe na utratę precyzji.
Technika DFlash zastępuje tradycyjne generowanie wersji roboczych (draft) w sposób autoregresyjny, wykorzystując blokową, zamaskowaną predykcję równoległą . Model draft używa mechanizmu uwagi z przesuwnym oknem (Sliding-Window Attention, SWA), aby utrzymać koszt predykcji na niemal stałym poziomie, niezależnie od długości sekwencji
. Do poprawy współczynnika akceptacji wykorzystano optymalizator Muon oraz samodestylację (self-distillation), co bezpośrednio przekłada się na wzrost przepustowości wnioskowania
. W scenariuszach programistycznych raporty wskazują, że średnia zaakceptowana długość wynosi około 6,30 tokena na krok weryfikacji
.
System TileRT porzuca konwencjonalny model uruchamiania jądra dla każdego operatora na rzecz silnika trwałego jądra (persistent kernel engine), gdzie potok obliczeniowy stale rezydentuje na GPU . Pełno-potokowe pobieranie z wyprzedzeniem (full-pipeline prefetching) nakłada na siebie operacje przenoszenia danych i obliczeń, drastycznie redukując puste cykle GPU
. System dekomponuje również zadania związane z komunikacją, przesyłem danych i obliczeniami tensorowymi na różne, wyspecjalizowane wątki (warps), skutecznie przekształcając GPU w nieprzerwanie pracujący, heterogeniczny system wykonawczy
.
Cena za dostęp do API UltraSpeed w okresie próbnym jest ustalona na dokładnie 3-krotność standardowej ceny za tokeny wyjściowe (output) MiMo-V2.5-Pro .
Cennik tokenów wejściowych (input) również podlega mnożnikowi 3x, gdzie wejście z trafieniem w cache kosztuje 0,0108 USD za milion tokenów, a wejście bez trafienia to koszt 1,305 USD za milion tokenów . Xiaomi marketingowo określa to jako „3 razy wyższa cena, 10 razy lepsze wrażenia”, podkreślając tym samym około 10-krotny wzrost przepustowości przy 3-krotnie wyższym koszcie tokenów
.
Okres testowy UltraSpeed jest ściśle ograniczony czasowo: trwa od 9 czerwca do 23 czerwca 2026 roku do godziny 23:59 . Dostęp jest przyznawany na podstawie aplikacji z powodu ograniczonych zasobów szybkiego wnioskowania, a pierwszeństwo mają firmy i profesjonalni deweloperzy
.
Zatwierdzeni użytkownicy otrzymują darmowy dostęp do czatu w dwutygodniowym oknie, na zasadach uczciwego użytkowania: maksymalnie 10 udanych wejść do kolejki na konto dziennie, limit 30 minut na sesję oraz automatyczne zwalnianie zasobów po 5 minutach bezczynności . Xiaomi nie gwarantuje ani szybkości rozpatrywania wniosków, ani ich pozytywnego wyniku
.
Model bazowy, określany jako MiMo-V2.5-Pro-FP4-DFlash, został wydany jako open-source równocześnie z ogłoszeniem UltraSpeed . Wagi skwantyzowane do FP4 oraz checkpointy modelu DFlash są dostępne na platformie HuggingFace, co jest spójne z dokumentacją Xiaomi, identyfikującą kwantyzację FP4 i dekodowanie spekulatywne DFlash jako kluczowe komponenty systemu
.
Tryb UltraSpeed udowadnia, że wnioskowanie na bilionowym modelu parametrów z interaktywną prędkością może działać na powszechnie dostępnej infrastrukturze, bez potrzeby stosowania specjalistycznych układów scalonych. To odejście od podejścia opartego na dedykowanym sprzęcie, które można zaobserwować gdzie indziej w branży . Dla deweloperów tworzących aplikacje agentowe wrażliwe na opóźnienia, potoki wywoływania narzędzi (tool-calling pipelines) czy generowanie kodu w czasie rzeczywistym, połączenie wysokiej przepustowości i milionowego okna kontekstowego sygnalizuje praktyczną ścieżkę do szybszych i wydajniejszych systemów produkcyjnych – pod warunkiem, że uda im się uzyskać dostęp podczas ograniczonego okna testowego.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Xiaomi i TileRT ogłosiły w czerwcu 2026 r. tryb MiMo V2.5 Pro UltraSpeed – pierwszy na świecie bilionowy model AI, który przekracza prędkość 1000 tokenów/s na standardowym serwerze z 8 GPU, a nie na niestandardowych c...
Xiaomi i TileRT ogłosiły w czerwcu 2026 r. tryb MiMo V2.5 Pro UltraSpeed – pierwszy na świecie bilionowy model AI, który przekracza prędkość 1000 tokenów/s na standardowym serwerze z 8 GPU, a nie na niestandardowych c... Prędkość osiągnięto dzięki trzem skoordynowanym technikom: kwantyzacji mieszanej FP4 dla warstw eksperckich, dekodowaniu spekulatywnemu DFlash z predykcją blokową i zoptymalizowanemu silnikowi jądra TileRT.
Model bazowy MiMo V2.5 Pro FP4 DFlash został udostępniony na zasadach open source wraz z premierą, a wagi FP4 i checkpointy DFlash są dostępne na HuggingFace.