Xiaomi et TileRT ont dévoilé en juin 2026 MiMo V2.5 Pro UltraSpeed, le premier modèle à mille milliards de paramètres dépassant les 1 000 tokens par seconde sur un simple serveur 8 GPU standard, sans puce sur mesure. Ce record est le fruit d'une combinaison de trois techniques clés : la quantification mixte FP4 foca...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
Le 8 juin 2026, l'équipe MiMo de Xiaomi et son partenaire en inférence TileRT ont dévoilé MiMo-V2.5-Pro-UltraSpeed, un mode d'inférence à très haute vitesse pour la famille de modèles MiMo-V2.5-Pro . L'annonce se résume en une prouesse chiffrée : un modèle à mille milliards de paramètres a dépassé la barre des 1 000 tokens par seconde — une première mondiale à cette échelle, selon Xiaomi — le tout sur un simple serveur standard à 8 GPU, et non sur du matériel sur mesure
.
Xiaomi et TileRT ont fait état d'un débit soutenu supérieur à 1 000 tokens par seconde, avec des démonstrations culminant à près de 1 200 tokens par seconde, sur un serveur 8 GPU du commerce . Cette performance brise ce que Xiaomi appelle le « triangle impossible » de l'industrie : allier vitesse, capacité du modèle et compatibilité avec les GPU standards
. Lei Jun, le PDG de Xiaomi, a célébré l'événement sur les réseaux sociaux, y voyant une première historique pour un modèle de cette envergure
.
Le mode UltraSpeed n'est pas une nouvelle génération de modèle, mais un mode de service optimisé par l'ingénierie, appliqué à MiMo-V2.5-Pro. Ce dernier est un modèle à architecture de Mélange d'Experts (MoE) de 1 020 milliards de paramètres, avec 42 milliards de paramètres actifs et une fenêtre de contexte d'un million de tokens .
La documentation officielle de Xiaomi décrit une co-conception modèle-système qui combine trois techniques coordonnées pour dépasser les 1 000 tokens/s .
Seules les couches « expertes » de l'architecture MoE sont quantifiées en précision FP4, le reste du modèle conservant sa précision d'origine . Un entraînement sensible à la quantification (QAT) réduit l'empreinte mémoire et la pression sur la bande passante, avec pour objectif de maintenir une qualité quasi identique
. Cette approche sélective évite de dégrader les composants non-experts, plus sensibles à la perte de précision.
DFlash remplace la génération classique de propositions (drafts) en mode autorégressif par une prédiction parallèle masquée au niveau des blocs . Le modèle de proposition utilise une attention à fenêtre glissante (SWA) pour maintenir un coût de prédiction quasi constant, indépendant de la longueur de la séquence
. Un optimiseur Muon et l'auto-distillation sont utilisés pour améliorer le taux d'acceptation des propositions, augmentant directement le débit d'inférence
. Dans des scénarios de code, la longueur moyenne acceptée est d'environ 6,30 tokens par étape de vérification
.
Le système TileRT abandonne le lancement traditionnel de noyaux par opérateur. Il utilise un moteur à noyau persistant où le pipeline de calcul reste actif en continu sur le GPU . Un pré-chargement global (full-pipeline prefetching) fait chevaucher le déplacement des données et le calcul, éliminant les cycles d'inactivité du GPU
. Le système décompose également la communication, le mouvement des données et le calcul tensoriel entre différents « warps » (groupes de threads GPU) assignés à des rôles spécialisés. Le GPU devient ainsi un système d'exécution hétérogène en flux continu
.
Le prix de l'API en période d'essai est exactement 3 fois supérieur à celui du MiMo-V2.5-Pro standard .
La tarification des entrées suit le même multiplicateur de 3, avec un coût d'entrée en cache à 0,0108 $ par million de tokens et un coût d'entrée hors cache à 1,305 $ par million . Xiaomi résume l'offre par la formule « 3 fois le prix, 10 fois l'expérience de sortie », soulignant un gain de débit environ 10 fois supérieur pour un coût token 3 fois plus élevé
.
La période d'essai UltraSpeed est strictement limitée dans le temps : du 9 au 23 juin 2026, jusqu'à 23h59 . L'accès se fait sur dossier, en raison des ressources limitées dédiées à l'inférence haute vitesse, avec une priorité donnée aux cas d'usage d'entreprises et de développeurs professionnels
.
Les utilisateurs approuvés bénéficient d'une expérience de chat gratuite pendant ces deux semaines, sous réserve de règles d'équité : un maximum de 10 entrées en file d'attente par compte et par jour, une durée de session limitée à 30 minutes, et une libération automatique des ressources après 5 minutes d'inactivité . Xiaomi ne garantit ni le délai d'examen des candidatures, ni le taux d'approbation
.
Le modèle sous-jacent, nommé MiMo-V2.5-Pro-FP4-DFlash, a été publié en open source parallèlement à l'annonce . Les poids quantifiés en FP4 et les points de contrôle du modèle DFlash sont disponibles sur HuggingFace, en cohérence avec la documentation officielle qui identifie la quantification FP4 et le décodage spéculatif DFlash comme des composants essentiels du système
.
Le mode UltraSpeed démontre qu'il est possible de faire tourner un modèle à mille milliards de paramètres à une vitesse interactive sur une infrastructure standard, sans recourir à des puces spécialisées. C'est une rupture avec l'approche, observée ailleurs, qui repose sur du matériel dédié . Pour les développeurs qui construisent des applications agentiques sensibles à la latence, des pipelines d'appels d'outils ou de la génération de code en temps réel, la combinaison d'un très haut débit et d'une fenêtre de contexte d'un million de tokens ouvre la voie à des systèmes de production plus rapides et plus performants — à condition d'obtenir un accès pendant cette courte fenêtre d'essai.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Xiaomi et TileRT ont dévoilé en juin 2026 MiMo V2.5 Pro UltraSpeed, le premier modèle à mille milliards de paramètres dépassant les 1 000 tokens par seconde sur un simple serveur 8 GPU standard, sans puce sur mesure.
Xiaomi et TileRT ont dévoilé en juin 2026 MiMo V2.5 Pro UltraSpeed, le premier modèle à mille milliards de paramètres dépassant les 1 000 tokens par seconde sur un simple serveur 8 GPU standard, sans puce sur mesure. Ce record est le fruit d'une combinaison de trois techniques clés : la quantification mixte FP4 focalisée sur les couches expertes du modèle, le décodage spéculatif parallèle par blocs DFlash, et le moteur à noyau per...
Le modèle de base MiMo V2.5 Pro FP4 DFlash a été publié en open source sur HuggingFace, avec ses poids quantifiés FP4 et ses points de contrôle DFlash accessibles à tous.