Xiaomi e TileRT anunciaram o MiMo V2.5 Pro UltraSpeed em junho de 2026, o primeiro modelo de 1 trilhão de parâmetros a superar 1.000 tokens/segundo de velocidade de decodificação em um único servidor com 8 GPUs padrão... O marco de velocidade é alcançado por três técnicas coordenadas: quantização mista de precisão F...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
No dia 8 de junho de 2026, a equipe MiMo da Xiaomi e sua parceira de inferência TileRT lançaram o MiMo-V2.5-Pro-UltraSpeed, um modo de inferência de alta velocidade para a família de modelos MiMo-V2.5-Pro . O anúncio se concentrou em um único feito: um modelo de 1 trilhão de parâmetros processando mais de 1.000 tokens por segundo — descrito pela Xiaomi como algo inédito nessa escala — rodando em um único nó com 8 GPUs comuns, em vez de hardware customizado
.
A Xiaomi e a TileRT relataram uma taxa de transferência sustentada acima de 1.000 tokens por segundo, com demonstrações atingindo picos próximos de 1.200 tokens por segundo, em um servidor padrão com 8 GPUs . A conquista quebra o que a Xiaomi chama de "triângulo impossível" da indústria entre velocidade, capacidade e compatibilidade com GPUs de uso geral
. O CEO da MiMo, Lei Jun, destacou o marco em uma postagem nas redes sociais, descrevendo-o como a primeira vez na indústria que se ultrapassam os 1.000 tokens/s em um modelo de trilhão de parâmetros
.
O modo UltraSpeed não é uma nova classe de modelo, mas sim um modo de serviço baseado em engenharia construído sobre o MiMo-V2.5-Pro, uma arquitetura de Mistura de Especialistas (MoE) com 1,02 trilhão de parâmetros totais, 42 bilhões de parâmetros ativos e uma janela de contexto de 1 milhão de tokens .
A documentação oficial da Xiaomi descreve um co-design de pilha completa entre modelo e sistema que combina três técnicas coordenadas para impulsionar a taxa de transferência além de 1.000 tokens/s .
Apenas as camadas de especialistas do MoE são quantizadas para precisão FP4, enquanto todas as outras camadas mantêm sua precisão original . O treinamento com consciência de quantização (QAT) reduz a pegada de memória do modelo e a pressão sobre a largura de banda para manter a qualidade quase sem perdas
. Essa abordagem seletiva evita degradar componentes não especializados que são mais sensíveis à perda de precisão.
O DFlash substitui a geração de rascunho autorregressiva tradicional por uma predição paralela mascarada em nível de bloco . O modelo de rascunho usa atenção de janela deslizante (SWA) para manter o custo de predição quase constante, em vez de escalar com o comprimento da sequência
. Um otimizador Muon e auto-destilação são usados para melhorar as taxas de aceitação, aumentando diretamente a taxa de transferência da inferência
. Em cenários de codificação, relatórios indicam um comprimento médio aceito de cerca de 6,30 tokens por etapa de verificação
.
O sistema TileRT abandona o modelo convencional de lançamento de kernel por operador em favor de um motor de kernel persistente onde o pipeline de computação permanece residente na GPU . A pré-busca de pipeline completo sobrepõe a movimentação de dados com a computação, reduzindo drasticamente os ciclos ociosos da GPU
. O sistema também decompõe comunicação, movimentação de dados e computação de tensores em diferentes warps com funções dedicadas, transformando a GPU em um sistema de execução heterogêneo e de fluxo contínuo
.
O preço promocional da API UltraSpeed é definido como exatamente 3 vezes o preço de saída do MiMo-V2.5-Pro padrão .
O preço de entrada segue o mesmo multiplicador de 3 vezes, com entrada em cache a US$ 0,0108 por milhão de tokens e entrada sem cache a US$ 1,305 por milhão de tokens . A Xiaomi promove isso como "3 vezes o preço, 10 vezes a experiência de saída", enfatizando o ganho de cerca de 10 vezes na velocidade por 3 vezes o custo do token
.
O período de teste do UltraSpeed é explicitamente limitado: de 9 a 23 de junho de 2026, até as 23h59 . O acesso é feito por meio de inscrição devido à oferta limitada de recursos de inferência de alta velocidade, com prioridade para casos de uso empresariais e de desenvolvedores profissionais
.
Os usuários aprovados recebem uma experiência de chat gratuita durante as duas semanas, sujeita a regras de uso justo: no máximo 10 entradas bem-sucedidas na fila por conta por dia, limite de sessão de 30 minutos e liberação automática de recursos após 5 minutos de inatividade . A Xiaomi não garante prazos de revisão ou taxas de aprovação
.
O modelo subjacente, chamado MiMo-V2.5-Pro-FP4-DFlash, foi lançado como código aberto junto com o anúncio do UltraSpeed . Os pesos quantizados em FP4 e os checkpoints do modelo DFlash estão disponíveis no HuggingFace, de acordo com a documentação da Xiaomi que identifica a quantização FP4 e a decodificação especulativa DFlash como componentes centrais do sistema
.
O modo UltraSpeed demonstra que a inferência em escala de trilhões de parâmetros, em velocidades interativas, pode rodar em infraestrutura comum, sem a necessidade de silício customizado, um desvio da abordagem de hardware especializado vista em outros lugares da indústria . Para desenvolvedores que criam aplicações de agente sensíveis à latência, pipelines de chamada de ferramentas ou geração de código em tempo real, a combinação de alta velocidade com uma janela de contexto de 1 milhão de tokens sinaliza um caminho prático para sistemas em produção mais rápidos e capazes — desde que consigam acesso durante a janela de teste limitada.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Xiaomi e TileRT anunciaram o MiMo V2.5 Pro UltraSpeed em junho de 2026, o primeiro modelo de 1 trilhão de parâmetros a superar 1.000 tokens/segundo de velocidade de decodificação em um único servidor com 8 GPUs padrão...
Xiaomi e TileRT anunciaram o MiMo V2.5 Pro UltraSpeed em junho de 2026, o primeiro modelo de 1 trilhão de parâmetros a superar 1.000 tokens/segundo de velocidade de decodificação em um único servidor com 8 GPUs padrão... O marco de velocidade é alcançado por três técnicas coordenadas: quantização mista de precisão FP4 focada nos especialistas MoE, decodificação especulativa paralela mascarada em blocos DFlash e o motor de kernel persi...
O modelo base MiMo V2.5 Pro FP4 DFlash foi lançado como código aberto, com pesos FP4 e checkpoints do DFlash disponíveis no HuggingFace, alinhando se ao objetivo da Xiaomi de oferecer inferência acessível em alta velo...