2026 年 6 月,小米与 TileRT 发布 MiMo V2.5 Pro UltraSpeed,成为全球首个在通用 GPU 上将万亿参数模型推理速度突破每秒 1000 Token 的成果 [9][12]。 速度突破依赖三大协同技术:FP4 混合精度量化(仅压缩 MoE 专家层)、DFlash 块级掩码并行投机解码,以及 TileRT 的常驻内核引擎与线程束级异构流水线协作 [2][37]。

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
2026 年 6 月 8 日,小米 MiMo 团队携手推理合作伙伴 TileRT,正式推出 MiMo-V2.5-Pro-UltraSpeed 高速推理模式 。官方消息显示,一个万亿参数规模的模型首次在单台标准 8 卡 GPU 服务器上,实现了超过 每秒 1000 Token 的解码速度,这被小米称为行业内的首次突破
。
在官方演示中,MiMo-V2.5-Pro-UltraSpeed 的吞吐量峰值甚至逼近了 每秒 1200 Token ,这意味着生成一篇千字长文,模型只需不到两秒。
值得注意的是,这一成就并非依赖昂贵的定制化专用芯片,而是运行在采购便捷的商用 GPU 集群上 。小米集团创始人雷军也在微博上发声,强调这是业界首次在万亿参数模型上跨过“1000 tokens/s”的门槛
。
UltraSpeed 并非一个全新的模型,而是基于 MiMo-V2.5-Pro(一个拥有 1.02 万亿总参数、420 亿激活参数、支持 100 万 Token 上下文的 MoE 混合专家模型)的工程化服务模式 。
要将万亿级“巨兽”提速至此,小米公开了从模型层到系统层的全栈协同设计,主要靠以下三项技术攻坚 。
大模型的推理速度,往往卡在显存带宽上。小米的做法很巧妙:他们只对 MoE 的专家层(Expert Layers) 进行 FP4 量化,模型的其余部分保持原有精度 。
通过量化感知训练(QAT),大幅压缩了模型体积和访存开销,同时保证了模型能力几乎不受损 。这种“抓大放小”的策略,绕开了对精度敏感的组件,既榨干了硬件带宽,又守住了性能底线。
传统的大模型生成是“自回归”的,就像串行思维,一个字接一个字往外蹦。DFlash 则用一种块级掩码并行预测取而代之 。
它让一个轻量的草稿模型采用滑动窗口注意力(SWA)进行低成本预测,把计算开销压到常数级,再由万亿参数的大模型并行验证。配合 Muon 优化器与自蒸馏技术,每次验证能接受的 Token 平均长度大幅提升,直接转化为实打实的吞吐量 。在编程场景下,其单次验证平均可接受约 6.30 个 Token
。
在每秒超过 1000 Token 的极端吞吐下,传统“启动-运行-结束”的算子弹射模式会成为瓶颈。TileRT 直接将计算流水线常驻在 GPU 上,不再频繁启停 。
更精细的是,团队将通信、数据搬运、张量计算拆解到不同的 GPU 线程束(Warp)上去“各司其职”,把 GPU 变成了一个持续流动的精密工厂,从全链路预取到计算的重叠优化,几乎消除了 GPU 的空转等待 。
伴随着极速模式而来的,是“提质又提价”。UltraSpeed API 的限时体验价精准地卡在标准版价格的 3 倍 :
输入 Token 同样遵循 3 倍差价 。小米官方打出的口号是“3 倍价格提升,10 倍输出体验”,直指开发者在高延迟场景下的痛点
。
这不是一个随时可调用的功能。由于高速推理资源供给有限,UltraSpeed 模式采取 申请制 开放 :
为了推动高性能推理的普及,小米将 UltraSpeed 的基座模型 MiMo-V2.5-Pro-FP4-DFlash 进行了开源 。开发者和研究者可以在 HuggingFace 上直接获取 FP4 量化权重与 DFlash 的相关模型参数
。
MiMo-V2.5-Pro-UltraSpeed 的出现,证明了在不依赖专用芯片的通用算力下,万亿参数大模型也能跑出“实时交互”级的响应速度 。对于正在构建低延迟智能体(Agent)任务、复杂代码实时生成或多步工具调用的开发团队而言,1000+ tokens/s 的吞吐配合 100 万 Token 的超长上下文窗口,无疑为生产级系统提供了一个高性价比的快车道——只要你能抢到这两周试用的“入场券”。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
2026 年 6 月,小米与 TileRT 发布 MiMo V2.5 Pro UltraSpeed,成为全球首个在通用 GPU 上将万亿参数模型推理速度突破每秒 1000 Token 的成果 [9][12]。
2026 年 6 月,小米与 TileRT 发布 MiMo V2.5 Pro UltraSpeed,成为全球首个在通用 GPU 上将万亿参数模型推理速度突破每秒 1000 Token 的成果 [9][12]。 速度突破依赖三大协同技术:FP4 混合精度量化(仅压缩 MoE 专家层)、DFlash 块级掩码并行投机解码,以及 TileRT 的常驻内核引擎与线程束级异构流水线协作 [2][37]。
UltraSpeed 模式定价为标准版的 3 倍(约 ¥18/百万 Token),但速度提升约 10 倍;同时,其基座模型 MiMo V2.5 Pro FP4 DFlash 已在 HuggingFace 上开源 [1][37]。