小米 MiMo 與 TileRT 於 2026 年 6 月聯合發布 UltraSpeed 模式,在單一台標準 8 卡 GPU 節點上,首度讓萬億參數模型突破 1000 tokens/s 的生成速度,無需依賴定制晶片。 速度提升的背後是三大關鍵技術:只針對 MoE 專家層做 FP4 混合精度量化、DFlash 區塊級並行推測解碼,以及 TileRT 常駐核心引擎搭配執行緒束分工的異構流水線協作。

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
2026 年 6 月 8 日,小米 MiMo 技術團隊聯合推理系統夥伴 TileRT,正式發布了 MiMo-V2.5-Pro-UltraSpeed 模式——一個為 MiMo-V2.5-Pro 模型家族量身打造的高速推理方案 。官方公告的核心是一項驚人的數據:在規格完全標準的 8 卡 GPU 通用伺服器上,一個擁有萬億參數的模型,生成了超越每秒 1000 個 token 的速度。小米集團 CEO 雷軍在個人社群平台上強調,這是業界首次在該規模的模型上達成此成就
。
不同於許多仰賴昂貴定制晶片的方案,小米與 TileRT 回報的吞吐量高於每秒 1000 tokens,在某些展示中峰值甚至逼近每秒 1200 tokens,而這一切就發生在你我熟悉的標準 8 卡 GPU 節點上 。小米將這個成果形容為打破了業界長期以來的「不可能三角」:想要速度快、模型能力強,就非得使用專用硬體不可的迷思
。
MiMo CEO 雷軍在一篇社群貼文中慶祝這個里程碑,並將其稱為「業界首次」在萬億參數模型上跨越 1000 tokens/s 的門檻 。
值得注意的是,UltraSpeed 並不是一個全新的模型,而是一個純工程驅動的服務模式,它是建立在 MiMo-V2.5-Pro 這個具備 1.02 萬億總參數、420 億活躍參數,且支援 100 萬 token 超長上下文的混合專家(MoE)架構之上 。
小米官方技術文件揭示了這套方案是透過模型與系統的全堆疊聯合設計,將三項關鍵技術緊密協作,才順利將吞吐量推上巔峰 。
這項技術只針對 MoE 架構中的「專家層」進行 FP4 格式的量化,而模型其他部分則保有原本的精準度 。這種選擇性量化搭配量化感知訓練(QAT),目的就是在大幅縮減模型體積、榨乾記憶體頻寬的同時,將能力損耗控制在近乎無感的範圍內
。團隊聰明地避開了對精度更敏感的非專家網路組件,避免因小失大。
有別於傳統一個字一個字猜的自迴歸解碼,DFlash 採用了一種區塊級的遮罩並行預測來產出草稿 。它透過滑動視窗注意力(SWA)機制,讓草稿模型的預測算力維持在一個近乎恆定的水準,不會隨著序列長度而倍數放大。再搭配 Muon 優化器與自蒸餾訓練來提升候選 token 的接受率,最終直接轉換為推理吞吐的實質躍升
。
TileRT 系統則是從根本上捨棄了傳統推理引擎一次一個算子啟動核心的作法,改為「常駐核心引擎」,讓整個計算管線就像是工廠流水線般持續在 GPU 上流轉 。全鏈路的資料預取讓數據搬移與計算極致重疊,徹底消滅了 GPU 的閒置空隙
。更進一步,系統將通訊、資料搬運、張量計算等任務,拆解給 GPU 內不同的執行緒束各司其職,把原本單一的 GPU 轉變成了一個持續流動、精密協作的異構執行系統
。
UltraSpeed 的體驗價正好是標準版 MiMo-V2.5-Pro 的 3 倍 。換言之,開發者可以用原先 3 倍的每 token 成本,換取約 10 倍的生成速度提升,這無疑是官方喊出「三倍價格,十倍輸出體驗」口號的底氣所在
。
輸入價格同樣以 3 倍計算,快取命中的輸入價格為每百萬 tokens 美金 0.0108 元,未命中的輸入則為每百萬 tokens 美金 1.305 元 。
由於高速推理的資源十分有限,這次的 UltraSpeed 體驗並非全面開放,而是一個為期兩週的申請制限時體驗窗口:從 2026 年 6 月 9 日 到 6 月 23 日 23:59 。官方明確表示將優先審核具備真實業務需求的企業與專業開發者
。
通過審核的用戶可以在這期間免費體驗 Chat 功能,但為了在資源吃緊下維持公平性,遊戲規則也相當明確:每個帳號每天最多排隊成功使用 10 次,一次對話最長 30 分鐘,只要閒置超過 5 分鐘,系統就會自動釋放資源 。小米官方也貼心提醒,他們不保證審核速度與通過率
。
伴隨 UltraSpeed 模式一同亮相的,還有名為 MiMo-V2.5-Pro-FP4-DFlash 的基礎模型,它已經在 HuggingFace 上全面開源 。不僅有 FP4 格式量化後的權重,DFlash 模型的檢查點也一併提供。這恰好與官方技術文檔將 FP4 量化與 DFlash 推測解碼視為核心系統組件的說法完全吻合,顯示小米不僅想在商業上驗證極速推理,也願意把這套技術路徑背後的模型實例分享給開源社群
。
UltraSpeed 模式的誕生,證明了萬億參數模型的互動級速度推理,不需要神話般的專用矽晶片,只需要大膽的工程整合與優化 。這個思維與業界其他押注專用硬體的路線形成了鮮明對比。對於那些正在打造對延遲極度敏感、需要頻繁呼叫工具的代理應用,或是追求即時程式碼產生的開發者來說,一個兼具 1000 tokens/s 超高吞吐量與 100 萬 token 超長上下文記憶的推理終端,無疑為他們通往更快、更強悍的生產力系統舖平了一條道路——唯一的門檻,就是得先搶到那兩週的限時入場券。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
小米 MiMo 與 TileRT 於 2026 年 6 月聯合發布 UltraSpeed 模式,在單一台標準 8 卡 GPU 節點上,首度讓萬億參數模型突破 1000 tokens/s 的生成速度,無需依賴定制晶片。
小米 MiMo 與 TileRT 於 2026 年 6 月聯合發布 UltraSpeed 模式,在單一台標準 8 卡 GPU 節點上,首度讓萬億參數模型突破 1000 tokens/s 的生成速度,無需依賴定制晶片。 速度提升的背後是三大關鍵技術:只針對 MoE 專家層做 FP4 混合精度量化、DFlash 區塊級並行推測解碼,以及 TileRT 常駐核心引擎搭配執行緒束分工的異構流水線協作。
基礎模型 MiMo V2.5 Pro FP4 DFlash 已同步在 HuggingFace 上開源,包含了 FP4 量化權重與 DFlash 模型參數,開發者可以直接下載研究。