2026年6月,小米MiMo同TileRT發布咗MiMo V2.5 Pro UltraSpeed模式,成為全球首個喺單一標準8 GPU伺服器(而唔係訂製晶片)上,將萬億參數模型解碼速度突破每秒1,000 tokens嘅里程碑 [6][7][9]。 速度突破靠嘅係三項核心技術協同:專攻MoE專家層嘅FP4混合精度量化、用區塊級Masked並行預測取代傳統自迴歸嘅DFlash推測解碼、以及TileRT嘅常駐核心引擎同Warp層級異構流水線協作 [2][4][39]。

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
2026年6月8號晚,小米MiMo技術團隊聯同推理拍檔TileRT正式發布咗MiMo-V2.5-Pro-UltraSpeed模式,呢個係MiMo-V2.5-Pro模型家族嘅一個高速推理服務模式 。
成個發布嘅焦點落喺一個數字上:一個有成1萬億參數(1 Trillion)嘅模型,輸出速度突破每秒1,000個Token,而且係喺一張有8張標準GPU嘅普通伺服器節點上跑到,完全唔使用乜嘢訂製晶片 。小米話呢個係業界喺呢個規模上嘅第一次
。
根據小米同TileRT嘅報告,呢個模式可以穩定咁保持每秒超過1,000個Token嘅輸出吞吐量,示範入面高峯期甚至見過接近每秒1,200個Token 。
呢次突破打破咗小米口中業界嘅「不可能三角」——就係速度夠快、模型能力夠強、但又唔使用專用晶片,三樣嘢冇可能同時達成。而家MiMo團隊話佢哋做到咗 。小米創辦人雷軍都特登喺微博出Post,話呢次係「業內首次在1萬億參數模型上突破1000 tokens/秒的輸出速度」
。
你可能會問,MiMo-V2.5-Pro本身係咩來頭?佢係一個1.02萬億參數嘅混合專家(MoE)架構模型,入面有420億個活躍參數,支援最長100萬Token嘅上下文窗口 。而呢個UltraSpeed模式並唔係一個全新模型,而係建基於現有模型,靠工程實力硬生生「榨」出嚟嘅加速版本。
小米官方文件解釋,呢次提速唔係靠一招半式,而係一個「模型-系統全鏈路協同設計」,由三項技術夾埋一齊發力,先推到過每秒1,000 Token呢個門檻 。
佢哋只係針對MoE架構入面嘅「專家層」(Expert Layers)做FP4量化,其他部分就保持返原本嘅精度 。
做法係透過「量化感知訓練」(QAT),喺大幅縮減模型體積、減少記憶體頻寬壓力嘅同時,令到模型嘅表現能力可以保持喺近乎無損嘅水平 。呢種「選擇性減肥」嘅策略,就避免咗搞到嗰啲對精度好敏感嘅非專家組件表現跌Watt。
傳統嘅解碼過程係逐個Token自迴歸生成,好似人哋逐個字諗嘢咁。DFlash就唔同玩法,佢用嘅係區塊級嘅Masked並行預測,一次過估一堆Token出嚟,然後再由大模型一次過驗證 。
佢嘅Draft模型用咗滑動窗口注意力(SWA),令到預測成本幾乎固定,唔會因為你段嘢越嚟越長就拖慢晒 。再配合Muon優化器同自蒸餾技術去提高「接受率」(即係估中嘅機率),直接轉化為實質嘅推理吞吐量提升
。有報告指出,喺編程場景入面,平均每次驗證可以接受嘅長度去到約6.30個Token
,效率相當唔錯。
TileRT團隊放棄咗傳統嗰種「逐個算子啟動內核」嘅做法,改為用一個常駐核心引擎,等條計算流水線可以長駐喺GPU入面持續運行 。
透過全鏈路預取,將數據搬運同計算嘅時間重疊到極致,大大減少GPU發呆等嘢做嘅空轉時間 。佢哋仲將通訊、數據搬運同張量計算拆解到唔同嘅Warp(線程束),各自有專門嘅角色,等成個GPU變到好似一個持續流動、精密協作嘅異構執行系統咁
。
小米將UltraSpeed API嘅試用期定價,啱啱好係標準版MiMo-V2.5-Pro輸出價格嘅3倍 。
輸入價格都係跟呢個3倍乘數去計,命中快取嘅輸入每百萬Token收0.0108美元,未命中快取嘅就收1.305美元 。小米嘅宣傳口號就係「3倍價格提升,10倍輸出體驗」,強調你用多3倍嘅錢,但吞吐量提升咗大約10倍
。
呢個UltraSpeed模式嘅試用期係劃晒死線嘅:由2026年6月9號開始,到6月23號夜晚11點59分完 。
由於高速推理嘅資源供應好有限,所以要用家主動申請先有得玩,唔係公開任入 。小米會優先批核畀嗰啲有真實業務需求嘅企業同專業開發者
。
成功批核咗嘅用戶,可以喺呢兩個星期嘅窗口期內免費玩Chat體驗,但就要守公平使用規則:每個帳號每日最多排隊入10次、每次傾偈最長30分鐘、同埋如果超過5分鐘冇郁過,系統就會自動放返你啲資源出嚟 。小米仲講到明,「提交申請後不承諾審核時效性和審核通過率」,所以想玩就要快手同埋唔好咁老定
。
隨住UltraSpeed發布,小米亦將底層模型——叫做MiMo-V2.5-Pro-FP4-DFlash——拎咗出嚟開源 。
FP4量化咗嘅權重同DFlash模型嘅檢查點(checkpoint)都擺晒上HuggingFace,呢樣同小米之前嘅文件提到FP4量化同DFlash係核心系統組件嘅說法一致 。
呢個UltraSpeed模式證明咗一樣嘢:要喺萬億參數級別嘅模型上做到互動級別嘅推理速度,唔一定要使天價買專用晶片,用返標準嘅GPU硬件都得 。
對於嗰啲要做對延遲好敏感嘅AI代理應用(Agentic Applications)、工具調用流程(Tool-Calling Pipelines)、又或者實時代碼生成嘅開發者嚟講,呢個「高吞吐量再加100萬Token超長上下文窗口」嘅組合,代表住一條邁向更快、更強生產系統嘅實用路徑——當然大前提係你要喺個咁短嘅試用期入面,成功拎到佢哋嘅批核先有得玩。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
2026年6月,小米MiMo同TileRT發布咗MiMo V2.5 Pro UltraSpeed模式,成為全球首個喺單一標準8 GPU伺服器(而唔係訂製晶片)上,將萬億參數模型解碼速度突破每秒1,000 tokens嘅里程碑 [6][7][9]。
2026年6月,小米MiMo同TileRT發布咗MiMo V2.5 Pro UltraSpeed模式,成為全球首個喺單一標準8 GPU伺服器(而唔係訂製晶片)上,將萬億參數模型解碼速度突破每秒1,000 tokens嘅里程碑 [6][7][9]。 速度突破靠嘅係三項核心技術協同:專攻MoE專家層嘅FP4混合精度量化、用區塊級Masked並行預測取代傳統自迴歸嘅DFlash推測解碼、以及TileRT嘅常駐核心引擎同Warp層級異構流水線協作 [2][4][39]。
為咗展示技術唔係紙上談兵,小米同步將底層模型MiMo V2.5 Pro FP4 DFlash開源,FP4權重同DFlash檢查點都放晒上HuggingFace,貫徹佢哋推動高速推理普及化嘅方向 [6][10][37]。