Xiaomi и TileRT в июне 2026 года запустили MiMo V2.5 Pro UltraSpeed — первый в отрасли случай, когда модель с триллионом параметров преодолела барьер в 1000 токенов/с на стандартном 8 GPU сервере, без использования сп... Рекордная скорость достигнута благодаря синергии трех технологий: смешанного FP4 квантования для...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
Вечером 8 июня 2026 года команда Xiaomi MiMo совместно с партнером по инференсу TileRT представила MiMo-V2.5-Pro-UltraSpeed — высокоскоростной режим работы для семейства моделей MiMo-V2.5-Pro . Ключевое заявление: модель с триллионом параметров выдает более 1000 токенов в секунду на одном стандартном сервере с 8 GPU, что, по словам Xiaomi, является первым подобным достижением в индустрии
.
Xiaomi и TileRT отчитались об устойчивой пропускной способности свыше 1000 токенов в секунду, а в демонстрациях пиковые значения достигали почти 1200 токенов/с на стандартном 8-GPU узле . Этот прорыв разрушает так называемый «невозможный треугольник» индустрии, где скорость, мощность и совместимость с обычными GPU считались несочетаемыми
. Генеральный директор MiMo Лэй Цзюнь лично отметил веху в соцсетях, назвав ее первым в отрасли случаем преодоления рубежа в 1000 токенов/с на модели такого масштаба
.
Важно понимать, что UltraSpeed — это не новая архитектура модели, а инженерно-оптимизированный режим обслуживания, надстроенный поверх MiMo-V2.5-Pro. Эта модель использует архитектуру Mixture-of-Experts (MoE) с 1,02 триллиона параметров, из которых 42 миллиарда активны, и обладает контекстным окном в 1 миллион токенов . Для сравнения: это как если бы вы попросили ассистента проанализировать «Войну и мир» целиком, и он бы начал выдавать осмысленный ответ быстрее, чем вы успеваете моргнуть.
Официальная документация Xiaomi описывает полномасштабное совместное проектирование модели и системы (co-design), объединяющее три ключевых техники, которые и позволили преодолеть барьер в 1000 токенов/с .
Инженеры применили квантование до точности FP4, но не ко всей модели, а избирательно — только к слоям экспертов MoE. Остальные компоненты сохранили исходную точность . Квантование с осведомленностью об обучении (QAT) позволяет радикально уменьшить объем модели и снизить нагрузку на пропускную способность памяти без ощутимой потери качества
. Такой подход позволяет избежать деградации чувствительных к точности компонентов, не являющихся экспертами.
На смену традиционному авторегрессионному методу пришел DFlash — механизм блочного параллельного предсказания с маскированием . Черновая модель использует внимание со скользящим окном (SWA), чтобы стоимость предсказания оставалась почти постоянной и не росла с длиной последовательности
. Для повышения процента принятия токенов применяются оптимизатор Muon и самодистилляция, что напрямую конвертируется в рост пропускной способности инференса
. В задачах, связанных с кодом, средняя принятая длина составляет около 6,30 токена за шаг верификации
.
Система TileRT отказалась от классической модели запуска отдельных операторов (per-operator kernel launch) в пользу персистентного ядерного движка, где вычислительный конвейер постоянно находится на GPU . Полноконвейерная предвыборка данных позволяет максимально перекрывать перемещение данных и вычисления, сводя к минимуму простои GPU
. Кроме того, задачи коммуникации, перемещения данных и тензорных вычислений распределены по разным аппаратным потокам (warps), превращая GPU в непрерывно текущую, гетерогенную систему исполнения
.
Пробная цена API UltraSpeed ровно в 3 раза выше, чем у стандартного MiMo-V2.5-Pro :
Цены на входные токены также умножены на 3: попадание в кэш стоит 0,0108 долл./млн, промах мимо кэша — 1,305 долл./млн . Маркетинговый слоган кампании: «В 3 раза выше цена — в 10 раз лучше опыт», что отражает примерно десятикратный выигрыш в скорости при трехкратном увеличении стоимости токена
.
Пробный период UltraSpeed четко ограничен по времени: с 9 по 23 июня 2026 года (до 23:59) . Доступ осуществляется по заявкам, так как высокоскоростные ресурсы инференса ограничены. Приоритет отдается корпоративным пользователям и профессиональным разработчикам
.
Одобренные пользователи получают бесплатный чат-доступ на двухнедельное окно, но с рядом ограничений для соблюдения принципов справедливого использования: не более 10 успешных постановок в очередь на аккаунт в день, лимит сессии 30 минут и автоматическое освобождение ресурсов после 5 минут бездействия . Xiaomi не гарантирует ни скорость рассмотрения заявок, ни процент одобрения
.
Базовая модель MiMo-V2.5-Pro-FP4-DFlash была выложена в открытый доступ одновременно с анонсом UltraSpeed . VP4-квантованные веса и чекпоинты DFlash доступны на HuggingFace, что полностью соответствует заявленной документацией архитектуре, где FP4 и DFlash являются ключевыми компонентами системы
.
Режим UltraSpeed наглядно доказывает: инференс моделей масштаба триллиона параметров на интерактивных скоростях возможен на стандартной инфраструктуре, без необходимости в специализированных чипах. Это серьезное отступление от привычного в индустрии подхода с опорой на уникальное «железо» . Для разработчиков, создающих требовательные к задержкам агентные приложения, пайплайны вызова инструментов или системы генерации кода в реальном времени, сочетание высокой пропускной способности и контекстного окна в 1 миллион токенов открывает практический путь к более быстрым и мощным продуктивным системам. Правда, при условии, что они успеют получить доступ в рамках ограниченного пробного окна.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Xiaomi и TileRT в июне 2026 года запустили MiMo V2.5 Pro UltraSpeed — первый в отрасли случай, когда модель с триллионом параметров преодолела барьер в 1000 токенов/с на стандартном 8 GPU сервере, без использования сп...
Xiaomi и TileRT в июне 2026 года запустили MiMo V2.5 Pro UltraSpeed — первый в отрасли случай, когда модель с триллионом параметров преодолела барьер в 1000 токенов/с на стандартном 8 GPU сервере, без использования сп... Рекордная скорость достигнута благодаря синергии трех технологий: смешанного FP4 квантования для слоев экспертов MoE, блочного параллельного спекулятивного декодирования DFlash и персистентного ядерного движка TileRT...
Базовая модель MiMo V2.5 Pro FP4 DFlash была выложена в открытый доступ одновременно с анонсом.