أعلنت شاومي و TileRT في يونيو 2026 عن MiMo V2.5 Pro UltraSpeed، وهو أول نموذج بتريليون معلمة يكسر حاجز سرعة فك التشفير البالغ 1000 رمز/ثانية على خادم قياسي واحد بـ 8 وحدات GPU، وليس رقاقات مخصصة. يتحقق إنجاز السرعة من خلال ثلاث تقنيات متكاملة: التكميم المختلط FP4 الذي يستهدف طبقات الخبراء في بنية MoE، وفك التشفير ال...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
في 8 يونيو 2026، أعلن فريق MiMo من شاومي وشريكه في الاستدلال TileRT عن MiMo-V2.5-Pro-UltraSpeed، وهو نمط استدلال فائق السرعة لعائلة نماذج MiMo-V2.5-Pro . تمحور الإعلان حول ادعاء واحد: نموذج بتريليون معلمة يحقق أكثر من 1000 رمز في الثانية - وهو ما وصفته شاومي بأنه سابقة أولى على هذا المقياس - أثناء تشغيله على عقدة تجارية قياسية واحدة بـ 8 وحدات معالجة رسومية (GPU) بدلاً من العتاد المخصص
.
أعلنت شاومي و TileRT عن تحقيق إنتاجية مستدامة تتجاوز 1000 رمز في الثانية، مع وصول العروض التوضيحية إلى ذروة تقارب 1200 رمز في الثانية، على خادم قياسي بـ 8 وحدات GPU . يكسر هذا الإنجاز ما تسميه شاومي "المثلث المستحيل" في الصناعة والمتمثل في الجمع بين السرعة والقدرة والتوافق مع وحدات GPU العامة
. سلط لي جون، الرئيس التنفيذي لشركة شاومي، الضوء على هذا الإنجاز في منشور على وسائل التواصل الاجتماعي، واصفاً إياه بأنه المرة الأولى في الصناعة التي يتم فيها تجاوز 1000 رمز/ثانية على نموذج بتريليون معلمة
.
نمط UltraSpeed ليس فئة نموذج جديدة، بل هو نمط تقديم مدفوع بالهندسة مبني فوق MiMo-V2.5-Pro، وهو نموذج ببنية خليط الخبراء (Mixture-of-Experts) يحتوي على 1.02 تريليون معلمة، مع 42 مليار معلمة نشطة، ونافذة سياق تصل إلى مليون رمز .
تصف الوثائق الرسمية لشركة شاومي تصميماً مشتركاً كامل المكدس بين النموذج والنظام يجمع بين ثلاث تقنيات منسقة لدفع الإنتاجية إلى ما يتجاوز 1000 رمز/ثانية .
يتم تكميم طبقات الخبراء (MoE Experts) فقط إلى دقة FP4، بينما تحتفظ جميع الطبقات الأخرى بدقتها الأصلية . يقلل التدريب المدرك للتكميم (QAT) من البصمة الذاكرية للنموذج وضغط عرض النطاق الترددي بهدف الحفاظ على جودة شبه مثالية
. يتجنب هذا النهج الانتقائي تدهور أداء المكونات غير الخبيرة الأكثر حساسية لفقدان الدقة.
يستبدل DFlash التوليد التوقعي التقليدي ذاتي الانحدار بتنبؤ متوازٍ مقنع على مستوى الكتل . يستخدم النموذج المسودّ (Draft Model) انتباه النافذة المنزلقة (SWA) للحفاظ على تكلفة التنبؤ شبه ثابتة، بدلاً من زيادتها مع طول التسلسل
. يُستخدم مُحسِّن Muon والتقطير الذاتي لتحسين معدلات القبول، مما يعزز إنتاجية الاستدلال بشكل مباشر
. في سيناريوهات البرمجة، تشير التقارير إلى متوسط طول مقبول يبلغ حوالي 6.30 رمز لكل خطوة تحقق
.
يتخلى نظام TileRT عن نموذج إطلاق النواة التقليدي لكل عامل (per-operator kernel launch) لصالح محرك نواة دائمة حيث يبقى خط أنابيب الحوسبة مقيماً على وحدة GPU . يقوم الجلب المسبق لخط الأنابيب الكامل بتداخل حركة البيانات مع الحوسبة، مما يقلل بشكل كبير من دورات وحدة GPU الخاملة
. يقوم النظام أيضاً بتفكيك الاتصالات وحركة البيانات وحوسبة الموترات عبر مجموعات خيوط (warps) مختلفة بأدوار مخصصة، مما يحول وحدة GPU فعلياً إلى نظام تنفيذ غير متجانس يتدفق باستمرار
.
تم تحديد سعر تجربة UltraSpeed API بثلاثة أضعاف سعر الإخراج القياسي لـ MiMo-V2.5-Pro .
يتبع تسعير الإدخال نفس مضاعف 3x، حيث يبلغ سعر الإدخال عند إصابة ذاكرة التخزين المؤقت 0.0108 دولار لكل مليون رمز، والإدخال عند فقدان ذاكرة التخزين المؤقت 1.305 دولار لكل مليون رمز . تسوق شاومي هذا على أنه "3 أضعاف السعر، 10 أضعاف تجربة الإخراج"، مع التركيز على تحقيق زيادة في الإنتاجية تقارب 10 أضعاف مقابل 3 أضعاف تكلفة الرمز
.
فترة تجربة UltraSpeed محددة زمنياً بشكل صريح: من 9 يونيو إلى 23 يونيو 2026، حتى الساعة 23:59 . يعتمد الوصول على تقديم طلب نظراً لمحدودية موارد الاستدلال عالي السرعة، مع إعطاء الأولوية لحالات استخدام المؤسسات والمطورين المحترفين
.
يحصل المستخدمون المعتمدون على تجربة محادثة مجانية خلال نافذة الأسبوعين، مع مراعاة قواعد الاستخدام العادل: حد أقصى يبلغ 10 مرات دخول ناجحة إلى قائمة الانتظار لكل حساب يومياً، وحد أقصى للجلسة يبلغ 30 دقيقة، وتحرير تلقائي للموارد بعد 5 دقائق من الخمول . لا تضمن شاومي توقيت المراجعة أو معدلات القبول
.
تم إصدار النموذج الأساسي، المشار إليه باسم MiMo-V2.5-Pro-FP4-DFlash، كمصدر مفتوح بالتزامن مع إعلان UltraSpeed . أوزان FP4 المُكمَّمة ونقاط تحقق نموذج DFlash متاحة على منصة HuggingFace، بما يتوافق مع وثائق شاومي التي تحدد تكميم FP4 وفك التشفير التوقعي DFlash كمكونات أساسية للنظام
.
يثبت نمط UltraSpeed أن استدلال نماذج تريليون معلمة بسرعات تفاعلية يمكن تشغيله على بنية تحتية تجارية دون الحاجة إلى سيليكون مخصص، وهو خروج عن نهج العتاد المتخصص السائد في أماكن أخرى من الصناعة . بالنسبة للمطورين الذين يبنون تطبيقات وكيلة (agentic) حساسة للوقت، أو خطوط أنابيب استدعاء الأدوات، أو توليد الأكواد في الوقت الفعلي، فإن الجمع بين الإنتاجية العالية ونافذة سياق تبلغ مليون رمز يشير إلى مسار عملي نحو أنظمة إنتاج أسرع وأكثر قدرة - شريطة أن يتمكنوا من الوصول خلال نافذة التجربة المحدودة.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
أعلنت شاومي و TileRT في يونيو 2026 عن MiMo V2.5 Pro UltraSpeed، وهو أول نموذج بتريليون معلمة يكسر حاجز سرعة فك التشفير البالغ 1000 رمز/ثانية على خادم قياسي واحد بـ 8 وحدات GPU، وليس رقاقات مخصصة.
أعلنت شاومي و TileRT في يونيو 2026 عن MiMo V2.5 Pro UltraSpeed، وهو أول نموذج بتريليون معلمة يكسر حاجز سرعة فك التشفير البالغ 1000 رمز/ثانية على خادم قياسي واحد بـ 8 وحدات GPU، وليس رقاقات مخصصة. يتحقق إنجاز السرعة من خلال ثلاث تقنيات متكاملة: التكميم المختلط FP4 الذي يستهدف طبقات الخبراء في بنية MoE، وفك التشفير التوقعي المتوازي المقنع على مستوى الكتل DFlash، ومحرك النواة الدائمة TileRT مع تخصيص مجموعات الخيوط.
تم إطلاق النموذج الأساسي MiMo V2.5 Pro FP4 DFlash كمصدر مفتوح بالتزامن مع الإعلان، مع أوزان FP4 ونقاط تحقق DFlash متاحة على HuggingFace، بما يتماشى مع توجه شاومي نحو استدلال عالي السرعة وسهل الوصول.