שיאומי ו TileRT חשפו ביוני 2026 את מצב ה UltraSpeed עבור MiMo V2.5 Pro, והפכו למודל טריליון הפרמטרים הראשון ששובר את מהירות ה 1,000 טוקנים לשנייה על שרת GPU תעשייתי בודד (8 כרטיסים). ההישג הושג באמצעות שילוב שלוש טכניקות מתוחכמות: דחיסת FP4 סלקטיבית לשכבות המומחים, פענוח ספקולטיבי מבוסס בלוקים (DFlash), ומנוע ליבה מ...

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on June 6, 2026 regarding MiMo-V2.5-Pro-UltraSpeed, including the specific tokens-per-second milestone achieved on. Article summary: On **June 8, 2026** (with major reports appearing on June 9), Xiaomi's MiMo team, in collaboration with TileRT, announced **MiMo-V2.5-Pro-UltraSpeed** — a new high-speed inference mode for its trillion-parameter flagship. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency. Xiaomi has introduced its MiMo-V2.5 model family, adding multimodal capabilities and advancing its push int" source context "Xiaomi rolls out MiMo V2.5 with multimodal AI and improved efficiency" Reference image 2: visual subje
ב-8 ביוני 2026, צוות MiMo של שיאומי, בשיתוף פעולה עם שותפת ההאצה TileRT, השיק את ה-MiMo-V2.5-Pro-UltraSpeed, מצב הסקה מהיר במיוחד עבור סדרת המודלים MiMo-V2.5-Pro . הכותרות התמקדו בטענה אחת מרכזית: מודל בעל טריליון פרמטרים (1T) המצליח לייצר מעל 1,000 טוקנים בשנייה. שיאומי תיארה זאת כפריצת דרך ראשונה מסוגה בקנה מידה זה, תוך הדגשה שהכל רץ על שרת GPU תעשייתי סטנדרטי בעל 8 כרטיסים (Commodity Node), ולא על חומרה מותאמת אישית
.
החברה דיווחה על תפוקה יציבה של יותר מ-1,000 טוקנים לשנייה, כשהדגמות הראו שיאים של 1,200 טוקנים לשנייה, וזאת על שרת GPU סטנדרטי . ההישג שובר את מה ששיאומי מכנה "המשולש הבלתי אפשרי" בתעשייה: שילוב של מהירות, יכולת ותאימות לחומרת GPU גנרית
. מנכ"ל שיאומי, ליי ג'ון, ציין ברשתות החברתיות כי זוהי הפעם הראשונה בתעשייה בה מודל טריליון פרמטרים חוצה את הרף של 1,000 טוקנים/שנייה
.
חשוב להבין: מצב ה-UltraSpeed אינו דור חדש של מודל, אלא שכבה הנדסית חכמה המתלבשת מעל MiMo-V2.5-Pro. זהו מודל ארכיטקטורת Mixture-of-Experts (MoE) בעל 1.02 טריליון פרמטרים, שרק 42 מיליארד מהם פעילים בו-זמנית, המסוגל להתמודד עם חלון הקשר (Context Window) עצום של מיליון טוקנים .
התיעוד הרשמי של שיאומי מתאר תכנון מערכתי מלא המשלב שלוש טכניקות מתואמות כדי לדחוף את התפוקה אל מעבר ל-1,000 טוקנים/שנייה .
הרעיון פשוט אך מתוחכם: רק שכבות המומחים (Expert layers) בארכיטקטורת ה-MoE נדחסות לדיוק של 4 ביטים (FP4), בעוד כל שאר השכבות שומרות על הדיוק המקורי שלהן . תהליך ה-Quantization-Aware Training (QAT) מקטין משמעותית את נפח המודל ואת הלחץ על רוחב הפס של הזיכרון, תוך מטרה לשמור על יכולות המודל ברמה כמעט זהה למקור
. גישה סלקטיבית זו מונעת פגיעה ברכיבים הרגישים יותר לאובדן דיוק.
במקום לייצר טוקנים אחד-אחד באופן אוטו-רגרסיבי, DFlash משתמשת בניבוי מקבילי מבוסס בלוקים . מודל הטיוטה (Draft Model) עושה שימוש במנגנון קשב של חלון נע (Sliding Window Attention) כדי לשמור על עלות חיזוי קבועה, מבלי שתהיה תלויה באורך הרצף
. כדי להבטיח שהמודל הגדול יאשר את הטוקנים שניבאו, נעשה שימוש באופטימיזציית Muon ובזיקוק עצמי (Self-Distillation) לשיפור שיעורי הקבלה
. בתרחישי קידוד, דווח על אורך ממוצע של 6.30 טוקנים שמאושרים בכל שלב אימות
.
מערכת TileRT נוטשת את הגישה המסורתית שבה כל פעולה מפעילה גרעין עיבוד (Kernel) נפרד, ובמקום זאת מריצה צינור עיבוד שלם שיושב באופן קבוע על ה-GPU . שליפה מראש (Prefetching) של הפקודות חופפת את תנועת הנתונים עם החישוב, ומוחקת כמעט לחלוטין את זמני ההמתנה של המעבד הגרפי
. בנוסף, המערכת מפרקת ברמת ה-Tile (אריח) את פעולות התקשורת, העברת הנתונים וחישובי הטנזורים בין חטיבות עיבוד שונות (Warps) בעלות תפקידים ייעודיים, מה שהופך למעשה את ה-GPU למערכת ביצוע הטרוגנית שזורמת ברציפות
.
מחיר הניסיון של ה-API ל-UltraSpeed נקבע לפי 3 בדיוק מהמחיר של מצב ה-Pro הרגיל .
תמחור הקלט משקף את אותה מכפלה של פי 3: קלט שנמצא בזיכרון המטמון (Cache Hit) ב-$0.0108 למיליון טוקנים, וקלט שלא נמצא (Cache Miss) ב-$1.305 למיליון טוקנים . שיאומי משווקת זאת תחת הסלוגן הקליט "פי 3 המחיר, פי 10 חוויית הפלט", תוך שהיא מדגישה את שיפור התפוקה הדרמטי לעומת העלייה המתונה יחסית בעלות
.
חלון הזמן להתנסות מוגבל במפורש: 9 ביוני עד 23 ביוני 2026, בשעה 23:59 . הגישה מבוססת על בקשה ואישור מראש, שכן משאבי ההאצה מוגבלים. תינתן עדיפות לתרחישי שימוש ארגוניים ולמפתחים מקצועיים
.
משתמשים שיאושרו יקבלו גישה חינמית לשימוש בצ'אט במהלך שבועיים אלו, בכפוף לכללי שימוש הוגן: מקסימום 10 כניסות מוצלחות לתור ביום, הגבלת סשן ל-30 דקות, ושחרור אוטומטי של משאבים לאחר 5 דקות של חוסר פעילות . שיאומי לא מתחייבת למהירות הטיפול בבקשות או לשיעור האישורים
.
המודל הבסיסי, המכונה MiMo-V2.5-Pro-FP4-DFlash, שוחרר כקוד פתוח במקביל להכרזה . המשקלים הדחוסים (FP4) ומודל הטיוטה (DFlash) זמינים להורדה בפלטפורמת HuggingFace, בהתאם להצהרות החברה כי אלו הם רכיבי הליבה של השיטה
.
ההישג של MiMo-V2.5-Pro-UltraSpeed מוכיח שהסקה של מודלי ענק במהירות אינטראקטיבית היא בהישג יד גם ללא הסתמכות על שבבים מותאמים כמו TPUs או ASICs יקרים, תוך שימוש בתשתית GPU מוכרת וזמינה .
עבור מפתחים הבונים אפליקציות מבוססות סוכנים (Agents), מערכות RAG מורכבות, או יישומים הדורשים יצירת קוד בזמן אמת, השילוב של מהירות גבוהה וחלון הקשר עצום של מיליון טוקנים מהווה קפיצת מדרגה משמעותית לפרודוקטיביות. היכולת לעבד 1,000 טוקנים בשנייה – שווה ערך לכ-750 מילים בשנייה – הופכת אינטראקציות מורכבות עם מסמכים ארוכים או בסיסי קוד גדולים למיידיות ומעשיות מאי פעם, כל עוד ניתן להשיג גישה במהלך חלון הניסיון המצומצם.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
שיאומי ו TileRT חשפו ביוני 2026 את מצב ה UltraSpeed עבור MiMo V2.5 Pro, והפכו למודל טריליון הפרמטרים הראשון ששובר את מהירות ה 1,000 טוקנים לשנייה על שרת GPU תעשייתי בודד (8 כרטיסים).
שיאומי ו TileRT חשפו ביוני 2026 את מצב ה UltraSpeed עבור MiMo V2.5 Pro, והפכו למודל טריליון הפרמטרים הראשון ששובר את מהירות ה 1,000 טוקנים לשנייה על שרת GPU תעשייתי בודד (8 כרטיסים). ההישג הושג באמצעות שילוב שלוש טכניקות מתוחכמות: דחיסת FP4 סלקטיבית לשכבות המומחים, פענוח ספקולטיבי מבוסס בלוקים (DFlash), ומנוע ליבה מתמיד (TileRT) המבטל זמני המתנה ב GPU.
קוד המודל הבסיסי, MiMo V2.5 Pro FP4 DFlash, שוחרר כקוד פתוח בפלטפורמת HuggingFace, ומאפשר לקהילת המחקר לנתח ולשחזר את הביצועים פורצי הדרך.