Xiaomi לא הסתפקה בפרסום תוצאה סופית: בזמן אימון החיזוק של MiMo-V2.6 Pro ו־Flash היא הציגה לציבור לוח מדדים שהתעדכן לאורך הריצות. זו הצצה יוצאת דופן לשלב שאחרי האימון המקדים — אך עדיין מדובר בנתונים ש־Xiaomi בחרה להציג, לא בתיעוד מלא של כל פעילות המחשוב שלה.
1
18
מה הופיע על הלוח?
אפשר היה לעקוב אחר שלבי אימון שהושלמו, ניסיונות ביצוע שעדיין רצו, מספרי טוקנים, עקומות תגמול, שיעורי הצלחה במשימות, זמני שלבים, עלות מצטברת וציוני ביניים במשימות תכנות. מוני שלבי האימון ושלבי יצירת הניסיונות לא תמיד תאמו: יצירת הניסיונות התקדמה במקביל לעדכוני המודל, באופן אסינכרוני.
1
18
22
הלוח וסקירות שלו הציגו גם סימנים לתקלות תפעוליות, ובהן הפעלות מחדש, מחסור בזיכרון במעבדים גרפיים ובעיות בנתונים. הגדרות המדדים מבחינות בין כישלון בביצוע משימה לבין ניסיון שאבד בגלל תשתית. המידע הזה מועיל להבנת הגרפים, אך אינו מוכיח שכל תקלה הוצגה.
18
23
בתמונת מצב מוקדמת שני המודלים עמדו על שלב אימון 10, בעוד שלב יצירת הניסיונות כבר הגיע ל־16. באותה נקודה דווח על כ־2.2 מיליארד טוקנים לשלב ב־Pro וכ־2.6 מיליארד ב־Flash, ועל הוצאה מצטברת של כ־741 אלף וכ־322 אלף דולר, בהתאמה. אלה היו נתונים לרגע מסוים, לא העלות הסופית או קצב הוצאה יומי קבוע.
25
איך התנהל האימון?
כל עדכון התבסס על 1,568 משימות שהוצגו למודל, עם 16 ניסיונות לכל משימה — 25,088 מסלולי ביצוע אפשריים לשלב. המערכת אפשרה ליצירת התשובות ולהרצת המשימות להתקדם במקביל לבדיקה ולעדכון המודל. באותה ריצת אימון שולבו משימות של סוכני AI בתחומי תכנות, משימות כלליות, עיבוד חזותי ואבטחת סייבר, באמצעות כמה מערכות להרצת המשימות — ולא סוג משימה אחד בלבד.
4
10
19
גם מתן הציון לא הסתכם ב״עבר״ או ״נכשל״. לפי תיאור השיטה של Xiaomi, תוצאות של בדיקות הניתנות להרצה שולבו עם אמות מידה ייעודיות למשימה והשוואות בין ניסיונות לאותה משימה. כך ניתן היה להבחין באיכות בין פתרונות שהצליחו. הבדיקה עצמה צרכה משאבי מחשוב: לפי סקירה של הדוח הטכני, חלקה היה כ־12.7% מעלות אימון החיזוק של Pro.
44
47
התיאור המוקדם של ״כ־2 מיליארד טוקנים לשלב״ היה אומדן של סדר גודל, לא מכסה קבועה. דיווחים מאוחרים יותר מציינים מספרי טוקנים גבוהים יותר לשלב.
4
19
20
איך קוראים ציוני הצלחה ועלויות?
תגמול האימון מתייחס למסלולי הביצוע ששימשו לעדכון המודל; הוא אינו מבחן יכולת עצמאי. המדד dynsam/avg@n מחשב, לכל משימה שנדגמה, את חלקם של הניסיונות שהצליחו — ואז ממוצע בין המשימות. הגרסה dynsam/avg@n_no_infra מוציאה מהחישוב ניסיונות שנכשלו מסיבות תשתית. ההשוואה ביניהם עוזרת שלא לייחס למודל תקלה בהרצת משימה, אך אף אחד מהם אינו מודד ביצועים בכל משימה אפשרית.
18
באותה תמונת מצב מוקדמת נרשמו במבחן התכנות DeepSWE v1.1 ציונים של 62.24 ל־Pro ו־60.77 ל־Flash. אלה היו ציוני בדיקה במהלך האימון. בהמשך דיווחה Xiaomi על תוצאות סופיות של כ־72.6 ל־Pro ו־65.7 ל־Flash. גם אותן יש להבין כתוצאות במסגרת הבדיקה של Xiaomi, ולא כתוצאות שפורסמו בלוח דירוג ציבורי ואומתו באופן בלתי תלוי.
25
17
45
לפי Xiaomi, שתי הריצות הסתיימו בתוך פחות משישה ימים, לאחר 30 שלבים לכל מודל. העלות המדווחת היא כ־2.62 מיליון דולר ל־Pro וכ־850 אלף דולר ל־Flash — כ־3.47 מיליון דולר יחד עבור ריצות אימון החיזוק המדווחות. את הנתון של כ־750 אלף מסלולי ביצוע נכון לקרוא כנתון לכל מודל: 25,088 מסלולים אפשריים לשלב כפול 30 שלבים הם 752,640. העלויות הללו אינן כוללות את האימון המקדים ואת כל יתר עבודת הפיתוח.
2
4
44
45
מה עדיין לא ידוע?
החידוש בלוח היה פרסום מדדים לאורך האימון, במקום חשיפה של המודלים המוגמרים בלבד. מאז הודיעה Xiaomi גם על פרסום משקולות Pro ו־Flash, מודל מוקטן של 9 מיליארד פרמטרים, דוח טכני, יותר מ־7,000 סביבות למשימות אימון חיזוק, מסגרת עבודה לתהליך האימון ומערכות הרצה קטנות שניתן לשלב זו בזו.
1
15
אבל לוח ציבורי אינו שקול לגישה מלאה ליומני המערכת. המקורות הזמינים אינם מאמתים באופן עצמאי רציפות שידור ללא הפסקות או סינון, ואינם מציגים את כל הפעילות המקבילה בתשתית. גם פרסום המודל המוקטן אינו ראיה לכך שתהליך יצירתו פעל מאחורי שתי הריצות שהוצגו, או שעלותו נכללה בסכומים שדווחו עבורן.
18
15
2