ההכרזה של אילון מאסק ב-14 בספטמבר מציירת מסלול שאפתני לדגמי Grok העתידיים של xAI, אך לא מציגה הוכחה לכך שהחברה השיגה בינתיים בינה מלאכותית כללית (AGI). לדבריו, Grok 4.8 — מודל עם 2.5 טריליון פרמטרים — אמור להשלים את האימון המקדים באותו שבוע ולעבור מיד לאחר מכן ללמידת חיזוק (RL). את Grok 5 הוא הציב כמודל שעשוי להגיע ל-AGI. עם זאת, לא פורסמו תוצאות מבחנים, כרטיס מודל, הגדרה תפעולית ל-AGI או לוח זמנים למסירה. לכן, נכון לראות בכך תחזית של מייסד החברה, ולא הישג שהודגם בפועל.
1
2
4
המדרג שמאסק תיאר ל-Grok
מאסק אמר ש-Grok 4.8 אומן באמצעות סביבת תוכנה חדשה של xAI, המבוססת על ++C, וששלב האימון המקדים שלו עומד להסתיים באותו שבוע; לאחריו אמור להתחיל שלב ה-RL.
1
2
במקביל הוא תיאר מדרג יכולות לדגמים שאחרי Grok 4.7:
- Grok 4.8: "שיפור מורגש" לעומת 4.7.
- Grok 4.9: כנראה ברמה של Astra או Fable.
- Grok 5: "אולי טוב יותר מכל דבר אחר"; כשנשאל על AGI, הוא הפנה ל-Grok 5 ולא ל-4.8.
2
14
הניסוח הזה חשוב: "אולי טוב יותר מכל דבר אחר" אינו מדד ביצועים. גם מסגור ה-AGI לא כלל פירוט של יכולות נדרשות, רמת אמינות, מידת אוטונומיה, תקני בטיחות או מערך הערכה שיקבעו מה נחשב AGI. דיווחים תיארו את Grok 5 כפריצת הדרך הנטענת של xAI ל-AGI, אך מפת הדרכים עצמה נותרה דלה בפרטים שאפשר לבדוק.
2
10
Grok 4.7: הערכה מתונה יותר מהבטחות על הובלה
לגבי Grok 4.7, שטרם שוחרר, מאסק היה זהיר יותר. הוא אמר שהמודל אמור להיות "בערך ברמה של Opus 5.0, לא 5.1" של Anthropic: טוב יותר בתחומים מסוימים ופחות טוב באחרים. הוא גם ציין שיש לתקן את הביצועים המולטימודליים — כלומר, עבודה משולבת עם טקסט, תמונות וסוגי מידע נוספים.
3
8
זו טענה צרה בהרבה מהצהרה על הובלה כוללת בשוק. והיא גם מדגישה עד כמה התחזית לגבי 4.8, 4.9 ו-5 היא ראשונית: הדגמים העתידיים נדונו עוד לפני שלמפתחים ולמשתמשים הייתה אפשרות לבחון באופן עצמאי את Grok 4.7.
מדוע העיכוב של Grok 4.7 משמעותי
ב-2 בספטמבר אמר מאסק ש-Grok 4.7 נמצא במרחק של כ-10 ימים מהשקה — כלומר, סביב 12 בספטמבר. ב-11 בספטמבר הוא כבר אמר שנדרשים "עוד כמה ימים".
7
20
ההסבר שהציע נגע לכיול של למידת החיזוק: ייתכן ש-xAI הענישה תגובות ארוכות בצורה אגרסיבית מדי. לפי מאסק, הדבר גרם למודל לוותר מוקדם מדי על משימות קשות שאותן הוא למעשה מסוגל לפתור, וכן לא לבדוק את עבודתו בקפדנות מספקת. הוא הציג זאת כאבחנה אפשרית, ולא כהסבר טכני סופי.
20
21
זה אינו רק פרט בלוח זמנים. המקרה ממחיש את הפער בין השלמת הרצת אימון גדולה לבין השקת מוצר שאפשר לסמוך עליו. התנהגות לאחר אימון, הערכות, איכות מולטימודלית, אמינות, בטיחות, מוכנות לפריסה ותמחור — כל אלה עשויים להשפיע על מועד ההשקה, ולעיתים על עצם ההחלטה להשיק.
מה היה זמין בפועל באותו זמן
נכון ל-14 בספטמבר, Grok 4.7 עדיין לא שוחרר לציבור. לפי הדיווחים, מודל הדגל המתועד והעדכני ביותר של xAI היה Grok 4.6, שהושק ב-12 באוגוסט, במחיר API של 2 דולר למיליון טוקני קלט ו-6 דולרים למיליון טוקני פלט.
3
11
באותה תקופה דווח על השקות או הכרזות בספטמבר של Claude Fable 5.1, Gemini 3.8 Flash ו-GPT-6 Astra.
34
45 ההקשר התחרותי מעלה את החשיבות של מפת הדרכים של xAI, אך הוא אינו מאמת טענות השוואתיות על ביצועים של דגמי Grok שעדיין לא שוחררו.
השורה התחתונה: זו טענה שעדיין דורשת אימות
היקף של 2.5 טריליון פרמטרים ומערך אימון חדש עשויים להצביע על השקעה תשתיתית משמעותית. אבל לא מספר הפרמטרים ולא עוצמת המחשוב, כשלעצמם, מוכיחים יכולת, אמינות או AGI. העיכוב ב-Grok 4.7 הוא תזכורת מעשית לכך שהתנהגות המודל לאחר האימון עשויה להיות גורם מכריע.
1
20
למפתחים, ללקוחות ולמשקיעים, נקודות הבדיקה החשובות יותר מהצהרות מפת דרכים הן:
- השקה רשמית עם מודל שניתן לגשת אליו או מוצר זמין.
- תמחור, תיעוד וכרטיס מודל שפורסמו לציבור.
- תוצאות מבחנים שניתן לשחזר, לרבות משימות מולטימודליות ומשימות ארוכות טווח, כשזה רלוונטי.
- הגדרה ברורה של AGI ותקן הערכה, לפני שמתייחסים לטענת AGI כאל יותר משאיפה.
עד לפרסום חומרים כאלה, דבריו של מאסק מ-14 בספטמבר מבהירים את הכיוון שאליו xAI שואפת: Grok 4.8 לאחר אימון מקדים ו-RL, אחריו 4.9 חזק יותר, ולבסוף Grok 5 שאפתני במיוחד. הם אינם מוכיחים שאחד מהמודלים האלה כבר הגיע לרמת היכולת שהובטחה.
2
4