| האם נדרש אימון מחדש? | לא. רכישת המיומנות מתבצעת בזמן ההסקה, ללא עדכון ייעודי למשימה. | לא במצב הלמידה החד־פעמית: החברה טוענת שאין צורך בעדכוני גרדיאנט או בכוונון נוסף. |
| שיעור הצלחה | 62% בממוצע במשימות החדשות. | 59% בממוצע בעשר משימות מניפולציה, לפי דיווחי החברה. |
| טענת יעילות | רכישת המיומנות מהירה בערך פי 507 לעומת כוונון מפוקח עם 50 הדגמות רובוט לכל משימה. | הדגמה של 3–12 שניות אמורה להחליף אימון משימתי מסורתי; לחלופין, ניתן לבצע התאמה קצרה של 1–10 צעדי גרדיאנט. זו טענת החברה, ולא השוואה בלתי תלויה במסגרת אמת־מידה אחידה. |
HOST אינה מנסה פשוט להעתיק את מסלול היד של האדם. במקום זאת, הסרטון משמש כמפת התקדמות: המערכת מזהה באיזה שלב של המשימה נמצא הרובוט, מוצאת בסרטון את השלב המתאים ומעריכה כיצד תיראה התוצאה מנקודת המבט של הרובוט.
לאחר מכן היא גוזרת את הפעולות הדרושות כדי להגיע לתוצאה הזו, תוך שימוש בתצפיות של הרובוט עצמו ובמידע על מצב גופו. כך ניתן להתמודד טוב יותר עם הבדלים בין גוף האדם לגוף הרובוט, במקום להניח שהעתקה ישירה של תנועות האדם תעבוד.
בבדיקה שכללה 50 משימות חדשות ו־20 ניסיונות לכל משימה, HOST השיגה הצלחה ממוצעת של 62%. החוקרים דיווחו גם על ירידה של 1% בלבד בתנאי תאורה שונים, 4% בהחלפת חפצים, 6% בשינוי הסביבה ו־9% כאשר אדם הפריע במהלך הביצוע.
GEN-1.5 מציגה רעיון דומה מנקודת מבט של מודל יסוד רובוטי רחב. במקום להפוך את הסרטון למערך נתונים חדש ולבצע אימון, המודל מכניס אותו לחלון ההקשר שלו — בדומה לאופן שבו מודל שפה מקבל דוגמה בתוך השיחה וממשיך ממנה.
לפי Generalist AI, הדגמה באורך של 3–12 שניות יכולה להספיק כדי שהמערכת תנסה לבצע משימה חדשה ללא עדכון פרמטרים או fine-tuning. החברה מציגה דוגמאות כמו פתיחת צנצנת, פתיחת תיק, טאטוא קובייה לקערה ושימוש בכלים חדשים.
החברה מדווחת על 59% הצלחה ממוצעת בעשר משימות מניפולציה מגוונות, וכן על יכולות כגון חיקוי מאדם לרובוט, שרשור של שתי התנהגויות שנלמדו בהדגמות נפרדות, העברה מהדגמה בסימולציה לביצוע בעולם הפיזי ואלתור דרכי פעולה.
עם זאת, GEN-1.5 אינה «ללא אימון» בכל תרחיש. במשימות קשות יותר, Generalist מציעה מסלול few-shot שבו המודל מתעדכן באמצעות 1–10 צעדי גרדיאנט ועל בסיס דקות ספורות של נתונים. לכן יש להבחין בין למידה חד־פעמית בזמן ההפעלה לבין התאמה קצרה שעדיין כוללת אופטימיזציה.
הגישה הזו מקרבת את ממשק ההוראה של רובוטים לאופן שבו בני אדם מלמדים זה את זה: להראות במקום לתכנת כל תנועה, לתכנן פונקציית תגמול או לאסוף מאות הדגמות באמצעות הפעלה מרחוק.
היתרון אינו בכך שהרובוטים אינם זקוקים לנתוני אימון כלל. להפך: הם נשענים על אימון מקדים יקר ורחב־היקף. החידוש הוא שהעלות הזו «נפרסת» על פני משימות ומשתמשים רבים, כך שהאדם שמפעיל את הרובוט עשוי ללמד אותו פעולה חדשה באמצעות צפייה קצרה אחת — בלי להתחיל תהליך אימון מלא.
HOST ממחישה את החיסכון במספרים: 29 שניות לרכישת מיומנות ומהירות של פי 507 לעומת כוונון מפוקח בתנאי ההשוואה של המחקר. GEN-1.5 מציעה חזון דומה דרך מודל כללי יותר, אך נכון לעכשיו הטענות המספריות שלה קשות יותר להשוואה ישירה.
HOST אינה הוכחה לאמינות בעולם פתוח. מדובר במחקר קדם־פרסום ובהערכה מבוקרת של 50 משימות שנבחרו מראש. שיעור הצלחה של 62% עדיין רחוק מביצוע אמין בכל משימה, במיוחד בסביבות ביתיות, תעשייתיות, ארוכות־טווח או בטיחותיות.
ההדגמות של GEN-1.5 אינן תחליף לבנצ'מרק עצמאי. הנתונים על המודל, משך האימון, היעדר נתוני סימולציה, משך ההדגמות ושיעורי ההצלחה מגיעים בעיקר מ־Generalist AI או מהודעות מטעמה.
אין עדיין השוואה ציבורית אחידה בין המערכות. עבור GEN-1.5 חסרים פרוטוקול ניסוי מפורט, מספר ניסויים מלא, בסיס השוואה מוסכם, שחרור מודל ונתונים ושחזור של צד שלישי. לכן ההדגמות הן אינדיקציה ליכולת מבטיחה — אך לא הוכחה לכך שהמערכת קבעה שיא ביצועים כללי.
בשורה התחתונה, HOST מספקת ראיה אקדמית לכך שרובוט יכול לרכוש מיומנות מניפולציה חדשה מסרטון אנושי יחיד, בזמן ההפעלה וללא שינוי במשקלי המודל. GEN-1.5 מרמזת שאימון מקדים רחב על ניסיון פיזי עשוי להפוך יכולת דומה למאפיין של מודל רובוטי כללי. הכיוון נראה משמעותי, אבל למידה מהתבוננות עדיין אינה תחליף לבדיקות אמינות, הנדסת בטיחות והתאמה ייעודית בסביבות לא־מבוקרות.