Skild AI טוענת כי S1 מסוגל לבצע משימות חדשות ורב־שלביות שאורכן עד 10 דקות, לאחר צפייה בסרטון אנושי יחיד וללא fine tuning; במבחן פנימי דווח על הצלחה ממוצעת של 66% בכל שלב, לעומת 9% למודל שקיבל הוראה בשפה. הסרטון משמש כ"פרומפט" חזותי בזמן ההפעלה: S1 מחבר מיומנויות שנלמדו מראש ומתאים את הפעולות לסביבה הנוכחית של הרובוט.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
רובוטים תעשייתיים עדיין דורשים בדרך כלל תכנות ייעודי, איסוף נתונים, הפעלה מרחוק או אימון מחדש כמעט בכל פעם שמוסיפים להם משימה. Skild AI מנסה לשנות את הממשק הזה באמצעות S1 — מודל בסיס לרובוטיקה שאמור ללמוד משימה חדשה מהדגמה בווידאו.
לפי החברה, אפשר להציג לרובוט סרטון קצר או ארוך של אדם שמבצע משימה, והמודל ינסה לבצע אותה בסביבה הנוכחית שלו. S1 מיועד גם למשימות רב־שלביות שלא הופיעו באימון המקדים ושנמשכות עד 10 דקות, בלי fine-tuning או מחזור אימון ייעודי לאחר הצפייה. 1
המשמעות אינה שהרובוט משחזר כל פריים בסרטון. הרעיון הוא שהוא מזהה את המטרה, מבין את סדר הפעולות ומרכיב יכולות שכבר למד — כמו אחיזה, הזזה, מזיגה והנחה — לרצף חדש של פעולות.
הטכנולוגיה מכונה למידה חזותית מתוך ההקשר — Visual In-Context Learning. הסרטון האנושי משמש כפרומפט בזמן ההפעלה, ולא כנתונים שמחייבים שינוי של משקלי המודל. S1 מתבונן בהדגמה, מסיק מהי המטרה ומהו רצף הפעולות הרצוי, ואז מתרגם את המידע לפקודות עבור הרובוט והסביבה שבה הוא נמצא. 1
זה קרוב יותר ל"להראות לרובוט מה לעשות" מאשר לאימון רובוטי מסורתי. המודל צריך לקשר בין מה שהוא רואה לבין מיומנויות שנלמדו מראש, וגם להתמודד עם שינויים במיקום החפצים, בזווית שלהם ובתנאי הסביבה.
Skild הציגה דוגמאות כמו הכנת קפה בשיטת מזיגה ידנית, שתילת צמח בעציץ, הרכבת ערכה והפיכת פנקייקים. 135 אלה אינן תנועות בודדות, אלא משימות הכוללות זיהוי חפצים, תכנון סדר פעולות ושליטה מתמשכת.
האתגר המרכזי הוא אופק פעולה ארוך. משימה של 10 דקות עשויה לכלול עשרות החלטות והזדמנויות לטעות. לכן S1 נדרש לשמור על היעד לאורך זמן, להגיב לשינויים ולהתאים את הביצוע — לא רק להעתיק את התנועות המדויקות של האדם בסרטון.
Skild דיווחה על פער משמעותי בין מתן הוראה באמצעות סרטון לבין מתן הוראה בשפה. בסולם אימון שהגיע ל־100,000 שעות, המדיניות שקיבלה פרומפט בווידאו השיגה שיעור הצלחה ממוצע של 66% בכל שלב, לעומת 9% למדיניות מקבילה מסוג Vision-Language-Action, כלומר מודל שמקבל הוראה לשונית ומשלב ראייה ופעולה. 32
הפער עשוי לנבוע מכך שהסרטון מעביר פרטים פיזיים שקשה לתאר במילים: איזה חפץ לתפוס, באיזו זווית, מהו סדר הפעולות ואיך להגיב כאשר הסביבה אינה בדיוק כפי שתוכנן.
אבל חשוב לדייק: מדובר בתוצאה שדווחה על ידי Skild במסגרת הערכה פנימית, ולא במדד תעשייתי ששוחזר באופן בלתי תלוי. בנוסף, שיעור הצלחה בכל שלב אינו אומר שלרובוט יש סיכוי של 66% להשלים משימה של 10 דקות מתחילתה ועד סופה. במשימה ארוכה, טעות באחד השלבים עלולה להשפיע על ההמשך.
הדוגמאות הציבוריות של המודל כוללות:
Skild מתארת את המשימות ככאלה שלא נכללו באימון המקדים. עם זאת, הראיות הזמינות מגיעות בעיקר מהחברה ומדיווחים המסכמים את טענותיה. 133
הסרטונים מדגימים את הממשק שהחברה מבקשת ליצור: אדם מבצע משימה פעם אחת, והרובוט מנסה להכליל את ההליך. הם אינם מוכיחים ש־S1 מסוגל לבצע כל עבודת בית, לפעול ללא פיקוח או להתמודד עם כל וריאציה פיזית אפשרית במפעל.
היתרון המוצהר של S1 הוא שאין צורך במחזור אימון נפרד לאחר שהרובוט צפה בהדגמה. Skild והסיקור של ההשקה מתארים הפעלה בזמן אמת מתוך ההקשר. 130
עם זאת, המקורות הזמינים אינם מספקים מדידת השהיה מדויקת ואמינה — למשל, כמה שניות עוברות מסיום הסרטון ועד הפעולה הראשונה של הרובוט. "ללא fine-tuning" פירושו שהמודל אינו עובר עדכון משקלים ייעודי למשימה חדשה; אין פירוש הדבר שכל סרטון מעובד באופן מיידי, או שאין צורך בכיול, בהכנת המערכת ובבדיקות בטיחות.
S1 הוא חלק מאסטרטגיה רחבה יותר של Skild, המכונה Skild Brain. החברה מנסה לאמן מודל כללי על משימות רבות, על גופי רובוטים שונים, על סימולציות וגם על נתונים חזותיים של בני אדם — במקום לבנות מדיניות נפרדת לכל רובוט ולכל משימה.
Skild אומרת שיצרה יקום סימולטיבי ובו 100,000 וריאציות של רובוטים, ובדקה אם המודל יכול להכליל גם לגופים שלא נכללו בנתוני האימון. 6 חומרי החברה מתארים מערכת שמיועדת לפעול על רובוטים דמויי אדם, רובוטים הולכים על ארבע, זרועות שולחניות ורובוטים ניידים המשלבים זרוע ומערכת תנועה. 310
המונח "אומני־בודי" — Omni-Bodied — הוא המיתוג של Skild למודל שאמור לעבור בין גופים שונים. ברמה העקרונית, מודל משותף יכול ללמוד את מטרת המשימה בנפרד מהגיאומטריה המדויקת של מכונה מסוימת, ולהתאים את עצמו להבדלים בגפיים, בגלגלים, בזרועות ובמפעילים.
אך גוף הרובוט עדיין חשוב מאוד. רובוטים שונים משתמשים בחיישנים, תפסנים וממשקי בקרה שונים; יש ביניהם הבדלים במגבלות המפרקים, במשקל הנשיאה, בהשהיה ובדרישות הבטיחות. לכן הכללה בין גופים עשויה לצמצם את עבודת ההתאמה, אך אינה מבטלת את הצורך באינטגרציה ובבדיקות בסביבה האמיתית.
Skild מציגה אימון בקנה מידה רחב על שילוב של סימולציה, ניסיון רובוטי ונתונים חזותיים של בני אדם. החברה והסיקור בענף העלו גם טענות שלפיהן ברשותה פי 100 עד פי 1,000 יותר נתונים ממתחרותיה.
את הטענה הזו יש לקבל בזהירות. במקורות שסופקו אין השוואה אחידה וניתנת לביקורת בין גודל מאגרי הנתונים, איכותם או כמות הניסיון הרובוטי השימושי של חברות שונות. הניסוח המבוסס יותר הוא ש־Skild מנסה להגדיל את מאגר האימון באמצעות מעבר בין גופי רובוטים וסימולציה, ולא להסתמך רק על הדגמות ייעודיות של רובוט יחיד.
לפי דיווחים פומביים, התוכנה של Skild פועלת על מאות רובוטים במפעלים, במרכזי נתונים ובסביבות לוגיסטיות. הדוגמאות שדווחו כוללות את המפעל של NVIDIA ביוסטון, ניסוי בנמל התעופה לה גוארדיה ועבודה עם חברות בתחום החיווט והבנייה. החברה גם הודיעה על קשרים עם ABB Robotics, Universal Robots ו־NVIDIA. 174
בנוסף, דווח על תוכנית לפרוס את המודל עם Foxconn בקווי הרכבה הקשורים לשרתי ה־GPU מדגם Blackwell של NVIDIA ביוסטון. 43 מדובר בעדות למאמץ ניסוי או פריסה, ולא בהוכחה להפעלה אוטונומית רחבה של מפעלים.
המקורות הציבוריים אינם מספיקים כדי לחשב שיעורי השלמה בייצור, זמינות מערכת, חיסכון בעלויות או החזר השקעה. לכן אין להסיק מתוצאה מעבדתית של 66% על ביצועי ייצור בפועל.
העניין סביב Skild AI קיבל חיזוק משמעותי בעקבות גיוסי הענק שלה. לפי דיווח בלומברג, בינואר 2026 גייסה החברה כ־1.4 מיליארד דולר בסבב C בהובלת SoftBank, לפי שווי של יותר מ־14 מיליארד דולר. 13 בסבב A, שהוכרז ביולי 2024, גייסה החברה 300 מיליון דולר לפי שווי מדווח של 1.5 מיליארד דולר. 9
ההשוואה ל"רגע ה־ChatGPT" מתייחסת לשינוי אפשרי בחוויית המשתמש: במקום לתכנת רובוט או לאמן אותו מחדש לכל עבודה, עובד יוכל להדגים את ההתנהגות הרצויה — והמודל יתרגם אותה לפעולות.
S1 הוא צעד מעניין בכיוון הזה, אך עדיין לא הוכחה לכך שהרובוטים הכלליים כבר הגיעו. התוצאות החזקות ביותר שפורסמו הן תוצאות מטעם החברה, רשימת המשימות עדיין מוגבלת, ואין במקורות שסופקו מדדים תעשייתיים בלתי תלויים. המסקנה הזהירה יותר היא ש־S1 מציג דרך מבטיחה לצמצם אימון ייעודי לרובוטים: להשתמש בווידאו כהוראה, להישען על מיומנויות שנרכשו באימון רחב ולבדוק אם אפשר להרכיב אותן למשימות חדשות וארוכות.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI טוענת כי S1 מסוגל לבצע משימות חדשות ורב־שלביות שאורכן עד 10 דקות, לאחר צפייה בסרטון אנושי יחיד וללא fine tuning; במבחן פנימי דווח על הצלחה ממוצעת של 66% בכל שלב, לעומת 9% למודל שקיבל הוראה בשפה.
Skild AI טוענת כי S1 מסוגל לבצע משימות חדשות ורב־שלביות שאורכן עד 10 דקות, לאחר צפייה בסרטון אנושי יחיד וללא fine tuning; במבחן פנימי דווח על הצלחה ממוצעת של 66% בכל שלב, לעומת 9% למודל שקיבל הוראה בשפה. הסרטון משמש כ"פרומפט" חזותי בזמן ההפעלה: S1 מחבר מיומנויות שנלמדו מראש ומתאים את הפעולות לסביבה הנוכחית של הרובוט.
האסטרטגיה הרחבה של Skild, המכונה Skild Brain, מבוססת על אימון במגוון גופי רובוטים ובסימולציה; עם זאת, אין עדיין נתונים ציבוריים בלתי תלויים על שיעורי השלמה, זמינות או החזר השקעה בתעשייה.