تقول Skild AI إن نموذج S1 يستطيع تنفيذ مهام متعددة الخطوات لم يسبق له رؤيتها، وتستمر حتى 10 دقائق، بعد مشاهدة فيديو بشري واحد ومن دون ضبط دقيق أو تدريب لاحق؛ وسجّل معدل نجاح متوسطاً بلغ 66% لكل خطوة في اختبار داخلي لل... يتعامل S1 مع الفيديو بوصفه تعليمة وقت التنفيذ، فيركّب مهارات اكتسبها خلال التدريب المسبق وينقلها...
نشر بواسطةتم التحرير باستخدام GPT-5.6 Lunaتم إنشاء الصور باستخدام GPT Image 1.5
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
يحاول نموذج S1 من شركة Skild AI جعل برمجة الروبوتات أقرب إلى التعليم بالمشاهدة: يؤدي شخص المهمة أمام الكاميرا، ثم يستخدم النموذج هذا العرض بوصفه تعليمة بصرية، بدلاً من بدء عملية تدريب جديدة مخصصة للمهمة. وتقول Skild إن S1 يستطيع تنفيذ مهام متعددة الخطوات لم يسبق له رؤيتها، وقد تمتد إلى 10 دقائق، من دون ضبط دقيق أو دورة تدريب لاحقة بعد مشاهدة الفيديو. 1
تكمن أهمية هذا النهج في أن أنظمة الروبوتات كانت تحتاج تقليدياً إلى كميات كبيرة من البيانات الخاصة بكل مهمة، أو إلى التحكم عن بُعد والهندسة وإعادة التدريب قبل الانتقال إلى عمل جديد. ولا يفترض S1 أنه يحفظ الفيديو لقطة بلقطة؛ بل يحاول فهم الهدف وتركيب مهارات تعلمها سابقاً في سلسلة جديدة من الأفعال.
يعتمد S1 على ما يسمى التعلم البصري داخل السياق. فالعرض الذي يقدمه الإنسان يعمل كـ«موجّه للمهمة» وقت التنفيذ. يراقب النموذج ما يحدث، ويستنتج الهدف وتسلسل الخطوات، ثم يحوّل هذه المعلومات إلى أوامر للروبوت داخل البيئة الموجودة أمامه. ووفق وصف Skild، لا تتغير أوزان النموذج مع كل عرض جديد. 1
وهذا أقرب إلى أن تري نظاماً ذكياً ما تريد منه فعله، لا إلى تدريبه بالطريقة التقليدية. فعلى النموذج أن يربط المشاهدات البصرية بمهارات سبق أن تعلمها، مثل الإمساك بالأشياء وتحريكها ووضعها والتعامل معها، ثم يرتب تلك المهارات في إجراء أطول. وتشمل الأمثلة العلنية التي عرضتها Skild إعداد القهوة بطريقة التقطير، وزراعة النباتات في الأصص، وتجميع أطقم، وقلب الفطائر. 1
35
التحدي الأكبر هنا هو طول أفق المهمة. فقد يكون من السهل نسبياً تعلم حركة قصيرة أو برمجتها منفردة، لكن مهمة تستغرق 10 دقائق قد تضم عشرات القرارات، وتغيّر مواقع الأشياء، وفرصاً متعددة للخطأ. ويُفترض أن يحافظ S1 على الهدف طوال هذا التسلسل، وأن يكيّف أفعاله مع المشهد بدلاً من إعادة حركات الشخص الذي ظهر في الفيديو حرفياً.
تقول Skild إن هناك فرقاً كبيراً بين التوجيه بالفيديو والتوجيه باللغة في اختبار للمهام الجديدة. فعند مقياس تدريب معلن يبلغ 100 ألف ساعة، حققت السياسة الموجّهة بالفيديو معدل نجاح متوسطاً قدره 66% لكل خطوة، مقارنة بـ9% لسياسة مماثلة من نماذج الرؤية-اللغة-الفعل التي تعتمد على التوجيه النصي. 32
وتشير النتيجة إلى أن العرض البصري قد ينقل تفاصيل فيزيائية يصعب على الكلمات وحدها تحديدها: أي جسم ينبغي الإمساك به، وكيفية توجيهه، وترتيب الأفعال، وكيف يستجيب الشخص للتغيرات في البيئة. لكن ينبغي قراءة الرقم بحذر؛ فهو ناتج عن تقييم أعلنته Skild، وليس معياراً صناعياً أعادت جهات مستقلة اختباره. كما أن معدل النجاح لكل خطوة لا يعني أن الروبوت يضمن إكمال مهمة كاملة مدتها 10 دقائق بنسبة 66% من البداية إلى النهاية.
تشمل العروض العامة مهام تلاعب بالأشياء مثل:
وتكتسب هذه الأمثلة أهمية لأنها تجمع بين الإدراك والتعامل مع الأشياء وترتيب الخطوات والتحكم المستمر، بدلاً من اختبار حركة واحدة معزولة. وتصف Skild هذه المهام بأنها لم تظهر في التدريب المسبق، مع أن الأدلة المتاحة تأتي أساساً من الشركة ومن تقارير تلخص ادعاءاتها. 1
33
وتوضح العروض الواجهة التي تستهدفها الشركة: ينفذ الإنسان المهمة مرة، ثم يحاول الروبوت تعميم الإجراء. لكنها لا تثبت أن S1 يستطيع أداء أي عمل منزلي عشوائي بموثوقية، أو العمل من دون إشراف، أو التعامل مع كل الاختلافات الفيزيائية الموجودة في بيئة إنتاج حقيقية.
الميزة التي تروّج لها Skild هي أن الروبوت يستطيع البدء بعد مشاهدة العرض، من دون مرحلة تدريب منفصلة لاحقة. وتصف الشركة والتغطيات المرتبطة بالإطلاق هذا التنفيذ بأنه يحدث في الوقت الحقيقي ضمن سياق المهمة. 1
30
لكن المصادر المتاحة لا تقدم قياساً دقيقاً وموثوقاً لزمن الاستجابة، مثل عدد الثواني بين نهاية الفيديو وبدء أول حركة. فعبارة «من دون ضبط دقيق» تعني أن النموذج لا يمر بدورة جديدة لتحديث أوزانه من أجل المهمة، ولا تعني بالضرورة أن كل فيديو يُعالج فوراً أو أن الروبوت لا يحتاج إلى إعداد أو معايرة أو فحوص سلامة.
يمثل S1 جزءاً من استراتيجية Skild Brain الأوسع، التي تهدف إلى تدريب نموذج عام على مهام وأجسام روبوتية ومحاكاة وبيانات بصرية بشرية متنوعة، بدلاً من بناء سياسة منفصلة لكل روبوت ولكل وظيفة. وتقول Skild إنها أنشأت عالماً محاكياً يضم 100 ألف نموذج مختلف من الروبوتات، واختبرت قدرة النموذج على التعميم إلى أجسام استُبعدت من بيانات التدريب. 6
ويُفترض أن يؤدي التدريب عبر أجسام متعددة إلى تعريف النموذج بمبادئ عامة للتحكم. وتصف مواد Skild نظاماً يستهدف العمل عبر روبوتات شبيهة بالبشر، وروبوتات رباعية الأرجل، وأذرع مكتبية، وروبوتات متنقلة مزودة بأذرع. 3
10
أما الادعاء المتكرر بأن Skild تمتلك بيانات أكثر من منافسيها بما بين 100 و1000 مرة، فينبغي التعامل معه بحذر. فالمصادر المقدمة لا توفر مقارنة موحدة وقابلة للتدقيق بشكل مستقل لحجم البيانات أو جودتها أو مقدار الخبرة الروبوتية المفيدة لدى الشركات المختلفة. والنقطة الأكثر قابلية للدفاع هي أن Skild تراهن على التوسع عبر التدريب والمحاكاة على أجسام متعددة، لا على عروض مخصصة لروبوت واحد ومنصة عتاد واحدة.
«متعدد الأجسام» هو المصطلح الذي تستخدمه Skild لوصف نموذج يفترض أن ينتقل بين هياكل روبوتية مختلفة. ومن حيث المبدأ، يمكن لنموذج مشترك أن يتعلم مفاهيم المهمة على مستوى عالٍ بصورة منفصلة عن هندسة آلة بعينها، ثم يتكيف مع أطراف وعجلات ومقابض وترتيبات مختلفة للمحركات. وتقول Skild إن اختبارات المحاكاة شملت أشكالاً روبوتية لم تدخل بيانات التدريب، وتم التحكم فيها من دون أمثلة سابقة مباشرة. 6
لكن ذلك لا يجعل العتاد أمراً ثانوياً. فالروبوتات تختلف في المستشعرات، والمقابض، وحدود المفاصل، وواجهات التحكم، وزمن الاستجابة، وقدرات الحمولة، واشتراطات السلامة. وقد يقلل النموذج القابل للتعميم بين الأجسام من وقت التكييف، لكن تشغيله يظل يتطلب عتاداً متوافقاً وتكاملاً مع النظام واختبارات داخل البيئة المستهدفة.
تقول تقارير عامة إن برمجيات Skild تعمل على مئات الروبوتات في المصانع ومراكز البيانات وبيئات الخدمات اللوجستية. وتشمل الأمثلة المعلنة مصنع NVIDIA في هيوستن، وتجربة في مطار لاغوارديا، وأعمالاً مع شركات في مجالي تمديدات الأسلاك والإنشاءات. كما أعلنت الشركة علاقات مع ABB Robotics وUniversal Robots وNVIDIA. 17
4
وتشير هذه التقارير إلى اهتمام تجاري واختبارات في العالم الحقيقي، لكنها لا توفر أدلة عامة كافية لحساب معدلات إنجاز الإنتاج أو الجهوزية التشغيلية أو خفض التكلفة أو العائد على الاستثمار بصورة مستقلة. ولا ينبغي تحويل نتيجة مختبرية أو تقييم مضبوط إلى مؤشر إنتاجي. كما تحدث أحد التقارير عن نشر مخطط مع شركة Foxconn على خطوط تجميع مرتبطة بأنظمة خوادم شرائح NVIDIA Blackwell، وهو دليل على جهد اختبار أو نشر، وليس برهاناً على تشغيل واسع لمصانع ذاتية بالكامل. 43
ساعد التمويل الذي حصلت عليه Skild في جعل نهجها من أكثر مشاريع الذكاء الاصطناعي المادي متابعة. فقد ذكرت Bloomberg أن الشركة جمعت نحو 1.4 مليار دولار في جولة Series C قادتها SoftBank في يناير 2026، وبقيمة سوقية تجاوزت 14 مليار دولار. 13 وكانت الشركة قد أعلنت في يوليو 2024 عن جولة Series A بقيمة 300 مليون دولار، عند تقييم معلن بلغ 1.5 مليار دولار.
9
وتلخص عبارة «لحظة ChatGPT» التغيير المأمول في تجربة المستخدم: بدلاً من برمجة الروبوت أو إعادة تدريبه لكل مهمة، يمكن للعامل أن يريه السلوك المطلوب، ثم يترك للنموذج العام مهمة تحويل العرض إلى أفعال. ويقدم S1 خطوة لافتة في اتجاه هذه الواجهة.
لكن النموذج لا يثبت بعد وصول الروبوتات العامة إلى مرحلة النضج الكامل. فأقوى النتائج العلنية صادرة عن الشركة، ومجموعة المهام لا تزال محدودة، ولا تتوفر في الأدلة المقدمة مؤشرات صناعية مستقلة يمكن التحقق منها. والاستنتاج الأكثر اتزاناً هو أن S1 يعرض طريقة واعدة لتقليل التدريب المخصص للروبوتات: استخدام الفيديو بوصفه تعليمة، والاستفادة من التدريب المسبق الواسع لتوفير مهارات قابلة لإعادة الاستخدام، ثم اختبار قدرة النموذج على تركيبها في مهمة جديدة طويلة ومتعددة الخطوات.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
تقول Skild AI إن نموذج S1 يستطيع تنفيذ مهام متعددة الخطوات لم يسبق له رؤيتها، وتستمر حتى 10 دقائق، بعد مشاهدة فيديو بشري واحد ومن دون ضبط دقيق أو تدريب لاحق؛ وسجّل معدل نجاح متوسطاً بلغ 66% لكل خطوة في اختبار داخلي لل...
تقول Skild AI إن نموذج S1 يستطيع تنفيذ مهام متعددة الخطوات لم يسبق له رؤيتها، وتستمر حتى 10 دقائق، بعد مشاهدة فيديو بشري واحد ومن دون ضبط دقيق أو تدريب لاحق؛ وسجّل معدل نجاح متوسطاً بلغ 66% لكل خطوة في اختبار داخلي لل... يتعامل S1 مع الفيديو بوصفه تعليمة وقت التنفيذ، فيركّب مهارات اكتسبها خلال التدريب المسبق وينقلها إلى بيئة الروبوت الحالية.
تعتمد استراتيجية Skild Brain الأوسع على التدريب عبر أجسام روبوتية ومحاكاة متنوعة، لكن الأدلة العامة المتاحة لا تثبت بعد معدلات إنجاز أو جاهزية تشغيلية أو عائداً على الاستثمار على مستوى الإنتاج.
تقول Skild AI إن نموذج S1 يستطيع تنفيذ مهام متعددة الخطوات لم يسبق له رؤيتها، وتستمر حتى 10 دقائق، بعد مشاهدة فيديو بشري واحد ومن دون ضبط دقيق أو تدريب لاحق؛ وسجّل معدل نجاح متوسطاً بلغ 66% لكل خطوة في اختبار داخلي لل... يتعامل S1 مع الفيديو بوصفه تعليمة وقت التنفيذ، فيركّب مهارات اكتسبها خلال التدريب المسبق وينقلها...
نشر بواسطةتم التحرير باستخدام GPT-5.6 Lunaتم إنشاء الصور باستخدام GPT Image 1.5
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
يحاول نموذج S1 من شركة Skild AI جعل برمجة الروبوتات أقرب إلى التعليم بالمشاهدة: يؤدي شخص المهمة أمام الكاميرا، ثم يستخدم النموذج هذا العرض بوصفه تعليمة بصرية، بدلاً من بدء عملية تدريب جديدة مخصصة للمهمة. وتقول Skild إن S1 يستطيع تنفيذ مهام متعددة الخطوات لم يسبق له رؤيتها، وقد تمتد إلى 10 دقائق، من دون ضبط دقيق أو دورة تدريب لاحقة بعد مشاهدة الفيديو. 1
تكمن أهمية هذا النهج في أن أنظمة الروبوتات كانت تحتاج تقليدياً إلى كميات كبيرة من البيانات الخاصة بكل مهمة، أو إلى التحكم عن بُعد والهندسة وإعادة التدريب قبل الانتقال إلى عمل جديد. ولا يفترض S1 أنه يحفظ الفيديو لقطة بلقطة؛ بل يحاول فهم الهدف وتركيب مهارات تعلمها سابقاً في سلسلة جديدة من الأفعال.
يعتمد S1 على ما يسمى التعلم البصري داخل السياق. فالعرض الذي يقدمه الإنسان يعمل كـ«موجّه للمهمة» وقت التنفيذ. يراقب النموذج ما يحدث، ويستنتج الهدف وتسلسل الخطوات، ثم يحوّل هذه المعلومات إلى أوامر للروبوت داخل البيئة الموجودة أمامه. ووفق وصف Skild، لا تتغير أوزان النموذج مع كل عرض جديد. 1
وهذا أقرب إلى أن تري نظاماً ذكياً ما تريد منه فعله، لا إلى تدريبه بالطريقة التقليدية. فعلى النموذج أن يربط المشاهدات البصرية بمهارات سبق أن تعلمها، مثل الإمساك بالأشياء وتحريكها ووضعها والتعامل معها، ثم يرتب تلك المهارات في إجراء أطول. وتشمل الأمثلة العلنية التي عرضتها Skild إعداد القهوة بطريقة التقطير، وزراعة النباتات في الأصص، وتجميع أطقم، وقلب الفطائر. 1
35
التحدي الأكبر هنا هو طول أفق المهمة. فقد يكون من السهل نسبياً تعلم حركة قصيرة أو برمجتها منفردة، لكن مهمة تستغرق 10 دقائق قد تضم عشرات القرارات، وتغيّر مواقع الأشياء، وفرصاً متعددة للخطأ. ويُفترض أن يحافظ S1 على الهدف طوال هذا التسلسل، وأن يكيّف أفعاله مع المشهد بدلاً من إعادة حركات الشخص الذي ظهر في الفيديو حرفياً.
تقول Skild إن هناك فرقاً كبيراً بين التوجيه بالفيديو والتوجيه باللغة في اختبار للمهام الجديدة. فعند مقياس تدريب معلن يبلغ 100 ألف ساعة، حققت السياسة الموجّهة بالفيديو معدل نجاح متوسطاً قدره 66% لكل خطوة، مقارنة بـ9% لسياسة مماثلة من نماذج الرؤية-اللغة-الفعل التي تعتمد على التوجيه النصي. 32
وتشير النتيجة إلى أن العرض البصري قد ينقل تفاصيل فيزيائية يصعب على الكلمات وحدها تحديدها: أي جسم ينبغي الإمساك به، وكيفية توجيهه، وترتيب الأفعال، وكيف يستجيب الشخص للتغيرات في البيئة. لكن ينبغي قراءة الرقم بحذر؛ فهو ناتج عن تقييم أعلنته Skild، وليس معياراً صناعياً أعادت جهات مستقلة اختباره. كما أن معدل النجاح لكل خطوة لا يعني أن الروبوت يضمن إكمال مهمة كاملة مدتها 10 دقائق بنسبة 66% من البداية إلى النهاية.
تشمل العروض العامة مهام تلاعب بالأشياء مثل:
وتكتسب هذه الأمثلة أهمية لأنها تجمع بين الإدراك والتعامل مع الأشياء وترتيب الخطوات والتحكم المستمر، بدلاً من اختبار حركة واحدة معزولة. وتصف Skild هذه المهام بأنها لم تظهر في التدريب المسبق، مع أن الأدلة المتاحة تأتي أساساً من الشركة ومن تقارير تلخص ادعاءاتها. 1
33
وتوضح العروض الواجهة التي تستهدفها الشركة: ينفذ الإنسان المهمة مرة، ثم يحاول الروبوت تعميم الإجراء. لكنها لا تثبت أن S1 يستطيع أداء أي عمل منزلي عشوائي بموثوقية، أو العمل من دون إشراف، أو التعامل مع كل الاختلافات الفيزيائية الموجودة في بيئة إنتاج حقيقية.
الميزة التي تروّج لها Skild هي أن الروبوت يستطيع البدء بعد مشاهدة العرض، من دون مرحلة تدريب منفصلة لاحقة. وتصف الشركة والتغطيات المرتبطة بالإطلاق هذا التنفيذ بأنه يحدث في الوقت الحقيقي ضمن سياق المهمة. 1
30
لكن المصادر المتاحة لا تقدم قياساً دقيقاً وموثوقاً لزمن الاستجابة، مثل عدد الثواني بين نهاية الفيديو وبدء أول حركة. فعبارة «من دون ضبط دقيق» تعني أن النموذج لا يمر بدورة جديدة لتحديث أوزانه من أجل المهمة، ولا تعني بالضرورة أن كل فيديو يُعالج فوراً أو أن الروبوت لا يحتاج إلى إعداد أو معايرة أو فحوص سلامة.
يمثل S1 جزءاً من استراتيجية Skild Brain الأوسع، التي تهدف إلى تدريب نموذج عام على مهام وأجسام روبوتية ومحاكاة وبيانات بصرية بشرية متنوعة، بدلاً من بناء سياسة منفصلة لكل روبوت ولكل وظيفة. وتقول Skild إنها أنشأت عالماً محاكياً يضم 100 ألف نموذج مختلف من الروبوتات، واختبرت قدرة النموذج على التعميم إلى أجسام استُبعدت من بيانات التدريب. 6
ويُفترض أن يؤدي التدريب عبر أجسام متعددة إلى تعريف النموذج بمبادئ عامة للتحكم. وتصف مواد Skild نظاماً يستهدف العمل عبر روبوتات شبيهة بالبشر، وروبوتات رباعية الأرجل، وأذرع مكتبية، وروبوتات متنقلة مزودة بأذرع. 3
10
أما الادعاء المتكرر بأن Skild تمتلك بيانات أكثر من منافسيها بما بين 100 و1000 مرة، فينبغي التعامل معه بحذر. فالمصادر المقدمة لا توفر مقارنة موحدة وقابلة للتدقيق بشكل مستقل لحجم البيانات أو جودتها أو مقدار الخبرة الروبوتية المفيدة لدى الشركات المختلفة. والنقطة الأكثر قابلية للدفاع هي أن Skild تراهن على التوسع عبر التدريب والمحاكاة على أجسام متعددة، لا على عروض مخصصة لروبوت واحد ومنصة عتاد واحدة.
«متعدد الأجسام» هو المصطلح الذي تستخدمه Skild لوصف نموذج يفترض أن ينتقل بين هياكل روبوتية مختلفة. ومن حيث المبدأ، يمكن لنموذج مشترك أن يتعلم مفاهيم المهمة على مستوى عالٍ بصورة منفصلة عن هندسة آلة بعينها، ثم يتكيف مع أطراف وعجلات ومقابض وترتيبات مختلفة للمحركات. وتقول Skild إن اختبارات المحاكاة شملت أشكالاً روبوتية لم تدخل بيانات التدريب، وتم التحكم فيها من دون أمثلة سابقة مباشرة. 6
لكن ذلك لا يجعل العتاد أمراً ثانوياً. فالروبوتات تختلف في المستشعرات، والمقابض، وحدود المفاصل، وواجهات التحكم، وزمن الاستجابة، وقدرات الحمولة، واشتراطات السلامة. وقد يقلل النموذج القابل للتعميم بين الأجسام من وقت التكييف، لكن تشغيله يظل يتطلب عتاداً متوافقاً وتكاملاً مع النظام واختبارات داخل البيئة المستهدفة.
تقول تقارير عامة إن برمجيات Skild تعمل على مئات الروبوتات في المصانع ومراكز البيانات وبيئات الخدمات اللوجستية. وتشمل الأمثلة المعلنة مصنع NVIDIA في هيوستن، وتجربة في مطار لاغوارديا، وأعمالاً مع شركات في مجالي تمديدات الأسلاك والإنشاءات. كما أعلنت الشركة علاقات مع ABB Robotics وUniversal Robots وNVIDIA. 17
4
وتشير هذه التقارير إلى اهتمام تجاري واختبارات في العالم الحقيقي، لكنها لا توفر أدلة عامة كافية لحساب معدلات إنجاز الإنتاج أو الجهوزية التشغيلية أو خفض التكلفة أو العائد على الاستثمار بصورة مستقلة. ولا ينبغي تحويل نتيجة مختبرية أو تقييم مضبوط إلى مؤشر إنتاجي. كما تحدث أحد التقارير عن نشر مخطط مع شركة Foxconn على خطوط تجميع مرتبطة بأنظمة خوادم شرائح NVIDIA Blackwell، وهو دليل على جهد اختبار أو نشر، وليس برهاناً على تشغيل واسع لمصانع ذاتية بالكامل. 43
ساعد التمويل الذي حصلت عليه Skild في جعل نهجها من أكثر مشاريع الذكاء الاصطناعي المادي متابعة. فقد ذكرت Bloomberg أن الشركة جمعت نحو 1.4 مليار دولار في جولة Series C قادتها SoftBank في يناير 2026، وبقيمة سوقية تجاوزت 14 مليار دولار. 13 وكانت الشركة قد أعلنت في يوليو 2024 عن جولة Series A بقيمة 300 مليون دولار، عند تقييم معلن بلغ 1.5 مليار دولار.
9
وتلخص عبارة «لحظة ChatGPT» التغيير المأمول في تجربة المستخدم: بدلاً من برمجة الروبوت أو إعادة تدريبه لكل مهمة، يمكن للعامل أن يريه السلوك المطلوب، ثم يترك للنموذج العام مهمة تحويل العرض إلى أفعال. ويقدم S1 خطوة لافتة في اتجاه هذه الواجهة.
لكن النموذج لا يثبت بعد وصول الروبوتات العامة إلى مرحلة النضج الكامل. فأقوى النتائج العلنية صادرة عن الشركة، ومجموعة المهام لا تزال محدودة، ولا تتوفر في الأدلة المقدمة مؤشرات صناعية مستقلة يمكن التحقق منها. والاستنتاج الأكثر اتزاناً هو أن S1 يعرض طريقة واعدة لتقليل التدريب المخصص للروبوتات: استخدام الفيديو بوصفه تعليمة، والاستفادة من التدريب المسبق الواسع لتوفير مهارات قابلة لإعادة الاستخدام، ثم اختبار قدرة النموذج على تركيبها في مهمة جديدة طويلة ومتعددة الخطوات.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
تقول Skild AI إن نموذج S1 يستطيع تنفيذ مهام متعددة الخطوات لم يسبق له رؤيتها، وتستمر حتى 10 دقائق، بعد مشاهدة فيديو بشري واحد ومن دون ضبط دقيق أو تدريب لاحق؛ وسجّل معدل نجاح متوسطاً بلغ 66% لكل خطوة في اختبار داخلي لل...
تقول Skild AI إن نموذج S1 يستطيع تنفيذ مهام متعددة الخطوات لم يسبق له رؤيتها، وتستمر حتى 10 دقائق، بعد مشاهدة فيديو بشري واحد ومن دون ضبط دقيق أو تدريب لاحق؛ وسجّل معدل نجاح متوسطاً بلغ 66% لكل خطوة في اختبار داخلي لل... يتعامل S1 مع الفيديو بوصفه تعليمة وقت التنفيذ، فيركّب مهارات اكتسبها خلال التدريب المسبق وينقلها إلى بيئة الروبوت الحالية.
تعتمد استراتيجية Skild Brain الأوسع على التدريب عبر أجسام روبوتية ومحاكاة متنوعة، لكن الأدلة العامة المتاحة لا تثبت بعد معدلات إنجاز أو جاهزية تشغيلية أو عائداً على الاستثمار على مستوى الإنتاج.