Skild AI ระบุว่า S1 สามารถดูวิดีโอของงานที่ไม่เคยเห็นมาก่อน ซึ่งใช้เวลาสูงสุด 10 นาที แล้วลงมือทำโดยไม่เปลี่ยนน้ำหนักโมเดลหรือเก็บข้อมูลเฉพาะงานเพิ่ม การสาธิตของ S1 ครอบคลุมการชงกาแฟแบบพัวร์โอเวอร์ การย้ายต้นไม้ลงกระถาง การประกอบชุดอุปกรณ์ และการกลับแพนเค้ก โดยมีรายงานว่าปรับตัวเมื่อวัตถุเปลี่ยนและลองแก้ไขหลังเกิดข้...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, unveiled by co-founder Abhinav Gupta at SMARTCLOUD SHOW 2026 in Seoul on August 25, 2026, a. Article summary: S1 is Skild AI’s flagship robotics foundation model for in-context learning: a robot watches one video demonstration—including an unseen task lasting up to 10 minutes—and then executes it without collecting task-specific. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Skild AI วางตำแหน่ง S1 เป็นโมเดลพื้นฐานสำหรับหุ่นยนต์ที่ใช้แนวคิด in-context learning หรือการเรียนรู้จากบริบท กล่าวง่าย ๆ คือ แทนที่จะต้องฝึกโมเดลใหม่ทุกครั้งที่มีงานใหม่ หุ่นยนต์จะดูวิดีโอสาธิตแล้วใช้วิดีโอนั้นเป็นคำสั่งสำหรับการทำงาน
บริษัทระบุว่า S1 สามารถทำงานที่ไม่เคยพบระหว่างการฝึกมาก่อนและมีขั้นตอนต่อเนื่องยาวนานถึง 10 นาทีได้ โดยไม่ต้องปรับน้ำหนักโมเดลหรือทำ fine-tuning เฉพาะงาน 1
5
นี่อาจเป็นก้าวสำคัญของ AI ที่ทำงานกับโลกจริง แต่ยังไม่ใช่หลักฐานว่าหุ่นยนต์อเนกประสงค์พร้อมทำงานในบ้านหรือโรงงานได้โดยไม่มีข้อจำกัด ผลลัพธ์ที่เผยแพร่ในเวลานี้ส่วนใหญ่เป็นการสาธิตและการทดสอบที่ Skild AI จัดทำเอง จึงยังต้องรอการตรวจสอบจากหน่วยงานอิสระ
ระบบเรียนรู้หุ่นยนต์จำนวนมากถูกฝึกให้ทำงานเฉพาะอย่าง บนหุ่นยนต์รุ่นใดรุ่นหนึ่ง หรือภายใต้สภาพแวดล้อมที่กำหนดไว้ล่วงหน้า แต่ S1 มองวิดีโอสาธิตเป็นเสมือนโปรแกรมที่นำไปใช้ปฏิบัติได้ โมเดลต้องอนุมานเป้าหมาย ลำดับการเคลื่อนไหว ความสัมพันธ์ระหว่างวัตถุ และการปรับแรงหรือท่าทางที่จำเป็นต่อการทำงานให้สำเร็จ 1
3
การบอกหุ่นยนต์ด้วยภาษาว่า “ชงกาแฟ” หรือ “ย้ายต้นไม้” อาจระบุเป้าหมายได้ แต่ไม่ได้บอกอย่างละเอียดว่าต้องทำอะไรก่อนหลัง จับวัตถุอย่างไร ใช้เครื่องมือแบบไหน หรือรับมือกับงานที่มีหลายขั้นตอนอย่างไร วิดีโอจึงให้ข้อมูลทั้งลำดับเวลา การจัดวางวัตถุ จังหวะ และวิธีลงมือทำมากกว่า Skild AI เชื่อว่าบริบทที่ละเอียดขึ้นนี้ช่วยให้ S1 นำไปใช้กับงานระยะยาวที่ไม่เคยอยู่ในข้อมูลฝึกได้ 1
5
บริษัทอธิบายแนวทางนี้ว่าเป็นสิ่งที่คล้ายกับการพรอมป์โมเดลภาษา ความสามารถพื้นฐานของโมเดลยังคงเดิม ขณะที่วิดีโอสาธิตทำหน้าที่เติมบริบทเฉพาะของงานลงไป
Skild AI เผยการสาธิตการทำงานหลายประเภท เช่น
บางการสาธิตใช้เวลาสูงสุด 10 นาทีและมีขั้นตอนต่อเนื่องหลายสิบขั้นตอน 1
3
5
บริษัทยังรายงานการทดสอบเชิงคุณภาพเพื่อแสดงว่า S1 ไม่ได้เพียงเปิดดูท่าทางที่จำไว้แล้วทำซ้ำแบบตรงตัว ในการทดสอบดังกล่าว มีรายงานว่าโมเดลรับมือกับการเปลี่ยนแปลงของฉาก ลองทำใหม่หลังเกิดข้อผิดพลาดบางอย่าง ใช้ถ้วยแทนบัวรดน้ำเมื่อไม่มีวัตถุเดิม และแก้ไขวิธีจับไข่ที่ไม่ถนัดของผู้สาธิต แทนที่จะเลียนแบบทุกท่วงท่าอย่างเคร่งครัด 5
สัญญาณเหล่านี้บ่งชี้ถึงความยืดหยุ่นด้านพฤติกรรม แต่การดูวิดีโอสาธิตเพียงอย่างเดียวยังไม่เพียงพอที่จะยืนยันความน่าเชื่อถือในสภาพแวดล้อมที่หลากหลาย
การเปรียบเทียบที่มีตัวเลขชัดเจนที่สุดมาจากการประเมินภายในของ Skild AI กับงานที่โมเดลไม่เคยเห็น บริษัทระบุว่า เมื่อใช้ข้อมูลฝึก 100,000 ชั่วโมง นโยบายที่รับวิดีโอเป็นบริบททำอัตราความสำเร็จเฉลี่ยต่อขั้นตอนได้ 66% เทียบกับ 9% ของระบบพื้นฐานแบบ vision-language-action หรือ VLA ที่รับคำสั่งด้วยภาษา 1
4
Skild AI ยังระบุว่า เมื่อสภาพแวดล้อมตอนนำไปใช้งานเปลี่ยนไปมาก เช่น วัตถุไม่เหมือนในวิดีโอสาธิต หรือแผนการทำงานต้องใช้แขนอีกข้าง ระบบ VLA ที่รับคำสั่งด้วยภาษามีประสิทธิภาพลดลงมากกว่า S1 สูงสุดประมาณสามเท่า 1
อีกการเปรียบเทียบหนึ่งของบริษัทประเมินว่า วิดีโอพรอมป์เพียงหนึ่งคลิปให้ผลใกล้เคียงกับการฝึกหลังการฝึกเฉพาะงานประมาณ 380 ตอน บนนโยบายที่ผ่านการฝึกไว้แล้ว 1
ตัวเลขเหล่านี้อธิบายได้ว่าทำไมการพรอมป์ด้วยวิดีโอจึงน่าสนใจ เพราะวิดีโอไม่ได้สื่อแค่ผลลัพธ์ที่ต้องการ แต่ยังบอกลำดับ ขั้นตอน เวลา การจัดวางวัตถุ การใช้เครื่องมือ และกลยุทธ์ทางกายภาพด้วย อย่างไรก็ตาม ควรอ่านตัวเลขดังกล่าวในฐานะ หลักฐานจากการทดสอบภายในของ Skild AI ไม่ใช่ผลการเปรียบเทียบที่ตรวจสอบซ้ำโดยอิสระ เนื้อหาที่มีอยู่ยังไม่รวมงานวิจัยสาธารณะ น้ำหนักโมเดล หรือการประเมินภายนอกที่ใช้มาตรฐานเดียวกัน 4
15
Skild AI อธิบายว่า S1 ทำงานแบบเรียลไทม์หลังดูวิดีโอสาธิต และรายงานช่วงเปิดตัวระบุว่าหุ่นยนต์สามารถเริ่มทำงานได้ทันทีหลังชมวิดีโอ 2
5
แต่ยังไม่มีหลักฐานเพียงพอที่จะยืนยันตัวเลขทั่วไป เช่น “ภายในไม่กี่วินาที” หรือ “ภายใน 11 นาที” สำหรับระบบทั้งหมด แหล่งข้อมูลที่มีไม่ได้ระบุเวลาที่ตรวจสอบได้ตั้งแต่จบวิดีโอจนเริ่มปฏิบัติงาน ความแตกต่างนี้มีความสำคัญในโรงงาน เพราะเวลาเตรียมระบบ ความหน่วงในการประมวลผล การตรวจสอบความปลอดภัย และความสามารถในการกู้คืนจากความผิดพลาด อาจสำคัญไม่แพ้อัตราความสำเร็จของงาน
Skild AI ให้เครดิตกับกระบวนการรวบรวมข้อมูลหลายรูปแบบที่ช่วยพัฒนาโมเดลหุ่นยนต์อเนกประสงค์ บริษัทอธิบายว่าใช้ทั้งการจำลองขนาดใหญ่ วิดีโอการกระทำของมนุษย์บนอินเทอร์เน็ต ข้อมูลจากหุ่นยนต์ การควบคุมระยะไกล และข้อมูลจากการใช้งานจริง นอกจากนี้ เอกสารเกี่ยวกับ Series C ยังอธิบายวงจรข้อมูลที่การนำโมเดลไปใช้งานสร้างประสบการณ์ใหม่ ซึ่งสามารถนำกลับไปปรับปรุงโมเดลสำหรับหุ่นยนต์และสภาพแวดล้อมอื่น ๆ ได้ 37
ที่งาน SMARTCLOUD SHOW อบินาฟ กุปตา ผู้ร่วมก่อตั้งของบริษัท มีรายงานว่า Skild AI ใช้วิธีเก็บข้อมูลหุ่นยนต์ “ทุกชนิด” และมีข้อมูลมากกว่าคู่แข่ง 100–1,000 เท่า ตัวคูณนี้เป็นคำกล่าวอ้างของบริษัท ไม่ใช่การเปรียบเทียบอุตสาหกรรมที่ผ่านการตรวจสอบสาธารณะ 6
ในทางปฏิบัติ ข้อมูลแต่ละแหล่งมีบทบาทต่างกัน วิดีโอมนุษย์ช่วยสอนเรื่องวัตถุและการกระทำ การจำลองช่วยขยายจำนวนรูปแบบหุ่นยนต์และสภาพแวดล้อม ส่วนข้อมูลจากหุ่นยนต์จริงช่วยเชื่อมความเข้าใจเหล่านั้นเข้ากับการควบคุมทางกายภาพ
S1 เป็นส่วนหนึ่งของแนวคิดที่กว้างกว่าของ Skild AI ซึ่งเรียกว่า “สมองหุ่นยนต์แบบ omni-bodied” คำนี้ไม่ได้หมายความว่า หุ่นยนต์สองขา สี่ขา ล้อ หรือแขนกลจะเคลื่อนไหวเหมือนกันทั้งหมด เพราะข้อต่อ เซนเซอร์ แขนขา ล้อ และการเคลื่อนไหวที่เป็นไปได้ของแต่ละแบบแตกต่างกัน 45
แนวคิดคือให้สถาปัตยกรรมของโมเดลเรียนรู้กฎทางกายภาพที่ใช้ร่วมกันได้จากหลายแพลตฟอร์ม แล้วแปลงความเข้าใจนั้นให้เข้ากับความสามารถของหุ่นยนต์แต่ละตัว หุ่นยนต์แต่ละแบบจึงสามารถใช้ความรู้ร่วมกันได้ ขณะเดียวกันก็ยังส่งคำสั่งให้เหมาะกับแอ็กชูเอเตอร์และเซนเซอร์ที่มีอยู่ 45
แนวทางนี้มีเป้าหมายเพื่อลดความจำเป็นในการสร้างและดูแลโมเดลแยกสำหรับหุ่นยนต์ทุกการกำหนดค่า Skild AI ยังระบุว่าได้ฝึกโมเดลกับหุ่นยนต์จำลองจำนวนมาก เพื่อให้เรียนรู้พฤติกรรมทางกายภาพที่ทั่วไปขึ้น 42
45
Skild AI ประกาศความร่วมมือกับ ABB Robotics และ Universal Robots เพื่อนำซอฟต์แวร์ไปผสานกับระบบอุตสาหกรรม ขณะที่ Reuters รายงานว่า Skild AI และ Nvidia กำลังนำ “สมองหุ่นยนต์” ไปใช้งานบนสายประกอบที่เกี่ยวข้องกับระบบ Nvidia Blackwell 34
44
ประกาศเหล่านี้แสดงให้เห็นเส้นทางสู่การทดสอบเชิงพาณิชย์ แต่ยังไม่ได้ให้ภาพรวมผลการดำเนินงานที่เปิดเผยต่อสาธารณะ หลักฐานที่มีอยู่ยังไม่ยืนยันตัวเลขที่ผ่านการตรวจสอบอย่างเป็นอิสระในด้านปริมาณการผลิต เวลาทำงานต่อเนื่อง อัตราความผิดพลาด เหตุการณ์ด้านความปลอดภัย หรือผลตอบแทนจากการลงทุน การนำไปติดตั้งจึงเป็นหลักฐานว่ากำลังทดสอบหรือผสานระบบ ไม่ใช่ข้อพิสูจน์ว่าเทคโนโลยีเข้ามาแทนระบบอัตโนมัติแบบเดิมในวงกว้างแล้ว
ความสนใจจากนักลงทุนต่อ Skild AI อยู่ในระดับสูง Bloomberg รายงานว่า บริษัทระดมทุน Series C ได้ 1.4 พันล้านดอลลาร์สหรัฐ นำโดย SoftBank และมีมูลค่ามากกว่า 14 พันล้านดอลลาร์สหรัฐ ซึ่งเพิ่มขึ้นมากกว่าสามเท่าในเวลาประมาณเจ็ดเดือน 17
รายงานอื่น ๆ ประเมินเงินทุนสะสมของบริษัทไว้มากกว่า 1.8 พันล้านดอลลาร์สหรัฐ แต่ตัวเลขแตกต่างกันตามแหล่งข้อมูล จึงไม่ควรถือเป็นยอดรวมที่ผ่านการตรวจสอบอย่างเป็นทางการ 18
21
22
การเปรียบเทียบว่า S1 คือ “ช่วงเวลา ChatGPT ของหุ่นยนต์” จึงควรมองเป็นอุปมา ไม่ใช่ข้อสรุปที่ยืนยันแล้ว S1 ชี้ไปยังความเป็นไปได้ว่า หุ่นยนต์อาจเปลี่ยนจากการฝึกใหม่ทีละงาน มาเป็นการเรียนรู้จากการสาธิต นักลงทุน Ravi Mhatre เรียกการเปิดตัวนี้ว่าเป็น “ช่วงเวลา GPT-3” สำหรับงานที่ใช้เวลานานและเกี่ยวข้องกับแรงงานมนุษย์ แต่เป็นมุมมองของนักลงทุน ไม่ใช่การรับรองทางวิทยาศาสตร์จากหน่วยงานอิสระ 10
แนวคิดที่สำคัญที่สุดของ S1 ไม่ใช่เพียงการทำให้หุ่นยนต์เลียนแบบวิดีโอได้ แต่คือการให้โมเดลพื้นฐานใช้การสาธิตเพียงหนึ่งครั้งเพื่อประกอบทักษะ ปรับตัวเมื่อฉากเปลี่ยน และทำงานต่อเนื่องหลายขั้นตอนได้ โดยไม่ต้องอัปเดตน้ำหนักโมเดลสำหรับงานนั้นโดยเฉพาะ
ผลทดสอบที่ Skild AI รายงานว่า 66% เทียบกับ 9% รวมถึงการสาธิตงานระยะยาว ทำให้ข้ออ้างของ S1 มีความสำคัญในเชิงเทคนิค 1
4 แต่ข้อควรระวังก็สำคัญไม่แพ้กัน หลักฐานสาธารณะในปัจจุบันยังมาจากเอกสารของบริษัท การสาธิตที่คัดเลือกมา และประกาศการนำไปใช้งานระยะแรกเป็นหลัก
จนกว่านักวิจัยภายนอกจะทำซ้ำผลลัพธ์ภายใต้เงื่อนไขมาตรฐาน และลูกค้าอุตสาหกรรมจะเปิดเผยข้อมูลด้านความน่าเชื่อถือกับความปลอดภัย S1 ควรถูกมองว่าเป็นทิศทางที่น่าจับตาของ physical AI มากกว่าจะเป็นหลักฐานเด็ดขาดว่า “สมองหุ่นยนต์อเนกประสงค์” ได้มาถึงแล้ว
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Skild AI ระบุว่า S1 สามารถดูวิดีโอของงานที่ไม่เคยเห็นมาก่อน ซึ่งใช้เวลาสูงสุด 10 นาที แล้วลงมือทำโดยไม่เปลี่ยนน้ำหนักโมเดลหรือเก็บข้อมูลเฉพาะงานเพิ่ม
Skild AI ระบุว่า S1 สามารถดูวิดีโอของงานที่ไม่เคยเห็นมาก่อน ซึ่งใช้เวลาสูงสุด 10 นาที แล้วลงมือทำโดยไม่เปลี่ยนน้ำหนักโมเดลหรือเก็บข้อมูลเฉพาะงานเพิ่ม การสาธิตของ S1 ครอบคลุมการชงกาแฟแบบพัวร์โอเวอร์ การย้ายต้นไม้ลงกระถาง การประกอบชุดอุปกรณ์ และการกลับแพนเค้ก โดยมีรายงานว่าปรับตัวเมื่อวัตถุเปลี่ยนและลองแก้ไขหลังเกิดข้อผิดพลาดบางครั้ง
เทคโนโลยีนี้กำลังถูกวางตำแหน่งสำหรับหุ่นยนต์อุตสาหกรรม แต่หลักฐานสาธารณะยังไม่ยืนยันตัวชี้วัดระดับการผลิต เช่น เวลาทำงานต่อเนื่อง ปริมาณงาน อัตราความผิดพลาด หรือผลตอบแทนจากการลงทุน