Skild AI ระบุว่า S1 สามารถทำงานหลายขั้นตอนที่ไม่เคยเห็นมาก่อนและใช้เวลานานถึง 10 นาที หลังดูวิดีโอมนุษย์เพียงหนึ่งคลิป โดยไม่ต้องทำ fine tuning หรือฝึกหลังการสังเกต S1 ใช้วิดีโอเป็นคำสั่งในขั้นตอนประมวลผล แล้วนำทักษะที่เรียนรู้ไว้ก่อนหน้ามาประกอบเป็นลำดับการกระทำที่เหมาะกับสภาพแวดล้อมของหุ่นยนต์ บริษัทอ้างว่า S1 มีอ...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Lunaรูปภาพสร้างด้วย GPT Image 1.5
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
เมื่อการสอนหุ่นยนต์ไม่จำเป็นต้องเริ่มจากการเขียนโปรแกรมใหม่ทุกครั้ง แต่ใช้วิธี “ทำให้ดู” แทน นั่นคือประสบการณ์ที่ Skild AI ต้องการผลักดันด้วย S1 โมเดลพื้นฐานสำหรับหุ่นยนต์ที่รับวิดีโอการสาธิตจากมนุษย์เป็นคำสั่ง แล้วพยายามทำงานตามในสภาพแวดล้อมจริง
Skild ระบุว่า S1 สามารถจัดการงานที่ไม่เคยเห็นระหว่างการฝึกล่วงหน้า เป็นงานหลายขั้นตอนที่ใช้เวลานานได้ถึง 10 นาที โดยไม่ต้องทำ fine-tuning หรือมีรอบฝึกเฉพาะงานหลังดูวิดีโอ 1
จุดสำคัญคือ S1 ไม่ได้เพียงจดจำวิดีโอแบบเฟรมต่อเฟรม แต่พยายามตีความเป้าหมายของงาน จากนั้นนำทักษะที่มีอยู่แล้ว เช่น การหยิบ การเคลื่อนย้าย การวาง และการจัดการวัตถุ มาประกอบเป็นลำดับการกระทำใหม่
S1 ใช้แนวทางที่เรียกว่า visual in-context learning หรือการเรียนรู้จากบริบทด้วยภาพ วิดีโอที่มนุษย์สาธิตทำหน้าที่คล้าย “พรอมต์” ของงานในขณะที่โมเดลกำลังทำงาน ไม่ใช่ชุดข้อมูลใหม่สำหรับนำไปอัปเดตค่าน้ำหนักของโมเดล
หลังสังเกตวิดีโอ โมเดลต้องอนุมานทั้งเป้าหมาย ลำดับขั้นตอน วัตถุที่ต้องโต้ตอบด้วย และวิธีปรับการเคลื่อนไหวให้เข้ากับสถานการณ์ปัจจุบัน ก่อนแปลงข้อมูลเหล่านั้นเป็นคำสั่งสำหรับหุ่นยนต์ Skild อธิบายว่า S1 ไม่จำเป็นต้องเปลี่ยนค่าน้ำหนักของโมเดลสำหรับการสาธิตใหม่แต่ละครั้ง 1
แนวคิดนี้จึงใกล้เคียงกับการ “สอนด้วยตัวอย่าง” มากกว่าการฝึกหุ่นยนต์แบบเดิม ซึ่งมักต้องใช้ข้อมูลเฉพาะงาน การควบคุมหุ่นยนต์จากระยะไกล การเขียนระบบควบคุม หรือการฝึกซ้ำก่อนจะเริ่มงานใหม่ได้
ตัวอย่างงานที่บริษัทเผยแพร่ ได้แก่ การชงกาแฟแบบ pour-over การปลูกต้นไม้ลงกระถาง การประกอบชุดอุปกรณ์ และการพลิกแพนเค้ก 1
35
การควบคุมการเคลื่อนไหวสั้น ๆ เพียงครั้งเดียวอาจเขียนสคริปต์หรือฝึกได้ไม่ยากนัก แต่ภารกิจที่กินเวลานานถึง 10 นาทีอาจประกอบด้วยการตัดสินใจหลายสิบครั้ง ตำแหน่งวัตถุอาจเปลี่ยนไป และความผิดพลาดเล็ก ๆ ในช่วงต้นอาจส่งผลต่อขั้นตอนถัดไป
S1 จึงต้องรักษาเป้าหมายของงานไว้ตลอดลำดับการทำงาน และปรับการกระทำตามสิ่งที่มองเห็น แทนที่จะเลียนแบบท่าทางของผู้สาธิตแบบตายตัว ความสามารถนี้เป็นส่วนที่ทำให้การสาธิตด้วยวิดีโอมีความหมายต่อวงการหุ่นยนต์มากกว่าการสั่งให้ทำการเคลื่อนไหวเดี่ยว ๆ
ในการทดสอบงานที่ไม่เคยเห็นมาก่อน Skild รายงานว่า เมื่อใช้สเกลการฝึกล่วงหน้าที่ระบุไว้ 100,000 ชั่วโมง นโยบายที่รับพรอมต์เป็นวิดีโอทำอัตราความสำเร็จเฉลี่ย 66% ต่อขั้นตอน ขณะที่นโยบาย vision-language-action ซึ่งรับคำสั่งเป็นภาษาทำได้ 9% 32
ผลดังกล่าวชี้ว่า วิดีโออาจสื่อรายละเอียดทางกายภาพที่คำพูดอธิบายได้ไม่ครบ เช่น ต้องหยิบวัตถุชิ้นไหน จับในทิศทางใด ทำขั้นตอนไหนก่อน หรือปรับตัวอย่างไรเมื่อสภาพแวดล้อมไม่เหมือนเดิม
อย่างไรก็ตาม ตัวเลขนี้ควรอ่านอย่างระมัดระวัง เพราะเป็นผลการประเมินที่ Skild รายงานเอง ไม่ใช่ผลการทดสอบมาตรฐานอุตสาหกรรมที่มีการทำซ้ำโดยหน่วยงานอิสระ นอกจากนี้ อัตราความสำเร็จ “ต่อขั้นตอน” 66% ไม่ได้หมายความว่าหุ่นยนต์จะทำงาน 10 นาทีทั้งภารกิจสำเร็จด้วยความน่าจะเป็น 66% ตั้งแต่ต้นจนจบ
ตัวอย่างที่เปิดเผยต่อสาธารณะครอบคลุมงานจัดการวัตถุหลายขั้นตอน เช่น
งานเหล่านี้ต้องใช้ทั้งการมองเห็น การระบุวัตถุ การควบคุมการหยิบจับ การเรียงลำดับการกระทำ และการควบคุมต่อเนื่อง ไม่ใช่เพียงการทดสอบการเคลื่อนไหวเดี่ยว ๆ Skild ระบุว่างานเหล่านี้ไม่อยู่ในข้อมูลฝึกล่วงหน้า แต่หลักฐานที่มีอยู่ส่วนใหญ่ยังมาจากบริษัทและรายงานที่สรุปคำกล่าวของบริษัท 1
33
ดังนั้น วิดีโอสาธิตจึงแสดงให้เห็น “รูปแบบการใช้งานที่ตั้งใจไว้” นั่นคือมนุษย์ทำงานให้ดูหนึ่งครั้ง แล้วหุ่นยนต์พยายามนำขั้นตอนนั้นไปใช้กับงานเดียวกันในบริบทของตนเอง แต่ยังไม่ใช่หลักฐานว่า S1 สามารถทำงานบ้านแบบใดก็ได้ ทำงานโดยไม่ต้องมีผู้ดูแล หรือรับมือกับความแปรผันทางกายภาพทุกรูปแบบในโรงงานได้อย่างน่าเชื่อถือ
ข้อได้เปรียบที่ Skild โฆษณาคือ หุ่นยนต์สามารถเริ่มทำงานหลังสังเกตการสาธิต โดยไม่ต้องผ่านรอบฝึกเฉพาะงานเพิ่มเติม บริษัทและรายงานเกี่ยวกับการเปิดตัวอธิบายการทำงานนี้ว่าเป็นการประมวลผลแบบ in-context และทำงานได้แบบเรียลไทม์ 1
30
แต่แหล่งข้อมูลที่มีอยู่ยังไม่ได้ระบุค่าความหน่วงที่แม่นยำ เช่น ต้องใช้กี่วินาทีตั้งแต่จบวิดีโอจนถึงการเคลื่อนไหวครั้งแรกของหุ่นยนต์
คำว่า “ไม่ต้องทำ fine-tuning” หมายถึงโมเดลไม่ต้องผ่านกระบวนการอัปเดตค่าน้ำหนักสำหรับงานใหม่ ไม่ได้แปลว่าวิดีโอทุกคลิปจะถูกประมวลผลได้ทันทีโดยไม่มีเวลาเตรียมการ และไม่ได้ยืนยันว่าระบบไม่ต้องมีการตั้งค่า การปรับเทียบ หรือการตรวจสอบความปลอดภัยก่อนเริ่มทำงาน
S1 เป็นส่วนหนึ่งของแนวทาง Skild Brain ซึ่งต้องการสร้างโมเดลทั่วไปสำหรับงานและรูปร่างหุ่นยนต์หลายประเภท แทนการสร้างนโยบายแยกสำหรับหุ่นยนต์แต่ละรุ่นและงานแต่ละชนิด
Skild ระบุว่า บริษัทสร้างโลกจำลองที่มีหุ่นยนต์มากถึง 100,000 รูปแบบ และทดสอบการนำโมเดลไปใช้กับรูปร่างที่ถูกกันออกจากชุดฝึก เพื่อดูว่าสามารถควบคุมหุ่นยนต์ที่ไม่เคยเห็นมาก่อนได้หรือไม่ 6
การฝึกกับหุ่นยนต์หลายรูปแบบมีเป้าหมายเพื่อให้โมเดลเรียนรู้หลักการควบคุมทั่วไป ไม่ผูกติดกับโครงสร้างของเครื่องใดเครื่องหนึ่ง บริษัทอธิบายว่า Skild Brain มุ่งรองรับหุ่นยนต์ฮิวแมนนอยด์ หุ่นยนต์สี่ขา แขนกลบนโต๊ะ และหุ่นยนต์เคลื่อนที่ที่มีแขนกล 3
10
มีการกล่าวอ้างว่า Skild มีข้อมูลมากกว่าคู่แข่ง 100–1,000 เท่า แต่ควรพิจารณาอย่างระมัดระวัง เพราะแหล่งข้อมูลที่มีไม่ได้แสดงการเปรียบเทียบขนาด คุณภาพ หรือประสบการณ์จากหุ่นยนต์ของแต่ละบริษัทในมาตรฐานเดียวกันและตรวจสอบได้อย่างอิสระ
ข้อสรุปที่รองรับได้ชัดเจนกว่าคือ Skild กำลังเพิ่มขนาดการฝึกผ่านการจำลองและการฝึกข้ามรูปร่างหุ่นยนต์ แทนที่จะพึ่งพาการเก็บข้อมูลสาธิตแบบเฉพาะเจาะจงสำหรับฮาร์ดแวร์เพียงแพลตฟอร์มเดียว
คำว่า omni-bodied เป็นคำที่ Skild ใช้เรียกโมเดลซึ่งสามารถถ่ายโอนความสามารถข้ามร่างหุ่นยนต์หลายประเภทได้ ในทางหลักการ โมเดลร่วมหนึ่งชุดอาจเรียนรู้แนวคิดระดับงานแยกจากรูปทรงและกลไกเฉพาะของเครื่องจักรแต่ละตัว ทำให้สามารถปรับใช้กับแขนขา ล้อ แขนกล และชุดขับเคลื่อนที่แตกต่างกันได้
Skild ระบุว่าการทดสอบในสภาพแวดล้อมจำลองมีการกันรูปร่างหุ่นยนต์บางแบบออกจากข้อมูลฝึก และโมเดลสามารถควบคุมรูปร่างเหล่านั้นแบบ zero-shot หรือไม่เคยฝึกกับรูปร่างนั้นโดยตรง 6
แต่แนวคิดนี้ไม่ได้ทำให้ฮาร์ดแวร์ไม่สำคัญ หุ่นยนต์แต่ละตัวก็ยังมีเซนเซอร์ มือจับ ขีดจำกัดข้อต่อ อินเทอร์เฟซควบคุม เวลาแฝง น้ำหนักบรรทุก และข้อกำหนดด้านความปลอดภัยต่างกัน โมเดลที่ถ่ายโอนข้ามร่างได้อาจช่วยลดงานปรับระบบ แต่การนำไปใช้จริงยังต้องอาศัยฮาร์ดแวร์ที่เข้ากันได้ การบูรณาการระบบ และการตรวจสอบในพื้นที่เป้าหมาย
รายงานข่าวระบุว่าซอฟต์แวร์ของ Skild ทำงานอยู่บนหุ่นยนต์หลายร้อยตัวในโรงงาน ศูนย์ข้อมูล และพื้นที่โลจิสติกส์ ตัวอย่างที่ถูกกล่าวถึง ได้แก่ โรงงานของ NVIDIA ในเมืองฮิวสตัน การทดลองที่สนามบิน LaGuardia และการทำงานร่วมกับบริษัทด้านสายไฟและการก่อสร้าง นอกจากนี้ Skild ยังประกาศความร่วมมือกับ ABB Robotics, Universal Robots และ NVIDIA 17
4
ข้อมูลเหล่านี้สะท้อนความสนใจเชิงพาณิชย์และการทดสอบในโลกจริง แต่ยังไม่เพียงพอที่จะคำนวณอัตราการผลิตสำเร็จ เวลาที่ระบบทำงานได้ต่อเนื่อง ต้นทุนที่ลดลง หรือผลตอบแทนการลงทุนอย่างอิสระ
ผลจากห้องทดลองหรือการทดสอบแบบควบคุมจึงไม่ควรถูกนำไปตีความเป็นตัวเลขประสิทธิภาพของสายการผลิตโดยตรง อีกหนึ่งรายงานระบุถึงแผนการใช้งานร่วมกับ Foxconn บนสายประกอบระบบเซิร์ฟเวอร์ NVIDIA Blackwell GPU ในฮิวสตัน แต่ข้อมูลดังกล่าวเป็นหลักฐานของความพยายามทดสอบหรือการนำไปใช้งาน ไม่ใช่ข้อพิสูจน์ว่าหุ่นยนต์อัตโนมัติทำงานในโรงงานได้อย่างครอบคลุมแล้ว 43
เงินทุนจำนวนมากทำให้ Skild เป็นหนึ่งในบริษัท Physical AI หรือปัญญาประดิษฐ์ที่ทำงานในโลกกายภาพ ซึ่งถูกจับตามองมากที่สุด Bloomberg รายงานว่า Skild ระดมทุนได้ประมาณ 1.4 พันล้านดอลลาร์สหรัฐ ในรอบ Series C ที่นำโดย SoftBank เมื่อเดือนมกราคม 2026 ส่งผลให้บริษัทมีมูลค่ามากกว่า 14 พันล้านดอลลาร์สหรัฐ 13
ก่อนหน้านั้น Skild ประกาศระดมทุน Series A จำนวน 300 ล้านดอลลาร์สหรัฐ ในเดือนกรกฎาคม 2024 ที่มูลค่าบริษัท 1.5 พันล้านดอลลาร์สหรัฐ 9
การเปรียบเทียบกับ “ChatGPT moment” สำหรับหุ่นยนต์สะท้อนประสบการณ์ที่บริษัทต้องการให้เกิดขึ้น นั่นคือ แทนที่คนทำงานจะต้องเขียนโปรแกรม ฝึกข้อมูล หรือปรับระบบใหม่ทุกครั้ง เพียงสาธิตพฤติกรรมที่ต้องการให้หุ่นยนต์ดู แล้วโมเดลทั่วไปจะเป็นผู้แปลงการสาธิตนั้นให้กลายเป็นการกระทำ
S1 จึงเป็นก้าวที่น่าสนใจไปสู่หน้าตาของการสั่งงานแบบนั้น แต่ยังไม่ใช่หลักฐานว่าหุ่นยนต์ทั่วไปพร้อมใช้งานในทุกบ้านหรือโรงงานแล้ว ผลลัพธ์สาธารณะที่แข็งแรงที่สุดยังเป็นข้อมูลที่บริษัทเปิดเผยเอง ชุดงานที่สาธิตยังมีขอบเขตจำกัด และยังไม่มีตัวชี้วัดการใช้งานภาคอุตสาหกรรมที่ตรวจสอบโดยอิสระเพียงพอ
ข้อสรุปที่รอบคอบที่สุดคือ S1 แสดงให้เห็นแนวทางที่มีศักยภาพในการลดการฝึกหุ่นยนต์แบบเฉพาะงาน โดยใช้วิดีโอเป็นคำสั่ง อาศัยทักษะที่เรียนรู้จากการฝึกล่วงหน้า และทดสอบว่าโมเดลสามารถประกอบทักษะเหล่านั้นเข้ากับงานใหม่ที่มีหลายขั้นตอนได้ดีเพียงใด
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Skild AI ระบุว่า S1 สามารถทำงานหลายขั้นตอนที่ไม่เคยเห็นมาก่อนและใช้เวลานานถึง 10 นาที หลังดูวิดีโอมนุษย์เพียงหนึ่งคลิป โดยไม่ต้องทำ fine tuning หรือฝึกหลังการสังเกต
Skild AI ระบุว่า S1 สามารถทำงานหลายขั้นตอนที่ไม่เคยเห็นมาก่อนและใช้เวลานานถึง 10 นาที หลังดูวิดีโอมนุษย์เพียงหนึ่งคลิป โดยไม่ต้องทำ fine tuning หรือฝึกหลังการสังเกต S1 ใช้วิดีโอเป็นคำสั่งในขั้นตอนประมวลผล แล้วนำทักษะที่เรียนรู้ไว้ก่อนหน้ามาประกอบเป็นลำดับการกระทำที่เหมาะกับสภาพแวดล้อมของหุ่นยนต์
บริษัทอ้างว่า S1 มีอัตราความสำเร็จเฉลี่ยรายขั้นตอน 66% ในการทดสอบงานที่ไม่เคยเห็น เทียบกับ 9% สำหรับโมเดลที่รับคำสั่งด้วยภาษา แต่ตัวเลขนี้ยังเป็นผลทดสอบที่บริษัทเปิดเผยเอง
Skild AI ระบุว่า S1 สามารถทำงานหลายขั้นตอนที่ไม่เคยเห็นมาก่อนและใช้เวลานานถึง 10 นาที หลังดูวิดีโอมนุษย์เพียงหนึ่งคลิป โดยไม่ต้องทำ fine tuning หรือฝึกหลังการสังเกต S1 ใช้วิดีโอเป็นคำสั่งในขั้นตอนประมวลผล แล้วนำทักษะที่เรียนรู้ไว้ก่อนหน้ามาประกอบเป็นลำดับการกระทำที่เหมาะกับสภาพแวดล้อมของหุ่นยนต์ บริษัทอ้างว่า S1 มีอ...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Lunaรูปภาพสร้างด้วย GPT Image 1.5
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
เมื่อการสอนหุ่นยนต์ไม่จำเป็นต้องเริ่มจากการเขียนโปรแกรมใหม่ทุกครั้ง แต่ใช้วิธี “ทำให้ดู” แทน นั่นคือประสบการณ์ที่ Skild AI ต้องการผลักดันด้วย S1 โมเดลพื้นฐานสำหรับหุ่นยนต์ที่รับวิดีโอการสาธิตจากมนุษย์เป็นคำสั่ง แล้วพยายามทำงานตามในสภาพแวดล้อมจริง
Skild ระบุว่า S1 สามารถจัดการงานที่ไม่เคยเห็นระหว่างการฝึกล่วงหน้า เป็นงานหลายขั้นตอนที่ใช้เวลานานได้ถึง 10 นาที โดยไม่ต้องทำ fine-tuning หรือมีรอบฝึกเฉพาะงานหลังดูวิดีโอ 1
จุดสำคัญคือ S1 ไม่ได้เพียงจดจำวิดีโอแบบเฟรมต่อเฟรม แต่พยายามตีความเป้าหมายของงาน จากนั้นนำทักษะที่มีอยู่แล้ว เช่น การหยิบ การเคลื่อนย้าย การวาง และการจัดการวัตถุ มาประกอบเป็นลำดับการกระทำใหม่
S1 ใช้แนวทางที่เรียกว่า visual in-context learning หรือการเรียนรู้จากบริบทด้วยภาพ วิดีโอที่มนุษย์สาธิตทำหน้าที่คล้าย “พรอมต์” ของงานในขณะที่โมเดลกำลังทำงาน ไม่ใช่ชุดข้อมูลใหม่สำหรับนำไปอัปเดตค่าน้ำหนักของโมเดล
หลังสังเกตวิดีโอ โมเดลต้องอนุมานทั้งเป้าหมาย ลำดับขั้นตอน วัตถุที่ต้องโต้ตอบด้วย และวิธีปรับการเคลื่อนไหวให้เข้ากับสถานการณ์ปัจจุบัน ก่อนแปลงข้อมูลเหล่านั้นเป็นคำสั่งสำหรับหุ่นยนต์ Skild อธิบายว่า S1 ไม่จำเป็นต้องเปลี่ยนค่าน้ำหนักของโมเดลสำหรับการสาธิตใหม่แต่ละครั้ง 1
แนวคิดนี้จึงใกล้เคียงกับการ “สอนด้วยตัวอย่าง” มากกว่าการฝึกหุ่นยนต์แบบเดิม ซึ่งมักต้องใช้ข้อมูลเฉพาะงาน การควบคุมหุ่นยนต์จากระยะไกล การเขียนระบบควบคุม หรือการฝึกซ้ำก่อนจะเริ่มงานใหม่ได้
ตัวอย่างงานที่บริษัทเผยแพร่ ได้แก่ การชงกาแฟแบบ pour-over การปลูกต้นไม้ลงกระถาง การประกอบชุดอุปกรณ์ และการพลิกแพนเค้ก 1
35
การควบคุมการเคลื่อนไหวสั้น ๆ เพียงครั้งเดียวอาจเขียนสคริปต์หรือฝึกได้ไม่ยากนัก แต่ภารกิจที่กินเวลานานถึง 10 นาทีอาจประกอบด้วยการตัดสินใจหลายสิบครั้ง ตำแหน่งวัตถุอาจเปลี่ยนไป และความผิดพลาดเล็ก ๆ ในช่วงต้นอาจส่งผลต่อขั้นตอนถัดไป
S1 จึงต้องรักษาเป้าหมายของงานไว้ตลอดลำดับการทำงาน และปรับการกระทำตามสิ่งที่มองเห็น แทนที่จะเลียนแบบท่าทางของผู้สาธิตแบบตายตัว ความสามารถนี้เป็นส่วนที่ทำให้การสาธิตด้วยวิดีโอมีความหมายต่อวงการหุ่นยนต์มากกว่าการสั่งให้ทำการเคลื่อนไหวเดี่ยว ๆ
ในการทดสอบงานที่ไม่เคยเห็นมาก่อน Skild รายงานว่า เมื่อใช้สเกลการฝึกล่วงหน้าที่ระบุไว้ 100,000 ชั่วโมง นโยบายที่รับพรอมต์เป็นวิดีโอทำอัตราความสำเร็จเฉลี่ย 66% ต่อขั้นตอน ขณะที่นโยบาย vision-language-action ซึ่งรับคำสั่งเป็นภาษาทำได้ 9% 32
ผลดังกล่าวชี้ว่า วิดีโออาจสื่อรายละเอียดทางกายภาพที่คำพูดอธิบายได้ไม่ครบ เช่น ต้องหยิบวัตถุชิ้นไหน จับในทิศทางใด ทำขั้นตอนไหนก่อน หรือปรับตัวอย่างไรเมื่อสภาพแวดล้อมไม่เหมือนเดิม
อย่างไรก็ตาม ตัวเลขนี้ควรอ่านอย่างระมัดระวัง เพราะเป็นผลการประเมินที่ Skild รายงานเอง ไม่ใช่ผลการทดสอบมาตรฐานอุตสาหกรรมที่มีการทำซ้ำโดยหน่วยงานอิสระ นอกจากนี้ อัตราความสำเร็จ “ต่อขั้นตอน” 66% ไม่ได้หมายความว่าหุ่นยนต์จะทำงาน 10 นาทีทั้งภารกิจสำเร็จด้วยความน่าจะเป็น 66% ตั้งแต่ต้นจนจบ
ตัวอย่างที่เปิดเผยต่อสาธารณะครอบคลุมงานจัดการวัตถุหลายขั้นตอน เช่น
งานเหล่านี้ต้องใช้ทั้งการมองเห็น การระบุวัตถุ การควบคุมการหยิบจับ การเรียงลำดับการกระทำ และการควบคุมต่อเนื่อง ไม่ใช่เพียงการทดสอบการเคลื่อนไหวเดี่ยว ๆ Skild ระบุว่างานเหล่านี้ไม่อยู่ในข้อมูลฝึกล่วงหน้า แต่หลักฐานที่มีอยู่ส่วนใหญ่ยังมาจากบริษัทและรายงานที่สรุปคำกล่าวของบริษัท 1
33
ดังนั้น วิดีโอสาธิตจึงแสดงให้เห็น “รูปแบบการใช้งานที่ตั้งใจไว้” นั่นคือมนุษย์ทำงานให้ดูหนึ่งครั้ง แล้วหุ่นยนต์พยายามนำขั้นตอนนั้นไปใช้กับงานเดียวกันในบริบทของตนเอง แต่ยังไม่ใช่หลักฐานว่า S1 สามารถทำงานบ้านแบบใดก็ได้ ทำงานโดยไม่ต้องมีผู้ดูแล หรือรับมือกับความแปรผันทางกายภาพทุกรูปแบบในโรงงานได้อย่างน่าเชื่อถือ
ข้อได้เปรียบที่ Skild โฆษณาคือ หุ่นยนต์สามารถเริ่มทำงานหลังสังเกตการสาธิต โดยไม่ต้องผ่านรอบฝึกเฉพาะงานเพิ่มเติม บริษัทและรายงานเกี่ยวกับการเปิดตัวอธิบายการทำงานนี้ว่าเป็นการประมวลผลแบบ in-context และทำงานได้แบบเรียลไทม์ 1
30
แต่แหล่งข้อมูลที่มีอยู่ยังไม่ได้ระบุค่าความหน่วงที่แม่นยำ เช่น ต้องใช้กี่วินาทีตั้งแต่จบวิดีโอจนถึงการเคลื่อนไหวครั้งแรกของหุ่นยนต์
คำว่า “ไม่ต้องทำ fine-tuning” หมายถึงโมเดลไม่ต้องผ่านกระบวนการอัปเดตค่าน้ำหนักสำหรับงานใหม่ ไม่ได้แปลว่าวิดีโอทุกคลิปจะถูกประมวลผลได้ทันทีโดยไม่มีเวลาเตรียมการ และไม่ได้ยืนยันว่าระบบไม่ต้องมีการตั้งค่า การปรับเทียบ หรือการตรวจสอบความปลอดภัยก่อนเริ่มทำงาน
S1 เป็นส่วนหนึ่งของแนวทาง Skild Brain ซึ่งต้องการสร้างโมเดลทั่วไปสำหรับงานและรูปร่างหุ่นยนต์หลายประเภท แทนการสร้างนโยบายแยกสำหรับหุ่นยนต์แต่ละรุ่นและงานแต่ละชนิด
Skild ระบุว่า บริษัทสร้างโลกจำลองที่มีหุ่นยนต์มากถึง 100,000 รูปแบบ และทดสอบการนำโมเดลไปใช้กับรูปร่างที่ถูกกันออกจากชุดฝึก เพื่อดูว่าสามารถควบคุมหุ่นยนต์ที่ไม่เคยเห็นมาก่อนได้หรือไม่ 6
การฝึกกับหุ่นยนต์หลายรูปแบบมีเป้าหมายเพื่อให้โมเดลเรียนรู้หลักการควบคุมทั่วไป ไม่ผูกติดกับโครงสร้างของเครื่องใดเครื่องหนึ่ง บริษัทอธิบายว่า Skild Brain มุ่งรองรับหุ่นยนต์ฮิวแมนนอยด์ หุ่นยนต์สี่ขา แขนกลบนโต๊ะ และหุ่นยนต์เคลื่อนที่ที่มีแขนกล 3
10
มีการกล่าวอ้างว่า Skild มีข้อมูลมากกว่าคู่แข่ง 100–1,000 เท่า แต่ควรพิจารณาอย่างระมัดระวัง เพราะแหล่งข้อมูลที่มีไม่ได้แสดงการเปรียบเทียบขนาด คุณภาพ หรือประสบการณ์จากหุ่นยนต์ของแต่ละบริษัทในมาตรฐานเดียวกันและตรวจสอบได้อย่างอิสระ
ข้อสรุปที่รองรับได้ชัดเจนกว่าคือ Skild กำลังเพิ่มขนาดการฝึกผ่านการจำลองและการฝึกข้ามรูปร่างหุ่นยนต์ แทนที่จะพึ่งพาการเก็บข้อมูลสาธิตแบบเฉพาะเจาะจงสำหรับฮาร์ดแวร์เพียงแพลตฟอร์มเดียว
คำว่า omni-bodied เป็นคำที่ Skild ใช้เรียกโมเดลซึ่งสามารถถ่ายโอนความสามารถข้ามร่างหุ่นยนต์หลายประเภทได้ ในทางหลักการ โมเดลร่วมหนึ่งชุดอาจเรียนรู้แนวคิดระดับงานแยกจากรูปทรงและกลไกเฉพาะของเครื่องจักรแต่ละตัว ทำให้สามารถปรับใช้กับแขนขา ล้อ แขนกล และชุดขับเคลื่อนที่แตกต่างกันได้
Skild ระบุว่าการทดสอบในสภาพแวดล้อมจำลองมีการกันรูปร่างหุ่นยนต์บางแบบออกจากข้อมูลฝึก และโมเดลสามารถควบคุมรูปร่างเหล่านั้นแบบ zero-shot หรือไม่เคยฝึกกับรูปร่างนั้นโดยตรง 6
แต่แนวคิดนี้ไม่ได้ทำให้ฮาร์ดแวร์ไม่สำคัญ หุ่นยนต์แต่ละตัวก็ยังมีเซนเซอร์ มือจับ ขีดจำกัดข้อต่อ อินเทอร์เฟซควบคุม เวลาแฝง น้ำหนักบรรทุก และข้อกำหนดด้านความปลอดภัยต่างกัน โมเดลที่ถ่ายโอนข้ามร่างได้อาจช่วยลดงานปรับระบบ แต่การนำไปใช้จริงยังต้องอาศัยฮาร์ดแวร์ที่เข้ากันได้ การบูรณาการระบบ และการตรวจสอบในพื้นที่เป้าหมาย
รายงานข่าวระบุว่าซอฟต์แวร์ของ Skild ทำงานอยู่บนหุ่นยนต์หลายร้อยตัวในโรงงาน ศูนย์ข้อมูล และพื้นที่โลจิสติกส์ ตัวอย่างที่ถูกกล่าวถึง ได้แก่ โรงงานของ NVIDIA ในเมืองฮิวสตัน การทดลองที่สนามบิน LaGuardia และการทำงานร่วมกับบริษัทด้านสายไฟและการก่อสร้าง นอกจากนี้ Skild ยังประกาศความร่วมมือกับ ABB Robotics, Universal Robots และ NVIDIA 17
4
ข้อมูลเหล่านี้สะท้อนความสนใจเชิงพาณิชย์และการทดสอบในโลกจริง แต่ยังไม่เพียงพอที่จะคำนวณอัตราการผลิตสำเร็จ เวลาที่ระบบทำงานได้ต่อเนื่อง ต้นทุนที่ลดลง หรือผลตอบแทนการลงทุนอย่างอิสระ
ผลจากห้องทดลองหรือการทดสอบแบบควบคุมจึงไม่ควรถูกนำไปตีความเป็นตัวเลขประสิทธิภาพของสายการผลิตโดยตรง อีกหนึ่งรายงานระบุถึงแผนการใช้งานร่วมกับ Foxconn บนสายประกอบระบบเซิร์ฟเวอร์ NVIDIA Blackwell GPU ในฮิวสตัน แต่ข้อมูลดังกล่าวเป็นหลักฐานของความพยายามทดสอบหรือการนำไปใช้งาน ไม่ใช่ข้อพิสูจน์ว่าหุ่นยนต์อัตโนมัติทำงานในโรงงานได้อย่างครอบคลุมแล้ว 43
เงินทุนจำนวนมากทำให้ Skild เป็นหนึ่งในบริษัท Physical AI หรือปัญญาประดิษฐ์ที่ทำงานในโลกกายภาพ ซึ่งถูกจับตามองมากที่สุด Bloomberg รายงานว่า Skild ระดมทุนได้ประมาณ 1.4 พันล้านดอลลาร์สหรัฐ ในรอบ Series C ที่นำโดย SoftBank เมื่อเดือนมกราคม 2026 ส่งผลให้บริษัทมีมูลค่ามากกว่า 14 พันล้านดอลลาร์สหรัฐ 13
ก่อนหน้านั้น Skild ประกาศระดมทุน Series A จำนวน 300 ล้านดอลลาร์สหรัฐ ในเดือนกรกฎาคม 2024 ที่มูลค่าบริษัท 1.5 พันล้านดอลลาร์สหรัฐ 9
การเปรียบเทียบกับ “ChatGPT moment” สำหรับหุ่นยนต์สะท้อนประสบการณ์ที่บริษัทต้องการให้เกิดขึ้น นั่นคือ แทนที่คนทำงานจะต้องเขียนโปรแกรม ฝึกข้อมูล หรือปรับระบบใหม่ทุกครั้ง เพียงสาธิตพฤติกรรมที่ต้องการให้หุ่นยนต์ดู แล้วโมเดลทั่วไปจะเป็นผู้แปลงการสาธิตนั้นให้กลายเป็นการกระทำ
S1 จึงเป็นก้าวที่น่าสนใจไปสู่หน้าตาของการสั่งงานแบบนั้น แต่ยังไม่ใช่หลักฐานว่าหุ่นยนต์ทั่วไปพร้อมใช้งานในทุกบ้านหรือโรงงานแล้ว ผลลัพธ์สาธารณะที่แข็งแรงที่สุดยังเป็นข้อมูลที่บริษัทเปิดเผยเอง ชุดงานที่สาธิตยังมีขอบเขตจำกัด และยังไม่มีตัวชี้วัดการใช้งานภาคอุตสาหกรรมที่ตรวจสอบโดยอิสระเพียงพอ
ข้อสรุปที่รอบคอบที่สุดคือ S1 แสดงให้เห็นแนวทางที่มีศักยภาพในการลดการฝึกหุ่นยนต์แบบเฉพาะงาน โดยใช้วิดีโอเป็นคำสั่ง อาศัยทักษะที่เรียนรู้จากการฝึกล่วงหน้า และทดสอบว่าโมเดลสามารถประกอบทักษะเหล่านั้นเข้ากับงานใหม่ที่มีหลายขั้นตอนได้ดีเพียงใด
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Skild AI ระบุว่า S1 สามารถทำงานหลายขั้นตอนที่ไม่เคยเห็นมาก่อนและใช้เวลานานถึง 10 นาที หลังดูวิดีโอมนุษย์เพียงหนึ่งคลิป โดยไม่ต้องทำ fine tuning หรือฝึกหลังการสังเกต
Skild AI ระบุว่า S1 สามารถทำงานหลายขั้นตอนที่ไม่เคยเห็นมาก่อนและใช้เวลานานถึง 10 นาที หลังดูวิดีโอมนุษย์เพียงหนึ่งคลิป โดยไม่ต้องทำ fine tuning หรือฝึกหลังการสังเกต S1 ใช้วิดีโอเป็นคำสั่งในขั้นตอนประมวลผล แล้วนำทักษะที่เรียนรู้ไว้ก่อนหน้ามาประกอบเป็นลำดับการกระทำที่เหมาะกับสภาพแวดล้อมของหุ่นยนต์
บริษัทอ้างว่า S1 มีอัตราความสำเร็จเฉลี่ยรายขั้นตอน 66% ในการทดสอบงานที่ไม่เคยเห็น เทียบกับ 9% สำหรับโมเดลที่รับคำสั่งด้วยภาษา แต่ตัวเลขนี้ยังเป็นผลทดสอบที่บริษัทเปิดเผยเอง