Skild AI mendakwa S1 boleh menonton satu video bagi tugas baharu sehingga 10 minit dan melaksanakannya tanpa mengubah berat model atau mengumpul data khusus tugas. Demonstrasi S1 merangkumi penyediaan kopi pour over, menanam semula pokok, memasang kit dan membalikkan lempeng, selain dilaporkan mampu menyesuaikan dir...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, unveiled by co-founder Abhinav Gupta at SMARTCLOUD SHOW 2026 in Seoul on August 25, 2026, a. Article summary: S1 is Skild AI’s flagship robotics foundation model for in-context learning: a robot watches one video demonstration—including an unseen task lasting up to 10 minutes—and then executes it without collecting task-specific. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Skild AI S1 ialah model asas robotik yang dibina berasaskan pembelajaran dalam konteks (in-context learning). Secara ringkas, robot menonton satu video demonstrasi dan menggunakan video itu sebagai spesifikasi tugas—bukan sekadar arahan umum. Skild mendakwa S1 boleh melaksanakan tugas baharu yang belum pernah dilihatnya, termasuk tugasan sehingga 10 minit, tanpa penalaan halus khusus tugas atau perubahan pada berat model. 1
5
Jika dakwaan ini bertahan dalam ujian bebas, ia boleh menjadi langkah penting ke arah robot yang lebih mudah disesuaikan. Namun, S1 belum membuktikan bahawa robot serba guna sudah bersedia melakukan kerja rumah atau tugas kilang tanpa pengawasan. Hasil paling kukuh yang tersedia masih datang daripada demonstrasi dan penanda aras Skild sendiri.
Banyak sistem pembelajaran robotik dilatih untuk tugas, bentuk robot atau keadaan operasi tertentu. S1 mengambil pendekatan berbeza: video demonstrasi dianggap sebagai arahan yang boleh diterjemahkan kepada tindakan.
Daripada video itu, model perlu memahami matlamat, urutan langkah, hubungan antara objek, cara memegang sesuatu, penggunaan alatan serta pelarasan fizikal yang diperlukan untuk menyiapkan tugas. 1
3
Perbezaannya lebih jelas jika dibandingkan dengan arahan seperti “buat kopi” atau “alih pokok itu”. Bahasa boleh menyatakan matlamat, tetapi video turut menunjukkan urutan kerja, cara objek dipegang, penggunaan alatan dan bagaimana tugas berkembang dari satu langkah ke langkah seterusnya. Menurut Skild, maklumat yang lebih kaya ini membantu S1 mengendalikan tugasan jangka panjang yang tidak wujud dalam data pralatihnya. 1
5
Syarikat itu menggambarkan pendekatan ini sebagai analogi robotik kepada cara kita memberikan arahan kepada model bahasa: keupayaan asas model kekal sama, manakala video menyediakan konteks khusus untuk tugas tersebut.
Skild menunjukkan S1 melakukan beberapa tugasan manipulasi, termasuk:
Sesetengah demonstrasi berlangsung sehingga 10 minit dan melibatkan berpuluh-puluh tindakan berurutan. 1
3
5
Skild turut melaporkan ujian kualitatif yang bertujuan menunjukkan bahawa S1 bukan sekadar mengulang gerakan yang dihafal. Dalam ujian tersebut, model dilaporkan dapat bertindak balas terhadap perubahan keadaan, mencuba semula selepas melakukan kesilapan, menggunakan cawan apabila penyiram yang ditunjukkan dalam video tiada, serta membetulkan cara demonstrator mengendalikan telur yang kurang kemas—bukannya menirunya secara bulat-bulat. 5
Ini merupakan petunjuk kepada fleksibiliti tingkah laku, tetapi video demonstrasi semata-mata masih belum membuktikan kebolehpercayaan merentas pelbagai persekitaran.
Perbandingan paling khusus yang diberikan Skild datang daripada penilaian dalaman terhadap tugas yang tidak pernah dilihat sebelum ini. Dengan 100,000 jam data latihan, syarikat itu melaporkan kadar kejayaan purata setiap langkah sebanyak 66% bagi dasar pembelajaran dalam konteks yang menerima arahan video, berbanding 9% bagi model asas VLA yang dipadankan. VLA ialah singkatan bagi vision-language-action, iaitu model yang menghubungkan penglihatan, bahasa dan tindakan robot. 1
4
Skild turut berkata model VLA berasaskan bahasa itu merosot sehingga tiga kali ganda lebih banyak berbanding S1 apabila keadaan penggunaan berubah dengan ketara—contohnya apabila objek berbeza daripada objek dalam demonstrasi atau rancangan pelaksanaan memerlukan penggunaan tangan yang bertentangan. 1
Satu lagi perbandingan yang dilaporkan syarikat menganggarkan bahawa satu arahan video menghasilkan prestasi yang setanding dengan kira-kira 380 episod latihan pascapra-latih khusus tugas pada model yang telah dipratatih. 1
Angka-angka ini menjelaskan mengapa arahan video mungkin penting. Demonstrasi bukan sahaja menyampaikan hasil yang dikehendaki, tetapi juga urutan, masa, susunan objek, penggunaan alatan dan strategi fizikal. Namun, angka tersebut perlu dibaca sebagai bukti dalaman Skild, bukan penanda aras perbandingan yang telah diulang secara bebas. Bahan yang tersedia tidak merangkumi kertas penyelidikan awam, pemberat model atau penilaian luaran yang distandardkan. 4
15
Skild menggambarkan S1 sebagai sistem yang beroperasi dalam masa nyata selepas menonton demonstrasi. Laporan sekitar pelancarannya juga menyatakan robot boleh melaksanakan tugas sejurus selepas melihat video. 2
5
Namun, sumber yang ada belum cukup untuk mengesahkan angka khusus seperti “dalam beberapa saat” atau “dalam 11 minit” bagi sistem secara umum. Tempoh tepat daripada video tamat hingga robot mula bertindak tidak dapat dipastikan berdasarkan sumber yang diberikan.
Perbezaan ini penting dalam persekitaran industri. Masa persediaan, kependaman inferens, pemeriksaan keselamatan dan cara robot pulih daripada kesilapan boleh sama penting dengan kadar kejayaan tugas semata-mata.
Skild mengaitkan pembangunan model robotik serba guna itu dengan saluran data yang luas. Syarikat berkenaan menyatakan ia menggunakan simulasi berskala besar, video internet yang menunjukkan tindakan manusia, data robot, teleoperasi dan maklumat daripada penggunaan sebenar. Bahan Series C Skild turut menerangkan satu kitaran data: penggunaan robot menghasilkan lebih banyak pengalaman, yang kemudiannya boleh meningkatkan model merentas robot dan persekitaran. 37
Di SMARTCLOUD SHOW, pengasas bersama Abhinav Gupta dilaporkan berkata Skild menggunakan “setiap jenis” kaedah pengumpulan data robot dan telah mengumpulkan 100 hingga 1,000 kali lebih banyak data berbanding pesaing. Angka gandaan itu ialah dakwaan syarikat, bukan perbandingan industri yang diaudit secara terbuka. 6
Secara praktikal, setiap sumber data menyumbang perkara berbeza. Video manusia memberikan contoh objek dan tindakan, simulasi memperluas variasi bentuk robot serta persekitaran, manakala data robot sebenar menghubungkan pengetahuan tersebut dengan kawalan fizikal.
S1 ialah sebahagian daripada strategi lebih luas Skild untuk membina otak robot “omni-badan”. Istilah ini tidak bermaksud robot berkaki dua, berkaki empat, beroda dan lengan robotik akan bergerak dengan cara yang sama. Sendi, penderia, anggota, roda dan tindakan yang boleh dilakukan semuanya berbeza. 45
Sebaliknya, seni bina yang dicadangkan cuba mempelajari peraturan fizikal yang boleh digunakan merentas platform, kemudian memetakan pengetahuan itu kepada keupayaan robot tertentu. Dengan cara ini, satu model boleh berkongsi pengetahuan antara bentuk robot sambil menyesuaikan outputnya dengan penggerak dan penderia yang tersedia pada setiap robot. 45
Matlamatnya ialah mengurangkan keperluan membina dan menyelenggara model berasingan bagi setiap konfigurasi robot. Skild juga pernah menerangkan latihan merentas sejumlah besar bentuk robot simulasi sebagai sebahagian daripada usaha mempelajari tingkah laku fizikal yang lebih umum. 42
45
Skild mengumumkan kerjasama dengan ABB Robotics dan Universal Robots untuk mengintegrasikan perisiannya ke dalam sistem industri. Reuters pula melaporkan bahawa Skild dan Nvidia menggunakan otak robot itu pada barisan pemasangan yang berkaitan dengan sistem Nvidia Blackwell. 34
44
Pengumuman ini menunjukkan wujudnya laluan ke arah ujian komersial, tetapi belum memberikan rekod prestasi awam yang lengkap. Bukti yang tersedia tidak menetapkan angka yang diaudit secara bebas bagi kapasiti pengeluaran kilang, masa aktif, kadar ralat, insiden keselamatan atau pulangan pelaburan.
Dalam erti kata lain, penggunaan atau integrasi industri menunjukkan teknologi itu sedang diuji—bukan bukti bahawa ia sudah menggantikan automasi konvensional pada skala besar.
Minat pelabur terhadap Skild amat besar. Bloomberg melaporkan pusingan Series C bernilai AS$1.4 bilion yang diterajui SoftBank, sekali gus menilai syarikat itu pada lebih AS$14 bilion—lebih tiga kali ganda penilaiannya kira-kira tujuh bulan sebelumnya. 17
Laporan lain meletakkan jumlah pembiayaan terkumpul Skild melebihi AS$1.8 bilion, tetapi angka yang tersedia berbeza mengikut sumber dan tidak wajar dianggap sebagai jumlah muktamad yang diaudit. 18
21
22
Pembiayaan tersebut menunjukkan keyakinan bahawa perisian robotik boleh menjadi lapisan platform yang boleh diskalakan merentas pelbagai jenis perkakasan. Namun, ia tidak membuktikan bahawa robot serba guna yang boleh dipercayai untuk rumah atau kilang sudah tersedia.
Perbandingan dengan “detik ChatGPT untuk robot” juga wajar difahami sebagai analogi, bukan kesimpulan yang telah dipastikan. S1 mencadangkan kemungkinan perubahan daripada melatih semula robot untuk setiap tugas kepada mengajarnya melalui demonstrasi. Pelabur Ravi Mhatre menyifatkan pelancaran itu sebagai “detik GPT-3” bagi tugasan buruh manusia jangka panjang, tetapi itu ialah penilaian pelabur dan bukan pengesahan saintifik bebas. 10
Idea paling penting di sebalik S1 bukan sekadar keupayaan robot meniru video. Yang lebih besar ialah kemungkinan model asas robotik menggunakan satu demonstrasi untuk menggabungkan kemahiran, menyesuaikan diri dengan keadaan yang berubah dan melaksanakan urutan tindakan yang panjang tanpa mengemas kini berat model untuk tugas tertentu itu.
Keputusan penanda aras 66% berbanding 9% yang dilaporkan Skild, bersama demonstrasi tugasan sehingga 10 minit, menjadikan tuntutan ini signifikan dari sudut teknikal. 1
4 Namun, had buktinya juga perlu diberi perhatian: bahan awam masih banyak bergantung pada maklumat syarikat, demonstrasi terpilih dan pengumuman penggunaan awal.
Sehingga penyelidik luar dapat mengulangi keputusan tersebut dalam keadaan yang distandardkan—dan pelanggan industri menerbitkan data kebolehpercayaan serta keselamatan—S1 lebih tepat dilihat sebagai arah yang menjanjikan untuk AI fizikal, bukannya bukti muktamad bahawa “otak robot” serba guna telah tiba.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI mendakwa S1 boleh menonton satu video bagi tugas baharu sehingga 10 minit dan melaksanakannya tanpa mengubah berat model atau mengumpul data khusus tugas.
Skild AI mendakwa S1 boleh menonton satu video bagi tugas baharu sehingga 10 minit dan melaksanakannya tanpa mengubah berat model atau mengumpul data khusus tugas. Demonstrasi S1 merangkumi penyediaan kopi pour over, menanam semula pokok, memasang kit dan membalikkan lempeng, selain dilaporkan mampu menyesuaikan diri dengan perubahan objek serta memulihkan beberapa kesilapan.
S1 sedang diposisikan untuk robot industri, tetapi bukti awam setakat ini belum membuktikan metrik operasi seperti masa aktif, kadar pengeluaran, kadar ralat atau pulangan pelaburan.