Skild AI mendakwa S1 boleh melaksanakan tugasan berbilang langkah yang belum pernah dilihat sehingga 10 minit selepas menonton satu video manusia, tanpa penalaan halus atau latihan pasca pemerhatian. S1 menganggap video sebagai arahan ketika inferens, kemudian menggabungkan kemahiran yang dipelajari semasa pralatiha...
Diterbitkan olehDisunting dengan GPT-5.6 LunaImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Bayangkan mengajar robot membuat kopi dengan cara yang paling mudah: tunjukkan kepadanya satu video, bukan tulis kod baharu atau melatih semula model dari awal. Itulah idea di sebalik S1, model asas robotik daripada Skild AI.
Skild mendakwa S1 boleh melaksanakan tugasan manipulasi berbilang langkah yang belum pernah dilihat sebelum ini, dengan tempoh sehingga 10 minit, hanya berdasarkan satu demonstrasi video manusia. Model itu juga dikatakan tidak memerlukan penalaan halus atau kitaran latihan pasca-pemerhatian yang khusus untuk tugasan tersebut. 1
Namun, ini bukan bermakna robot menghafal setiap bingkai video dan mengulang pergerakan manusia secara tepat. Sebaliknya, S1 cuba memahami matlamat tugasan, menggunakan kemahiran yang telah dipelajari sebelum ini, kemudian menyusun kemahiran itu menjadi urutan tindakan baharu.
S1 menggunakan pendekatan yang dipanggil pembelajaran konteks visual (visual in-context learning). Dalam pendekatan ini, demonstrasi manusia berfungsi sebagai arahan kepada model ketika ia sedang digunakan. Berat model tidak diubah setiap kali ia menerima video tugasan baharu, menurut penerangan Skild. 1
Secara ringkas, prosesnya kelihatan seperti ini:
Contoh awam yang diberikan Skild termasuk menyediakan kopi pour-over, menanam pokok dalam pasu, memasang kit dan membalikkan lempeng. Tugasan ini memerlukan robot mengenal pasti objek, mengikuti turutan langkah dan mengekalkan kawalan dalam tempoh yang lebih panjang. 1
35
Cabaran terbesar ialah tugasan berjangka panjang. Pergerakan pendek boleh diprogram atau dilatih secara berasingan. Sebaliknya, tugasan selama 10 minit mungkin melibatkan berpuluh-puluh keputusan, kedudukan objek yang berubah serta pelbagai peluang untuk tersilap. S1 direka untuk mengekalkan matlamat tugasan sepanjang urutan itu dan menyesuaikan tindakan mengikut keadaan sekeliling.
Skild melaporkan perbezaan ketara antara arahan video dan arahan bahasa dalam penilaian tugasan yang belum pernah dilihat. Pada skala latihan yang dinyatakan sebagai 100,000 jam, dasar yang dipandu video mencapai kadar kejayaan purata setiap langkah sebanyak 66%, berbanding 9% bagi dasar penglihatan-bahasa-tindakan (vision-language-action atau VLA) yang dipandu bahasa. 32
Mengapa video mungkin lebih berguna? Video boleh menunjukkan butiran fizikal yang sukar diterangkan dengan perkataan—objek mana yang perlu dipegang, orientasinya, susunan tindakan dan cara menyesuaikan diri apabila keadaan berubah.
Tetapi angka 66% itu perlu dibaca dengan berhati-hati. Ia ialah keputusan penilaian yang dilaporkan oleh Skild, bukannya penanda aras industri yang telah disahkan secara bebas. Selain itu, kadar kejayaan setiap langkah tidak bermakna robot mempunyai jaminan 66% untuk menyelesaikan keseluruhan tugasan 10 minit dari awal hingga akhir.
Demonstrasi awam S1 merangkumi:
Contoh-contoh ini menggabungkan persepsi, pengendalian objek, susunan langkah dan kawalan berterusan. Skild menyifatkan tugasan tersebut sebagai tugasan yang tidak muncul semasa pralatihan, walaupun bukti yang tersedia datang terutamanya daripada syarikat itu sendiri dan laporan yang merumuskan dakwaannya. 1
33
Demonstrasi itu menunjukkan antara muka yang ingin dibina Skild: manusia melakukan tugasan sekali, kemudian robot cuba menggeneralisasikan prosedur berkenaan. Ia belum membuktikan bahawa S1 boleh melakukan sebarang kerja rumah, beroperasi tanpa pengawasan atau menangani semua variasi fizikal dalam persekitaran pengeluaran sebenar.
Kelebihan yang diiklankan ialah robot boleh mula bertindak selepas memerhatikan demonstrasi, tanpa fasa latihan berasingan selepas video itu selesai. Skild dan laporan mengenai pelancaran S1 menggambarkan proses ini sebagai pelaksanaan masa nyata melalui pembelajaran dalam konteks. 1
30
Namun, sumber yang tersedia tidak memberikan ukuran kependaman yang tepat dan boleh dipercayai—contohnya bilangan saat antara tamat video dengan tindakan pertama robot. Istilah “tanpa penalaan halus” bermaksud model tidak melalui kitaran kemas kini berat khusus untuk tugasan baharu. Ia tidak semestinya bermaksud setiap video diproses serta-merta atau robot tidak memerlukan persediaan, penentukuran dan pemeriksaan keselamatan.
S1 ialah sebahagian daripada strategi lebih besar Skild yang dipanggil Skild Brain. Matlamatnya adalah melatih satu model tujuan umum merentasi pelbagai tugasan, bentuk robot, simulasi dan data visual manusia, bukannya membina dasar berasingan untuk setiap robot dan pekerjaan.
Skild berkata ia mencipta alam simulasi yang mengandungi 100,000 variasi robot, kemudian menguji keupayaan model untuk menggeneralisasikan kemahiran kepada bentuk robot yang tidak termasuk dalam data latihan. 6
Latihan merentasi pelbagai jenis badan robot bertujuan membantu model mempelajari prinsip kawalan yang lebih umum. Bahan Skild menyatakan bahawa modelnya disasarkan untuk humanoid, robot berkaki empat, lengan atas meja dan manipulator mudah alih. 3
10
Dakwaan bahawa Skild mempunyai 100 hingga 1,000 kali lebih banyak data berbanding pesaing wajar dianggap dengan berhati-hati. Sumber yang diberikan tidak menyediakan perbandingan piawai dan boleh diaudit secara bebas tentang saiz, kualiti atau pengalaman robot yang berguna merentasi syarikat. Kesimpulan yang lebih kukuh ialah Skild sedang mengejar skala melalui latihan merentasi pelbagai bentuk robot dan simulasi, bukan hanya demonstrasi khusus untuk satu platform perkakasan.
Istilah “omni-badan” (omni-bodied) merujuk kepada model yang bertujuan berpindah antara pelbagai bentuk robot. Secara prinsip, model bersama boleh mempelajari konsep tugasan pada tahap lebih tinggi tanpa terikat sepenuhnya kepada geometri satu mesin. Ini membolehkannya menyesuaikan diri dengan anggota, roda, manipulator dan susunan penggerak yang berbeza.
Skild berkata ujian simulasi merangkumi bentuk robot yang diketepikan daripada data latihan dan dikawal secara sifar-shot—iaitu tanpa latihan khusus terlebih dahulu untuk bentuk tersebut. 6
Namun, perkakasan tetap penting. Robot sebenar berbeza dari segi sensor, pencengkam, had sendi, antara muka kawalan, kependaman, kapasiti muatan dan keperluan keselamatan. Model yang boleh menggeneralisasikan merentasi pelbagai bentuk mungkin mengurangkan kerja penyesuaian, tetapi penggunaan di lapangan masih memerlukan perkakasan yang sesuai, integrasi sistem dan pengesahan dalam persekitaran sasaran.
Laporan awam menyatakan bahawa perisian Skild beroperasi pada ratusan robot dalam kilang, pusat data dan persekitaran logistik. Contoh yang dilaporkan termasuk kilang NVIDIA di Houston, percubaan di LaGuardia serta kerja dengan syarikat pendawaian dan pembinaan. Skild turut mengumumkan hubungan dengan ABB Robotics, Universal Robots dan NVIDIA. 17
4
Skild juga dilaporkan akan menguji modelnya melalui kerjasama dengan Foxconn dan NVIDIA pada barisan pemasangan yang membina sistem pelayan GPU NVIDIA Blackwell di Houston, Texas. Ini menunjukkan usaha ujian atau penggunaan yang dirancang, bukannya bukti bahawa kilang beroperasi secara autonomi secara meluas. 43
Setakat bukti awam yang tersedia, tiada data mencukupi untuk mengira kadar penyelesaian pengeluaran, masa operasi, penjimatan kos atau pulangan pelaburan secara bebas. Keputusan ujian makmal juga tidak boleh dianggap sebagai metrik pengeluaran.
Pembiayaan besar menjadikan Skild antara usaha yang paling diperhatikan dalam bidang AI fizikal, iaitu kecerdasan buatan yang berinteraksi dengan dunia sebenar melalui robot. Bloomberg melaporkan bahawa syarikat itu mengumpulkan kira-kira AS$1.4 bilion dalam pusingan Siri C yang diketuai SoftBank pada Januari 2026, dengan penilaian melebihi AS$14 bilion. 13
Pusingan Siri A Skild yang diumumkan pada Julai 2024 pula bernilai AS$300 juta, pada penilaian yang dilaporkan sebanyak AS$1.5 bilion. 9
Ungkapan “detik ChatGPT untuk robot” menggambarkan perubahan pengalaman pengguna yang diharapkan: pekerja tidak perlu memprogram atau melatih semula robot untuk setiap tugasan. Mereka hanya perlu menunjukkan contoh, kemudian model umum menterjemahkan demonstrasi itu kepada tindakan fizikal.
S1 ialah langkah penting ke arah antara muka tersebut, tetapi ia belum membuktikan bahawa robot tujuan umum telah tiba. Keputusan terkuat yang tersedia masih dilaporkan oleh syarikat, set tugasan yang ditunjukkan adalah terhad dan metrik penggunaan industri yang disahkan secara bebas belum tersedia.
Kesimpulan yang lebih berimbang ialah S1 menunjukkan pendekatan yang menjanjikan untuk mengurangkan latihan robot khusus tugasan: gunakan video sebagai arahan, manfaatkan kemahiran yang diperoleh melalui pralatihan dan uji sama ada kemahiran itu boleh digabungkan menjadi tugasan baharu yang panjang.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI mendakwa S1 boleh melaksanakan tugasan berbilang langkah yang belum pernah dilihat sehingga 10 minit selepas menonton satu video manusia, tanpa penalaan halus atau latihan pasca pemerhatian.
Skild AI mendakwa S1 boleh melaksanakan tugasan berbilang langkah yang belum pernah dilihat sehingga 10 minit selepas menonton satu video manusia, tanpa penalaan halus atau latihan pasca pemerhatian. S1 menganggap video sebagai arahan ketika inferens, kemudian menggabungkan kemahiran yang dipelajari semasa pralatihan untuk menghasilkan tindakan dalam persekitaran robot semasa.
Strategi Skild Brain melatih satu model merentasi pelbagai bentuk robot dan simulasi, tetapi bukti awam masih belum menetapkan kadar penyelesaian, masa operasi, penjimatan kos atau pulangan pelaburan pada tahap pengel...
Skild AI mendakwa S1 boleh melaksanakan tugasan berbilang langkah yang belum pernah dilihat sehingga 10 minit selepas menonton satu video manusia, tanpa penalaan halus atau latihan pasca pemerhatian. S1 menganggap video sebagai arahan ketika inferens, kemudian menggabungkan kemahiran yang dipelajari semasa pralatiha...
Diterbitkan olehDisunting dengan GPT-5.6 LunaImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Bayangkan mengajar robot membuat kopi dengan cara yang paling mudah: tunjukkan kepadanya satu video, bukan tulis kod baharu atau melatih semula model dari awal. Itulah idea di sebalik S1, model asas robotik daripada Skild AI.
Skild mendakwa S1 boleh melaksanakan tugasan manipulasi berbilang langkah yang belum pernah dilihat sebelum ini, dengan tempoh sehingga 10 minit, hanya berdasarkan satu demonstrasi video manusia. Model itu juga dikatakan tidak memerlukan penalaan halus atau kitaran latihan pasca-pemerhatian yang khusus untuk tugasan tersebut. 1
Namun, ini bukan bermakna robot menghafal setiap bingkai video dan mengulang pergerakan manusia secara tepat. Sebaliknya, S1 cuba memahami matlamat tugasan, menggunakan kemahiran yang telah dipelajari sebelum ini, kemudian menyusun kemahiran itu menjadi urutan tindakan baharu.
S1 menggunakan pendekatan yang dipanggil pembelajaran konteks visual (visual in-context learning). Dalam pendekatan ini, demonstrasi manusia berfungsi sebagai arahan kepada model ketika ia sedang digunakan. Berat model tidak diubah setiap kali ia menerima video tugasan baharu, menurut penerangan Skild. 1
Secara ringkas, prosesnya kelihatan seperti ini:
Contoh awam yang diberikan Skild termasuk menyediakan kopi pour-over, menanam pokok dalam pasu, memasang kit dan membalikkan lempeng. Tugasan ini memerlukan robot mengenal pasti objek, mengikuti turutan langkah dan mengekalkan kawalan dalam tempoh yang lebih panjang. 1
35
Cabaran terbesar ialah tugasan berjangka panjang. Pergerakan pendek boleh diprogram atau dilatih secara berasingan. Sebaliknya, tugasan selama 10 minit mungkin melibatkan berpuluh-puluh keputusan, kedudukan objek yang berubah serta pelbagai peluang untuk tersilap. S1 direka untuk mengekalkan matlamat tugasan sepanjang urutan itu dan menyesuaikan tindakan mengikut keadaan sekeliling.
Skild melaporkan perbezaan ketara antara arahan video dan arahan bahasa dalam penilaian tugasan yang belum pernah dilihat. Pada skala latihan yang dinyatakan sebagai 100,000 jam, dasar yang dipandu video mencapai kadar kejayaan purata setiap langkah sebanyak 66%, berbanding 9% bagi dasar penglihatan-bahasa-tindakan (vision-language-action atau VLA) yang dipandu bahasa. 32
Mengapa video mungkin lebih berguna? Video boleh menunjukkan butiran fizikal yang sukar diterangkan dengan perkataan—objek mana yang perlu dipegang, orientasinya, susunan tindakan dan cara menyesuaikan diri apabila keadaan berubah.
Tetapi angka 66% itu perlu dibaca dengan berhati-hati. Ia ialah keputusan penilaian yang dilaporkan oleh Skild, bukannya penanda aras industri yang telah disahkan secara bebas. Selain itu, kadar kejayaan setiap langkah tidak bermakna robot mempunyai jaminan 66% untuk menyelesaikan keseluruhan tugasan 10 minit dari awal hingga akhir.
Demonstrasi awam S1 merangkumi:
Contoh-contoh ini menggabungkan persepsi, pengendalian objek, susunan langkah dan kawalan berterusan. Skild menyifatkan tugasan tersebut sebagai tugasan yang tidak muncul semasa pralatihan, walaupun bukti yang tersedia datang terutamanya daripada syarikat itu sendiri dan laporan yang merumuskan dakwaannya. 1
33
Demonstrasi itu menunjukkan antara muka yang ingin dibina Skild: manusia melakukan tugasan sekali, kemudian robot cuba menggeneralisasikan prosedur berkenaan. Ia belum membuktikan bahawa S1 boleh melakukan sebarang kerja rumah, beroperasi tanpa pengawasan atau menangani semua variasi fizikal dalam persekitaran pengeluaran sebenar.
Kelebihan yang diiklankan ialah robot boleh mula bertindak selepas memerhatikan demonstrasi, tanpa fasa latihan berasingan selepas video itu selesai. Skild dan laporan mengenai pelancaran S1 menggambarkan proses ini sebagai pelaksanaan masa nyata melalui pembelajaran dalam konteks. 1
30
Namun, sumber yang tersedia tidak memberikan ukuran kependaman yang tepat dan boleh dipercayai—contohnya bilangan saat antara tamat video dengan tindakan pertama robot. Istilah “tanpa penalaan halus” bermaksud model tidak melalui kitaran kemas kini berat khusus untuk tugasan baharu. Ia tidak semestinya bermaksud setiap video diproses serta-merta atau robot tidak memerlukan persediaan, penentukuran dan pemeriksaan keselamatan.
S1 ialah sebahagian daripada strategi lebih besar Skild yang dipanggil Skild Brain. Matlamatnya adalah melatih satu model tujuan umum merentasi pelbagai tugasan, bentuk robot, simulasi dan data visual manusia, bukannya membina dasar berasingan untuk setiap robot dan pekerjaan.
Skild berkata ia mencipta alam simulasi yang mengandungi 100,000 variasi robot, kemudian menguji keupayaan model untuk menggeneralisasikan kemahiran kepada bentuk robot yang tidak termasuk dalam data latihan. 6
Latihan merentasi pelbagai jenis badan robot bertujuan membantu model mempelajari prinsip kawalan yang lebih umum. Bahan Skild menyatakan bahawa modelnya disasarkan untuk humanoid, robot berkaki empat, lengan atas meja dan manipulator mudah alih. 3
10
Dakwaan bahawa Skild mempunyai 100 hingga 1,000 kali lebih banyak data berbanding pesaing wajar dianggap dengan berhati-hati. Sumber yang diberikan tidak menyediakan perbandingan piawai dan boleh diaudit secara bebas tentang saiz, kualiti atau pengalaman robot yang berguna merentasi syarikat. Kesimpulan yang lebih kukuh ialah Skild sedang mengejar skala melalui latihan merentasi pelbagai bentuk robot dan simulasi, bukan hanya demonstrasi khusus untuk satu platform perkakasan.
Istilah “omni-badan” (omni-bodied) merujuk kepada model yang bertujuan berpindah antara pelbagai bentuk robot. Secara prinsip, model bersama boleh mempelajari konsep tugasan pada tahap lebih tinggi tanpa terikat sepenuhnya kepada geometri satu mesin. Ini membolehkannya menyesuaikan diri dengan anggota, roda, manipulator dan susunan penggerak yang berbeza.
Skild berkata ujian simulasi merangkumi bentuk robot yang diketepikan daripada data latihan dan dikawal secara sifar-shot—iaitu tanpa latihan khusus terlebih dahulu untuk bentuk tersebut. 6
Namun, perkakasan tetap penting. Robot sebenar berbeza dari segi sensor, pencengkam, had sendi, antara muka kawalan, kependaman, kapasiti muatan dan keperluan keselamatan. Model yang boleh menggeneralisasikan merentasi pelbagai bentuk mungkin mengurangkan kerja penyesuaian, tetapi penggunaan di lapangan masih memerlukan perkakasan yang sesuai, integrasi sistem dan pengesahan dalam persekitaran sasaran.
Laporan awam menyatakan bahawa perisian Skild beroperasi pada ratusan robot dalam kilang, pusat data dan persekitaran logistik. Contoh yang dilaporkan termasuk kilang NVIDIA di Houston, percubaan di LaGuardia serta kerja dengan syarikat pendawaian dan pembinaan. Skild turut mengumumkan hubungan dengan ABB Robotics, Universal Robots dan NVIDIA. 17
4
Skild juga dilaporkan akan menguji modelnya melalui kerjasama dengan Foxconn dan NVIDIA pada barisan pemasangan yang membina sistem pelayan GPU NVIDIA Blackwell di Houston, Texas. Ini menunjukkan usaha ujian atau penggunaan yang dirancang, bukannya bukti bahawa kilang beroperasi secara autonomi secara meluas. 43
Setakat bukti awam yang tersedia, tiada data mencukupi untuk mengira kadar penyelesaian pengeluaran, masa operasi, penjimatan kos atau pulangan pelaburan secara bebas. Keputusan ujian makmal juga tidak boleh dianggap sebagai metrik pengeluaran.
Pembiayaan besar menjadikan Skild antara usaha yang paling diperhatikan dalam bidang AI fizikal, iaitu kecerdasan buatan yang berinteraksi dengan dunia sebenar melalui robot. Bloomberg melaporkan bahawa syarikat itu mengumpulkan kira-kira AS$1.4 bilion dalam pusingan Siri C yang diketuai SoftBank pada Januari 2026, dengan penilaian melebihi AS$14 bilion. 13
Pusingan Siri A Skild yang diumumkan pada Julai 2024 pula bernilai AS$300 juta, pada penilaian yang dilaporkan sebanyak AS$1.5 bilion. 9
Ungkapan “detik ChatGPT untuk robot” menggambarkan perubahan pengalaman pengguna yang diharapkan: pekerja tidak perlu memprogram atau melatih semula robot untuk setiap tugasan. Mereka hanya perlu menunjukkan contoh, kemudian model umum menterjemahkan demonstrasi itu kepada tindakan fizikal.
S1 ialah langkah penting ke arah antara muka tersebut, tetapi ia belum membuktikan bahawa robot tujuan umum telah tiba. Keputusan terkuat yang tersedia masih dilaporkan oleh syarikat, set tugasan yang ditunjukkan adalah terhad dan metrik penggunaan industri yang disahkan secara bebas belum tersedia.
Kesimpulan yang lebih berimbang ialah S1 menunjukkan pendekatan yang menjanjikan untuk mengurangkan latihan robot khusus tugasan: gunakan video sebagai arahan, manfaatkan kemahiran yang diperoleh melalui pralatihan dan uji sama ada kemahiran itu boleh digabungkan menjadi tugasan baharu yang panjang.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI mendakwa S1 boleh melaksanakan tugasan berbilang langkah yang belum pernah dilihat sehingga 10 minit selepas menonton satu video manusia, tanpa penalaan halus atau latihan pasca pemerhatian.
Skild AI mendakwa S1 boleh melaksanakan tugasan berbilang langkah yang belum pernah dilihat sehingga 10 minit selepas menonton satu video manusia, tanpa penalaan halus atau latihan pasca pemerhatian. S1 menganggap video sebagai arahan ketika inferens, kemudian menggabungkan kemahiran yang dipelajari semasa pralatihan untuk menghasilkan tindakan dalam persekitaran robot semasa.
Strategi Skild Brain melatih satu model merentasi pelbagai bentuk robot dan simulasi, tetapi bukti awam masih belum menetapkan kadar penyelesaian, masa operasi, penjimatan kos atau pulangan pelaburan pada tahap pengel...