Skild AI mengatakan S1 dapat menjalankan tugas multi langkah yang belum pernah dilihat sebelumnya hingga 10 menit setelah menonton satu video manusia, tanpa fine tuning; pada evaluasi internal, tingkat keberhasilan pe... S1 memperlakukan video sebagai instruksi saat inferensi, lalu menggabungkan keterampilan yang di...
Diterbitkan olehDiedit dengan GPT-5.6 LunaGambar dibuat dengan GPT Image 1.5
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI ingin membuat pemrograman robot terasa lebih seperti mengajari lewat contoh. Seseorang memperagakan sebuah tugas dalam video, lalu model menggunakan demonstrasi itu sebagai petunjuk visual untuk menjalankan tugas—tanpa memulai pelatihan khusus dari awal. Menurut Skild, S1 dapat menangani tugas manipulasi multi-langkah yang belum pernah dilihat sebelumnya, dengan durasi hingga 10 menit, tanpa fine-tuning atau siklus pelatihan tambahan setelah observasi. 1
Perbedaan ini penting karena sistem robotik biasanya membutuhkan banyak data khusus tugas, teleoperasi, rekayasa, atau pelatihan ulang sebelum mampu mengerjakan pekerjaan baru. S1 tidak diklaim sekadar menghafal setiap frame video. Tujuannya adalah memahami sasaran demonstrasi, kemudian menyusun keterampilan yang sudah dipelajari—seperti menggenggam, memindahkan, meletakkan, dan memanipulasi benda—menjadi urutan tindakan baru.
S1 menggunakan visual in-context learning, atau pembelajaran kontekstual visual. Demonstrasi manusia berfungsi sebagai prompt tugas pada saat inferensi. Model mengamati apa yang dilakukan, menyimpulkan tujuan dan urutannya, lalu menerjemahkan informasi tersebut menjadi tindakan robot di lingkungan yang sedang dihadapi. Berdasarkan penjelasan Skild, bobot model tidak diubah setiap kali menerima demonstrasi baru. 1
Pendekatan ini lebih mirip “menunjukkan apa yang harus dilakukan” daripada melatih robot secara konvensional. Model perlu menghubungkan pengamatan visual dengan keterampilan yang telah diperoleh sebelumnya, lalu menempatkannya dalam urutan prosedur yang lebih panjang. Contoh publik dari Skild mencakup membuat kopi pour-over, menanam tanaman ke pot, merakit kit, dan membalik panekuk. 1
35
Tantangan utamanya adalah long horizon, yakni tugas dengan rentang tindakan panjang. Gerakan singkat dapat diprogram atau dipelajari secara terpisah, tetapi tugas selama 10 menit bisa memuat puluhan keputusan, perubahan posisi benda, serta banyak peluang terjadinya kesalahan. S1 dirancang untuk mempertahankan tujuan sepanjang rangkaian tersebut dan menyesuaikan tindakan dengan kondisi sekitar, bukan sekadar mengulang persis gerakan manusia dalam video.
Skild melaporkan perbedaan besar antara prompt video dan prompt bahasa dalam evaluasi tugas yang belum pernah dilihat sebelumnya. Pada skala pelatihan yang disebut mencapai 100.000 jam, kebijakan yang dipandu video memperoleh tingkat keberhasilan rata-rata 66% per langkah, sedangkan kebijakan vision-language-action yang dipandu bahasa mencapai 9%. 32
Hasil ini mengindikasikan bahwa demonstrasi visual dapat menyampaikan detail fisik yang mungkin ambigu jika hanya dijelaskan dengan kata-kata: benda mana yang harus digenggam, orientasinya, urutan tindakan, serta cara merespons perubahan di lingkungan. Namun, angka tersebut perlu dibaca secara hati-hati. Angka itu berasal dari evaluasi yang dilaporkan Skild dan bukan tolok ukur industri yang telah direplikasi secara independen. Selain itu, keberhasilan per langkah sebesar 66% tidak berarti robot dijamin menyelesaikan seluruh tugas 10 menit dari awal hingga akhir dengan peluang 66%.
Demonstrasi publik mencakup tugas manipulasi seperti:
Contoh-contoh ini menarik karena menggabungkan persepsi, penanganan benda, pengurutan tindakan, dan kontrol berkelanjutan—bukan hanya menguji satu gerakan terisolasi. Skild menyebut tugas-tugas tersebut tidak termasuk dalam data prapelatihan, meski bukti yang tersedia terutama berasal dari perusahaan dan laporan yang merangkum klaimnya. 1
33
Demonstrasi itu memperlihatkan antarmuka yang ingin ditawarkan: manusia melakukan tugas sekali, lalu robot mencoba menggeneralisasikan prosedurnya. Namun, hal tersebut belum membuktikan bahwa S1 dapat diandalkan untuk semua pekerjaan rumah tangga, beroperasi tanpa pengawasan, atau menghadapi setiap variasi fisik di lingkungan produksi.
Keunggulan yang diiklankan S1 adalah kemampuannya mulai beroperasi setelah mengamati demonstrasi, tanpa fase pelatihan tambahan khusus tugas. Skild dan laporan mengenai peluncurannya menyebut eksekusi in-context secara real-time. 1
30
Meski demikian, sumber yang tersedia belum memberikan ukuran latensi yang tepat dan dapat diandalkan—misalnya, berapa detik jeda antara video selesai diputar dan robot melakukan gerakan pertama. Istilah “tanpa fine-tuning” berarti model tidak menjalani pembaruan bobot baru untuk tugas tertentu. Istilah itu tidak otomatis berarti setiap video diproses seketika atau robot tidak memerlukan persiapan, kalibrasi, dan pemeriksaan keselamatan.
S1 merupakan bagian dari strategi Skild Brain, yaitu membangun model serbaguna yang dilatih pada berbagai tugas, bentuk robot, simulasi, dan data visual manusia. Pendekatan ini berbeda dari pembuatan satu kebijakan terpisah untuk setiap robot dan pekerjaan. Skild mengatakan telah menciptakan semesta simulasi berisi 100.000 varian robot dan menguji kemampuan generalisasi pada bentuk robot yang tidak disertakan dalam pelatihan. 6
Pelatihan lintas bentuk robot dimaksudkan untuk membantu model mempelajari prinsip kontrol yang lebih umum. Materi Skild menggambarkan sistem yang dapat bekerja pada robot humanoid, robot berkaki empat, lengan robot di atas meja, dan manipulator bergerak. 3
10
Klaim bahwa Skild memiliki data 100 hingga 1.000 kali lebih banyak daripada pesaing perlu diperlakukan dengan hati-hati. Sumber yang tersedia tidak memberikan perbandingan terstandardisasi dan dapat diaudit secara independen mengenai ukuran, kualitas, atau pengalaman robot yang berguna di antara perusahaan-perusahaan tersebut. Kesimpulan yang lebih kuat adalah bahwa Skild mengejar skala melalui pelatihan lintas bentuk robot dan simulasi, bukan hanya melalui demonstrasi khusus untuk satu platform perangkat keras.
“Omni-bodied” adalah istilah Skild untuk model yang ditujukan agar dapat berpindah di antara berbagai bentuk robot. Secara prinsip, model bersama dapat mempelajari konsep tingkat tugas secara terpisah dari geometri mesin tertentu. Dengan begitu, model diharapkan dapat beradaptasi pada robot dengan lengan, roda, manipulator, dan susunan aktuator yang berbeda. Skild mengatakan pengujian simulasi mereka mencakup bentuk robot yang tidak ada dalam data pelatihan dan dikendalikan secara zero-shot. 6
Namun, perangkat keras tetap sangat penting. Robot berbeda dalam hal sensor, gripper, batas gerak sendi, antarmuka kontrol, latensi, kapasitas beban, dan batas keselamatan. Model yang mampu melakukan generalisasi lintas bentuk robot mungkin mengurangi pekerjaan adaptasi, tetapi penerapan di dunia nyata tetap membutuhkan perangkat keras yang kompatibel, integrasi sistem, dan validasi di lingkungan sasaran.
Laporan publik menyebut perangkat lunak Skild telah berjalan pada ratusan robot di pabrik, pusat data, dan lingkungan logistik. Contoh yang diberitakan mencakup pabrik NVIDIA di Houston, uji coba di LaGuardia, serta kerja sama dengan perusahaan di bidang pengkabelan dan konstruksi. Skild juga mengumumkan hubungan dengan ABB Robotics, Universal Robots, dan NVIDIA. 17
4
Laporan tersebut menunjukkan adanya minat komersial dan pengujian di dunia nyata. Namun, bukti publik yang tersedia belum cukup untuk menghitung tingkat penyelesaian produksi, uptime, penghematan biaya, atau return on investment secara independen. Hasil evaluasi laboratorium tidak boleh dianggap sebagai metrik produksi. Satu laporan juga menyebut rencana penerapan bersama Foxconn pada lini perakitan yang berkaitan dengan sistem server GPU NVIDIA Blackwell. Ini menunjukkan upaya pengujian atau penerapan, bukan bukti bahwa robot otonom telah mengoperasikan pabrik secara luas. 43
Pendanaan besar membuat pendekatan Skild menjadi salah satu upaya di bidang physical AI yang paling banyak diperhatikan. Bloomberg melaporkan bahwa perusahaan tersebut mengumpulkan sekitar US$1,4 miliar dalam pendanaan Series C yang dipimpin SoftBank pada Januari 2026, dengan valuasi di atas US$14 miliar. 13 Sebelumnya, Series A yang diumumkan pada Juli 2024 bernilai US$300 juta, dengan valuasi perusahaan yang dilaporkan mencapai US$1,5 miliar.
9
Analogi “momen ChatGPT” menggambarkan perubahan pengalaman pengguna yang diharapkan: alih-alih memprogram atau melatih ulang robot untuk setiap pekerjaan, seorang pekerja dapat memperagakan perilaku yang diinginkan dan membiarkan model umum menerjemahkannya menjadi tindakan. S1 merupakan langkah penting menuju antarmuka semacam itu.
Namun, S1 belum menjadi bukti bahwa robot serbaguna telah benar-benar hadir. Hasil publik terkuat masih berasal dari laporan perusahaan, jenis tugas yang diperagakan masih terbatas, dan metrik industri yang diverifikasi secara independen belum tersedia dalam bukti yang ada. Kesimpulan yang lebih terukur adalah bahwa S1 menunjukkan cara menjanjikan untuk mengurangi pelatihan robot yang spesifik terhadap tugas: gunakan video sebagai instruksi, manfaatkan keterampilan yang diperoleh dari prapelatihan, lalu uji apakah keterampilan tersebut dapat dirangkai menjadi tugas baru dengan rentang tindakan panjang.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Skild AI mengatakan S1 dapat menjalankan tugas multi langkah yang belum pernah dilihat sebelumnya hingga 10 menit setelah menonton satu video manusia, tanpa fine tuning; pada evaluasi internal, tingkat keberhasilan pe...
Skild AI mengatakan S1 dapat menjalankan tugas multi langkah yang belum pernah dilihat sebelumnya hingga 10 menit setelah menonton satu video manusia, tanpa fine tuning; pada evaluasi internal, tingkat keberhasilan pe... S1 memperlakukan video sebagai instruksi saat inferensi, lalu menggabungkan keterampilan yang dipelajari sebelumnya menjadi rangkaian tindakan sesuai lingkungan robot.
Strategi Skild Brain melatih satu model pada berbagai bentuk robot dan simulasi, tetapi bukti publik belum cukup untuk memastikan tingkat penyelesaian, uptime, penghematan biaya, atau ROI di lingkungan produksi.
Skild AI mengatakan S1 dapat menjalankan tugas multi langkah yang belum pernah dilihat sebelumnya hingga 10 menit setelah menonton satu video manusia, tanpa fine tuning; pada evaluasi internal, tingkat keberhasilan pe... S1 memperlakukan video sebagai instruksi saat inferensi, lalu menggabungkan keterampilan yang di...
Diterbitkan olehDiedit dengan GPT-5.6 LunaGambar dibuat dengan GPT Image 1.5
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI ingin membuat pemrograman robot terasa lebih seperti mengajari lewat contoh. Seseorang memperagakan sebuah tugas dalam video, lalu model menggunakan demonstrasi itu sebagai petunjuk visual untuk menjalankan tugas—tanpa memulai pelatihan khusus dari awal. Menurut Skild, S1 dapat menangani tugas manipulasi multi-langkah yang belum pernah dilihat sebelumnya, dengan durasi hingga 10 menit, tanpa fine-tuning atau siklus pelatihan tambahan setelah observasi. 1
Perbedaan ini penting karena sistem robotik biasanya membutuhkan banyak data khusus tugas, teleoperasi, rekayasa, atau pelatihan ulang sebelum mampu mengerjakan pekerjaan baru. S1 tidak diklaim sekadar menghafal setiap frame video. Tujuannya adalah memahami sasaran demonstrasi, kemudian menyusun keterampilan yang sudah dipelajari—seperti menggenggam, memindahkan, meletakkan, dan memanipulasi benda—menjadi urutan tindakan baru.
S1 menggunakan visual in-context learning, atau pembelajaran kontekstual visual. Demonstrasi manusia berfungsi sebagai prompt tugas pada saat inferensi. Model mengamati apa yang dilakukan, menyimpulkan tujuan dan urutannya, lalu menerjemahkan informasi tersebut menjadi tindakan robot di lingkungan yang sedang dihadapi. Berdasarkan penjelasan Skild, bobot model tidak diubah setiap kali menerima demonstrasi baru. 1
Pendekatan ini lebih mirip “menunjukkan apa yang harus dilakukan” daripada melatih robot secara konvensional. Model perlu menghubungkan pengamatan visual dengan keterampilan yang telah diperoleh sebelumnya, lalu menempatkannya dalam urutan prosedur yang lebih panjang. Contoh publik dari Skild mencakup membuat kopi pour-over, menanam tanaman ke pot, merakit kit, dan membalik panekuk. 1
35
Tantangan utamanya adalah long horizon, yakni tugas dengan rentang tindakan panjang. Gerakan singkat dapat diprogram atau dipelajari secara terpisah, tetapi tugas selama 10 menit bisa memuat puluhan keputusan, perubahan posisi benda, serta banyak peluang terjadinya kesalahan. S1 dirancang untuk mempertahankan tujuan sepanjang rangkaian tersebut dan menyesuaikan tindakan dengan kondisi sekitar, bukan sekadar mengulang persis gerakan manusia dalam video.
Skild melaporkan perbedaan besar antara prompt video dan prompt bahasa dalam evaluasi tugas yang belum pernah dilihat sebelumnya. Pada skala pelatihan yang disebut mencapai 100.000 jam, kebijakan yang dipandu video memperoleh tingkat keberhasilan rata-rata 66% per langkah, sedangkan kebijakan vision-language-action yang dipandu bahasa mencapai 9%. 32
Hasil ini mengindikasikan bahwa demonstrasi visual dapat menyampaikan detail fisik yang mungkin ambigu jika hanya dijelaskan dengan kata-kata: benda mana yang harus digenggam, orientasinya, urutan tindakan, serta cara merespons perubahan di lingkungan. Namun, angka tersebut perlu dibaca secara hati-hati. Angka itu berasal dari evaluasi yang dilaporkan Skild dan bukan tolok ukur industri yang telah direplikasi secara independen. Selain itu, keberhasilan per langkah sebesar 66% tidak berarti robot dijamin menyelesaikan seluruh tugas 10 menit dari awal hingga akhir dengan peluang 66%.
Demonstrasi publik mencakup tugas manipulasi seperti:
Contoh-contoh ini menarik karena menggabungkan persepsi, penanganan benda, pengurutan tindakan, dan kontrol berkelanjutan—bukan hanya menguji satu gerakan terisolasi. Skild menyebut tugas-tugas tersebut tidak termasuk dalam data prapelatihan, meski bukti yang tersedia terutama berasal dari perusahaan dan laporan yang merangkum klaimnya. 1
33
Demonstrasi itu memperlihatkan antarmuka yang ingin ditawarkan: manusia melakukan tugas sekali, lalu robot mencoba menggeneralisasikan prosedurnya. Namun, hal tersebut belum membuktikan bahwa S1 dapat diandalkan untuk semua pekerjaan rumah tangga, beroperasi tanpa pengawasan, atau menghadapi setiap variasi fisik di lingkungan produksi.
Keunggulan yang diiklankan S1 adalah kemampuannya mulai beroperasi setelah mengamati demonstrasi, tanpa fase pelatihan tambahan khusus tugas. Skild dan laporan mengenai peluncurannya menyebut eksekusi in-context secara real-time. 1
30
Meski demikian, sumber yang tersedia belum memberikan ukuran latensi yang tepat dan dapat diandalkan—misalnya, berapa detik jeda antara video selesai diputar dan robot melakukan gerakan pertama. Istilah “tanpa fine-tuning” berarti model tidak menjalani pembaruan bobot baru untuk tugas tertentu. Istilah itu tidak otomatis berarti setiap video diproses seketika atau robot tidak memerlukan persiapan, kalibrasi, dan pemeriksaan keselamatan.
S1 merupakan bagian dari strategi Skild Brain, yaitu membangun model serbaguna yang dilatih pada berbagai tugas, bentuk robot, simulasi, dan data visual manusia. Pendekatan ini berbeda dari pembuatan satu kebijakan terpisah untuk setiap robot dan pekerjaan. Skild mengatakan telah menciptakan semesta simulasi berisi 100.000 varian robot dan menguji kemampuan generalisasi pada bentuk robot yang tidak disertakan dalam pelatihan. 6
Pelatihan lintas bentuk robot dimaksudkan untuk membantu model mempelajari prinsip kontrol yang lebih umum. Materi Skild menggambarkan sistem yang dapat bekerja pada robot humanoid, robot berkaki empat, lengan robot di atas meja, dan manipulator bergerak. 3
10
Klaim bahwa Skild memiliki data 100 hingga 1.000 kali lebih banyak daripada pesaing perlu diperlakukan dengan hati-hati. Sumber yang tersedia tidak memberikan perbandingan terstandardisasi dan dapat diaudit secara independen mengenai ukuran, kualitas, atau pengalaman robot yang berguna di antara perusahaan-perusahaan tersebut. Kesimpulan yang lebih kuat adalah bahwa Skild mengejar skala melalui pelatihan lintas bentuk robot dan simulasi, bukan hanya melalui demonstrasi khusus untuk satu platform perangkat keras.
“Omni-bodied” adalah istilah Skild untuk model yang ditujukan agar dapat berpindah di antara berbagai bentuk robot. Secara prinsip, model bersama dapat mempelajari konsep tingkat tugas secara terpisah dari geometri mesin tertentu. Dengan begitu, model diharapkan dapat beradaptasi pada robot dengan lengan, roda, manipulator, dan susunan aktuator yang berbeda. Skild mengatakan pengujian simulasi mereka mencakup bentuk robot yang tidak ada dalam data pelatihan dan dikendalikan secara zero-shot. 6
Namun, perangkat keras tetap sangat penting. Robot berbeda dalam hal sensor, gripper, batas gerak sendi, antarmuka kontrol, latensi, kapasitas beban, dan batas keselamatan. Model yang mampu melakukan generalisasi lintas bentuk robot mungkin mengurangi pekerjaan adaptasi, tetapi penerapan di dunia nyata tetap membutuhkan perangkat keras yang kompatibel, integrasi sistem, dan validasi di lingkungan sasaran.
Laporan publik menyebut perangkat lunak Skild telah berjalan pada ratusan robot di pabrik, pusat data, dan lingkungan logistik. Contoh yang diberitakan mencakup pabrik NVIDIA di Houston, uji coba di LaGuardia, serta kerja sama dengan perusahaan di bidang pengkabelan dan konstruksi. Skild juga mengumumkan hubungan dengan ABB Robotics, Universal Robots, dan NVIDIA. 17
4
Laporan tersebut menunjukkan adanya minat komersial dan pengujian di dunia nyata. Namun, bukti publik yang tersedia belum cukup untuk menghitung tingkat penyelesaian produksi, uptime, penghematan biaya, atau return on investment secara independen. Hasil evaluasi laboratorium tidak boleh dianggap sebagai metrik produksi. Satu laporan juga menyebut rencana penerapan bersama Foxconn pada lini perakitan yang berkaitan dengan sistem server GPU NVIDIA Blackwell. Ini menunjukkan upaya pengujian atau penerapan, bukan bukti bahwa robot otonom telah mengoperasikan pabrik secara luas. 43
Pendanaan besar membuat pendekatan Skild menjadi salah satu upaya di bidang physical AI yang paling banyak diperhatikan. Bloomberg melaporkan bahwa perusahaan tersebut mengumpulkan sekitar US$1,4 miliar dalam pendanaan Series C yang dipimpin SoftBank pada Januari 2026, dengan valuasi di atas US$14 miliar. 13 Sebelumnya, Series A yang diumumkan pada Juli 2024 bernilai US$300 juta, dengan valuasi perusahaan yang dilaporkan mencapai US$1,5 miliar.
9
Analogi “momen ChatGPT” menggambarkan perubahan pengalaman pengguna yang diharapkan: alih-alih memprogram atau melatih ulang robot untuk setiap pekerjaan, seorang pekerja dapat memperagakan perilaku yang diinginkan dan membiarkan model umum menerjemahkannya menjadi tindakan. S1 merupakan langkah penting menuju antarmuka semacam itu.
Namun, S1 belum menjadi bukti bahwa robot serbaguna telah benar-benar hadir. Hasil publik terkuat masih berasal dari laporan perusahaan, jenis tugas yang diperagakan masih terbatas, dan metrik industri yang diverifikasi secara independen belum tersedia dalam bukti yang ada. Kesimpulan yang lebih terukur adalah bahwa S1 menunjukkan cara menjanjikan untuk mengurangi pelatihan robot yang spesifik terhadap tugas: gunakan video sebagai instruksi, manfaatkan keterampilan yang diperoleh dari prapelatihan, lalu uji apakah keterampilan tersebut dapat dirangkai menjadi tugas baru dengan rentang tindakan panjang.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Skild AI mengatakan S1 dapat menjalankan tugas multi langkah yang belum pernah dilihat sebelumnya hingga 10 menit setelah menonton satu video manusia, tanpa fine tuning; pada evaluasi internal, tingkat keberhasilan pe...
Skild AI mengatakan S1 dapat menjalankan tugas multi langkah yang belum pernah dilihat sebelumnya hingga 10 menit setelah menonton satu video manusia, tanpa fine tuning; pada evaluasi internal, tingkat keberhasilan pe... S1 memperlakukan video sebagai instruksi saat inferensi, lalu menggabungkan keterampilan yang dipelajari sebelumnya menjadi rangkaian tindakan sesuai lingkungan robot.
Strategi Skild Brain melatih satu model pada berbagai bentuk robot dan simulasi, tetapi bukti publik belum cukup untuk memastikan tingkat penyelesaian, uptime, penghematan biaya, atau ROI di lingkungan produksi.