HOST dan GEN-1.5 menunjukkan robot boleh belajar dengan cara “tengok dan buat”
HOST, dibangunkan oleh Beijing Institute of Technology, X Square Robot dan Tsinghua University, memperoleh kemahiran baharu daripada satu video manusia dalam purata 29 saat, dengan kadar kejayaan purata 62% dalam ujia... GEN 1.5 daripada Generalist AI menggunakan demonstrasi selama 3 hingga 12 saat sebagai “gesaan f...
HOST, dibangunkan oleh Beijing Institute of Technology, X Square Robot dan Tsinghua University, memperoleh kemahiran baharu daripada satu video manusia dalam purata 29 saat, dengan kadar kejayaan purata 62% dalam ujia...
GEN 1.5 daripada Generalist AI menggunakan demonstrasi selama 3 hingga 12 saat sebagai “gesaan fizikal” dalam konteks model, tanpa kemas kini gradien atau penalaan halus bagi mod satu demonstrasi.
Kedua duanya mengurangkan keperluan latihan khusus tugas, tetapi robot masih bergantung pada pralatihan berskala besar dan keputusan GEN 1.5 belum disahkan secara bebas melalui penanda aras awam yang setara.
How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from GeneralAI-generated editorial hero image for How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General.
AI Prompt
Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
openai.com
Dua usaha ini menandakan perubahan penting dalam pembelajaran robot: daripada melatih semula robot untuk setiap tugasan kepada pembelajaran semasa inferens. Dalam pendekatan ini, model yang telah dipralatih menganggap video demonstrasi sebagai konteks, kemudian mengawal robot untuk mencuba tugasan itu dengan segera.
HOST menawarkan bukti akademik yang lebih terperinci. GEN-1.5 pula menunjukkan potensi besar melalui laporan Generalist AI, tetapi hasilnya belum mempunyai pengesahan bebas yang setanding.
Perbandingan HOST dan GEN-1.5
Aspek
HOST
GEN-1.5
Mekanisme utama
Polisi peniruan visual satu percubaan yang menyelaraskan tindakan robot dengan tahap kemajuan dalam video manusia. Sistem turut meramal hasil daripada perspektif robot sendiri sebelum menentukan tindakan yang diperlukan.
Model asas multimodal untuk robot yang menganggap demonstrasi sensorimotor sebagai “gesaan fizikal” dalam konteks, lalu menghasilkan tindakan robot.
Input dan output
Video manusia, arahan bahasa, pemerhatian robot terkini serta maklumat proprioseptif—iaitu keadaan dalaman badan robot seperti posisi sendi. Sistem menghasilkan tindakan tanpa mengemas kini parameter model.
Memori video sehingga kira-kira 30 saat, bersama input sensor, bahasa dan propriosepsi. Model menghasilkan trajektori tindakan pada kadar 100 Hz.
Asas latihan
Dua peringkat: pralatihan menggunakan 193,462 trajektori robot merentasi 229 tugas, kemudian penyesuaian menggunakan 5,847 pasangan video manusia dan trajektori robot yang dikumpulkan sendiri.
Generalist AI melaporkan latihan berterusan selama lebih lapan bulan menggunakan data interaksi fizikal sebenar, tanpa data simulasi dalam pralatihan.
Tempoh demonstrasi tunggal
Purata sekitar 29 saat untuk memperoleh satu kemahiran.
Antara 3 hingga 12 saat bagi satu demonstrasi.
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "HOST dan GEN-1.5 menunjukkan robot boleh belajar dengan cara “tengok dan buat”"?
HOST, dibangunkan oleh Beijing Institute of Technology, X Square Robot dan Tsinghua University, memperoleh kemahiran baharu daripada satu video manusia dalam purata 29 saat, dengan kadar kejayaan purata 62% dalam ujia...
What are the key points to validate first?
HOST, dibangunkan oleh Beijing Institute of Technology, X Square Robot dan Tsinghua University, memperoleh kemahiran baharu daripada satu video manusia dalam purata 29 saat, dengan kadar kejayaan purata 62% dalam ujia... GEN 1.5 daripada Generalist AI menggunakan demonstrasi selama 3 hingga 12 saat sebagai “gesaan fizikal” dalam konteks model, tanpa kemas kini gradien atau penalaan halus bagi mod satu demonstrasi.
What should I do next in practice?
Kedua duanya mengurangkan keperluan latihan khusus tugas, tetapi robot masih bergantung pada pralatihan berskala besar dan keputusan GEN 1.5 belum disahkan secara bebas melalui penanda aras awam yang setara.
Tidak. Pemerolehan kemahiran berlaku semasa inferens tanpa kemas kini parameter khusus tugas.
Tidak bagi mod satu percubaan. Generalist AI mendakwa tiada kemas kini gradien atau penalaan halus diperlukan.
Liputan tugas
Diuji pada 50 tugas manipulasi baharu yang melibatkan objek, alatan dan gerak kerja berbeza, dengan 20 percubaan bagi setiap tugas.
Demonstrasi awam merangkumi membuka balang, membuka zip beg kecil, menyapu objek ke dalam mangkuk, memasukkan pen ke dalam cawan, menuang bolt serta penggunaan alatan dan improvisasi. Namun, set tugas awamnya tidak dihuraikan dengan tahap perincian eksperimen HOST.
Kadar kejayaan
Purata 62% pada tugas baharu.
Generalist AI melaporkan purata 59% bagi 10 tugas manipulasi pelbagai dalam mod satu demonstrasi, tetapi angka itu masih merupakan laporan syarikat dan belum disahkan melalui penilaian bebas yang setara.
Perbandingan dengan garis dasar
Dilaporkan mengatasi garis dasar peniruan sifar percubaan terkuat sebanyak 45%, malah mengatasi penalaan diselia yang menggunakan 50 demonstrasi robot bagi setiap tugas.
Apabila gesaan tunggal tidak mencukupi, syarikat menyatakan model boleh melalui penyesuaian few-shot dengan 1 hingga 10 langkah kecerunan menggunakan data selama 1 hingga 5 minit, kira-kira 10 hingga 50 demonstrasi.
Dakwaan kecekapan
Pemerolehan kemahiran dilaporkan kira-kira 507 kali lebih pantas berbanding penalaan diselia dengan 50 demonstrasi robot bagi setiap tugas.
Gesaan selama 3 hingga 12 saat menggantikan latihan tugas yang secara tradisinya memerlukan ribuan langkah kecerunan. Namun, dakwaan perbandingan ini belum diuji secara bebas melalui penanda aras yang sama.
Bagaimana HOST belajar daripada video manusia?
HOST tidak sekadar cuba menyalin pergerakan tangan manusia satu demi satu. Sebaliknya, video digunakan sebagai rujukan tentang kemajuan tugasan.
Robot menilai kedudukannya sendiri, mengenal pasti tahap semasa tugasan dan menghubungkannya dengan bahagian video yang sepadan. Sistem kemudian meramalkan rupa hasil yang perlu dicapai daripada perspektif robot sebelum membina tindakan untuk menuju ke hasil tersebut.
Pendekatan ini penting kerana robot dan manusia mempunyai tubuh, kamera, tangan serta cara pergerakan yang berbeza. Menyalin trajektori tangan secara langsung tidak semestinya menghasilkan tindakan yang betul bagi robot. Dengan menyelaraskan tahap tugasan dan bukan sekadar kedudukan mutlak, HOST cuba memindahkan niat serta urutan kerja manusia kepada badan robot yang berbeza.
Dalam ujian terhadap 50 tugas baharu, HOST mencatat kadar kejayaan purata 62%. Penilaian itu melibatkan pelbagai objek, alatan dan gerak kerja manipulasi, dengan 20 percubaan bagi setiap tugasan.
Ujian ketahanan yang dilaporkan turut menunjukkan penurunan prestasi sebanyak 1%, 4%, 6% dan 9% apabila pencahayaan, objek, persekitaran dan gangguan manusia diubah masing-masing.
Namun, angka 62% juga membawa maksud yang jelas: sistem ini masih gagal dalam kira-kira empat daripada setiap 10 percubaan secara purata. Ia menunjukkan kebolehlaksanaan pendekatan tersebut, bukan kebolehpercayaan yang sudah memadai untuk semua situasi dunia sebenar.
Bagaimana GEN-1.5 menggunakan “gesaan fizikal”?
GEN-1.5 mengambil pendekatan yang lebih menyerupai model asas umum. Demonstrasi ringkas dimasukkan ke dalam tetingkap konteks model sebagai satu arahan fizikal, bukannya digunakan untuk melatih polisi baharu dari awal.
Menurut Generalist AI, model itu boleh menggunakan video manusia, bahasa, data sensor dan propriosepsi untuk menghasilkan trajektori tindakan pada kadar 100 Hz. Ia juga didakwa boleh memindahkan demonstrasi manusia kepada robot, menggabungkan dua tingkah laku yang digesa serta menggunakan demonstrasi simulasi untuk melaksanakan tugas dalam dunia fizikal.
Contoh yang dipaparkan termasuk membuka balang, membuka zip beg kecil dan menyapu blok ke dalam mangkuk. Bagi tugasan yang lebih sukar, GEN-1.5 mempunyai laluan penyesuaian few-shot menggunakan beberapa langkah kecerunan dan beberapa minit data.
Perincian ini penting: GEN-1.5 bukan bermaksud “tiada latihan” untuk semua keadaan. Mod satu demonstrasi tidak memerlukan kemas kini model, tetapi penyesuaian tambahan masih tersedia apabila gesaan tunggal tidak mencukupi.
Apa yang sebenarnya berubah dalam pembelajaran robot?
Kedua-dua sistem menyokong antara muka pengajaran yang lebih semula jadi: tunjukkan, bukan programkan.
Secara tradisional, tugas baharu mungkin memerlukan jurutera menulis aturan pergerakan, mengumpul ratusan atau ribuan demonstrasi robot, mereka bentuk ganjaran atau menjalankan penalaan halus yang panjang. HOST dan GEN-1.5 cuba memindahkan sebahagian kerja itu kepada video ringkas yang menunjukkan manusia menyelesaikan tugasan.
Tetapi kecekapan ini tidak bermaksud robot belajar tanpa pengetahuan terdahulu. Kos besar sebenarnya telah dipindahkan ke peringkat pralatihan. Model atau polisi perlu terlebih dahulu mempelajari asas interaksi fizikal daripada data berskala besar. Demonstrasi pendek pengguna kemudian hanya menentukan matlamat, prosedur dan interaksi yang relevan untuk tugasan baharu.
HOST menjadikan pertukaran ini lebih jelas dari segi angka: purata 29 saat untuk memperoleh kemahiran dan dakwaan pemerolehan 507 kali lebih pantas berbanding penalaan menggunakan 50 demonstrasi robot bagi setiap tugas.
Batasan yang perlu diberi perhatian
HOST masih berasaskan penilaian makmal terkawal. Kajian itu ialah prapenerbitan akademik yang menguji 50 tugasan terpilih, bukan jaminan bahawa robot akan berfungsi dengan baik dalam rumah, kilang, tugasan berjangka panjang atau situasi yang melibatkan keselamatan. Kadar kejayaan purata 62% juga menunjukkan ruang penambahbaikan yang besar.
Bukti GEN-1.5 lebih sukar dinilai secara bebas. Maklumat tentang model, tempoh latihan, dakwaan tiada data simulasi, tempoh gesaan dan penyesuaian kebanyakannya datang daripada Generalist AI atau pengumuman yang berkaitan dengan syarikat itu.
Belum ada penanda aras awam yang benar-benar setara. Bukti awam yang tersedia belum menyediakan protokol percubaan standard, jumlah tugas yang boleh dibandingkan secara langsung, kadar kejayaan satu percubaan yang diaudit, garis dasar seragam, pelepasan model dan data, atau pengulangan pihak ketiga untuk GEN-1.5. Oleh itu, demonstrasinya lebih tepat dianggap sebagai bukti potensi, bukannya had prestasi robotik yang telah disahkan.
Kesimpulannya, HOST memberikan bukti bahawa robot boleh memperoleh kemahiran manipulasi baharu daripada satu video manusia tanpa mengubah parameter model dalam set ujian yang ditakrifkan. GEN-1.5 pula mencadangkan bahawa pralatihan fizikal yang cukup luas boleh menjadikan keupayaan serupa sebagai fungsi konteks dalam model robot serba guna.
Arah perkembangannya memang menarik, tetapi kesimpulan praktikalnya perlu sederhana: pembelajaran melalui pemerhatian sedang muncul sebagai kaedah baharu, bukan pengganti yang sudah terbukti untuk pengesahan tugas, kejuruteraan keselamatan dan penyesuaian dalam persekitaran terbuka.