Robot yang mengerjakan tugas beberapa langkah tidak cukup hanya melihat keadaan saat ini. Ia perlu mengingat apa yang sudah dilakukan, mengenali ketika gerakannya meleset, lalu menentukan langkah berikutnya. Itulah masalah yang ingin ditangani HERON-CRA, model kedua dalam rangkaian HERON dari Scalabot, merek milik Songyan Dynamics, setelah HERON-World Model. Rancangannya menyatukan beberapa cara belajar, tetapi hasil yang tersedia masih berupa demonstrasi dan klaim perusahaan, bukan validasi independen.
6
14
15
Dari ingatan ke tindakan korektif
Context Expert menyimpan riwayat tugas. Komponen ini mengodekan informasi spasial dan makna adegan dari langkah-langkah sebelumnya menjadi token konteks yang terstruktur. Istilah “4D” di sini berarti informasi ruang tiga dimensi yang diikuti sepanjang waktu. Dengan begitu, keputusan robot tidak hanya bertumpu pada gambar terbaru ketika benda berpindah atau keadaan berubah.
6
9
RL Engine dirancang untuk mengoreksi gerakan. Komponen pembelajaran penguatan ini digambarkan memakai pendekatan actor–critic residual yang ringan: alih-alih mengganti kebijakan tindakan dasar, ia mempelajari penyesuaian saat tindakan menyimpang. Sebuah model nilai digunakan untuk menilai kemajuan tugas dari waktu ke waktu. Tujuannya adalah kendali yang lebih presisi dan kemampuan memulihkan tindakan, tetapi bukti yang tersedia belum memisahkan seberapa besar peningkatan yang berasal dari komponen ini saja.
5
9
Keterampilan diupayakan agar tidak terpaku pada satu robot. Prapelatihan lintas tubuh robot (cross-embodiment pretraining) dimaksudkan untuk membantu keterampilan yang dipelajari berpindah ke robot dengan bentuk tubuh berbeda. Keberhasilan dan kegagalan di dunia nyata juga dapat menjadi titik awal bagi HERON-World Model untuk menghasilkan simulasi kemungkinan urutan tindakan sebagai bahan belajar lanjutan. Ini adalah rancangan siklus belajar, bukan bukti bahwa simulasi tersebut selalu meramalkan hasil pada robot fisik dengan tepat.
7
14
15
Apa arti demonstrasinya?
Dalam pengujiannya, Scalabot melaporkan tingkat keberhasilan melipat kaus kaki naik dari 38,5% menjadi 97,8%. Kenaikan itu besar untuk tugas yang dilaporkan, tetapi tidak boleh dibaca sebagai tingkat keberhasilan robot untuk semua pekerjaan: materi yang tersedia belum menetapkan jumlah percobaan, kondisi, dan pembanding yang diperiksa secara independen.
12
Demonstrasi membuat kopi menggambarkan pentingnya mengingat riwayat dalam tugas bertahap. Demonstrasi transfer keterampilan antarrobot dan respons terhadap gangguan menunjukkan kemampuan yang ingin dicapai: memakai kembali keterampilan dan merevisi tindakan ketika keadaan berubah. Namun, demonstrasi tersebut belum menunjukkan seberapa sering sistem berhasil pada lingkungan, tubuh robot, atau gangguan yang belum dikenal.
4
6
15
Kesimpulannya: HERON-CRA menawarkan rancangan yang masuk akal untuk tugas manipulasi panjang, tetapi keandalannya masih perlu diuji secara independen dengan kondisi yang dapat dibandingkan. Pengujian yang memisahkan pengaruh memori, koreksi melalui pembelajaran penguatan, prapelatihan lintas robot, dan simulasi tindakan juga diperlukan untuk mengetahui bagian mana yang benar-benar menghasilkan peningkatan.
4
14
15