Figure melaporkan Helix 2.5 yang dipralatih dengan dataset Index mencapai keberhasilan zero shot 56% dengan penilaian lulus gagal penuh, dibanding 9% untuk model sebanding yang dilatih dari nol. Robot Figure 03 diuji merapikan ruang keluarga, melipat handuk, dan merapikan tempat tidur di 30 rumah Bay Area yang sebel...
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did Figure announce about Helix 2.5 and its Figure 03 humanoid robot’s ability to generalize to unfamiliar homes, including the three h. Article summary: Figure announced that Helix 2.5 enabled its Figure 03 humanoid to perform meaningful whole-body household work in homes it had never encountered—not a claim that household robotics is solved. The result is notable eviden. Topic tags: general, general web, education, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Figure mengumumkan hasil yang menarik untuk riset generalisasi robot: robot humanoid Figure 03 dengan sistem Helix 2.5 diuji mengerjakan tugas domestik di rumah-rumah yang belum pernah ditemuinya. Namun, angka utama yang dilaporkan—56% keberhasilan untuk menyelesaikan seluruh tugas—juga berarti 44% percobaan belum tuntas menurut standar penilaian yang ketat. 11
4
Figure menyatakan Helix 2.5 dipralatih memakai Index, dataset perilaku manusia milik perusahaan. Dari satu model fondasi itu, perusahaan membentuk tiga kemampuan rumah tangga:
Robot lalu diuji di 30 rumah di Bay Area—wilayah sekitar San Francisco—yang sebelumnya belum pernah dilihat sistem tersebut. Figure mengatakan tidak ada data yang dikumpulkan di rumah-rumah evaluasi, tidak ada fine-tuning atau adaptasi khusus untuk lokasi maupun objek, dan satu checkpoint model yang sama dipakai di seluruh rumah. 11
Istilah zero-shot di sini perlu dibaca dengan tepat. Artinya, robot tidak dilatih khusus untuk rumah-rumah itu atau untuk mainan, handuk, dan perlengkapan tidur yang ditemui dalam pengujian. Bukan berarti tiga kategori tugas tersebut dipelajari tanpa pelatihan spesifik sama sekali; Figure menjelaskan bahwa model fondasi itu diadaptasikan menjadi tiga perilaku tadi. 11
Dalam perbandingan terkontrol versi Figure, prapelatihan dengan Index meningkatkan tingkat keberhasilan penuh zero-shot dari 9% pada model sebanding yang dilatih dari nol menjadi 56% pada model yang dipralatih. 4
11
Penilaiannya bersifat lulus-gagal, tanpa kredit untuk hasil sebagian. Untuk merapikan ruang keluarga, semua mainan yang berserakan harus masuk ke keranjang. Melipat handuk mensyaratkan handuk dilipat dan diletakkan pada tempatnya. Untuk merapikan tempat tidur, bantal dan selimut harus ditempatkan dengan benar serta dirapikan. 4
Karena standarnya ketat, skor 56% lebih bermakna daripada angka yang memberi nilai parsial. Tetapi batasannya juga jelas: 44% percobaan tugas penuh gagal. Hasil ini merupakan bukti bahwa prapelatihan skala besar berpotensi memperbaiki transfer kemampuan ke lingkungan asing, bukan bukti bahwa robot humanoid sudah siap bekerja mandiri dan andal di rumah. 4
Gagasan utama Figure adalah pendekatan robotika dapat mengikuti pola model fondasi: pralatih sistem dengan beragam contoh perilaku fisik manusia, gunakan data robot dalam jumlah lebih kecil untuk mendefinisikan suatu perilaku, lalu terapkan di ruang baru tanpa harus mengumpulkan ulang data untuk setiap ruangan. 11
Perusahaan juga melaporkan hubungan skala: ketika jumlah data prapelatihan Index dinaikkan dalam rentang delapan kali lipat, loss prediksi aksi robot turun secara terprediksi. Figure menyebut Index saat itu menghasilkan sekitar 35 menit data pengalaman manusia setiap detik. 3
Seorang perwakilan Figure secara terpisah menyebut sekitar 90.000 kontributor aktif mingguan saat perekaman, yang kemudian meningkat menjadi lebih dari 100.000. Angka kontributor tersebut adalah pernyataan perusahaan dan bukan data yang telah diaudit independen. 28
Figure juga mengumumkan komitmen komputasi awal sebesar US$3,5 miliar melalui kemitraan dengan Nscale. Targetnya hingga 100.000 GPU Nvidia Vera Rubin, dengan penerapan yang disebut akan dimulai pada paruh kedua 2027. 3
Hasil tersebut diumumkan dan dievaluasi oleh Figure sendiri, bukan melalui tolok ukur robotika rumah tangga independen yang telah ditinjau sejawat. 11
Ke-30 rumah itu dilaporkan merupakan hunian sewa jangka pendek yang kosong, rapi, dan memiliki pencahayaan baik. Rumah yang dihuni sehari-hari menghadirkan orang, hewan peliharaan, barang berantakan, pencahayaan yang berubah-ubah, gangguan, benda tidak lazim, serta tuntutan keselamatan. Semua faktor itu dapat membuat navigasi dan manipulasi benda jauh lebih sulit. 4
Jadi, kesimpulan yang paling tepat bukanlah “robot kini bisa mengurus rumah.” Figure telah memperlihatkan demonstrasi terkontrol bahwa prapelatihan dari data perilaku manusia berskala besar mungkin mengurangi kebutuhan untuk mengumpulkan demonstrasi robot di setiap rumah baru. Namun, apakah pendekatan ini mampu mencapai tingkat keandalan dan keselamatan yang diperlukan untuk rumah biasa yang dihuni, masih belum terjawab. 11
4
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Figure melaporkan Helix 2.5 yang dipralatih dengan dataset Index mencapai keberhasilan zero shot 56% dengan penilaian lulus gagal penuh, dibanding 9% untuk model sebanding yang dilatih dari nol.
Figure melaporkan Helix 2.5 yang dipralatih dengan dataset Index mencapai keberhasilan zero shot 56% dengan penilaian lulus gagal penuh, dibanding 9% untuk model sebanding yang dilatih dari nol. Robot Figure 03 diuji merapikan ruang keluarga, melipat handuk, dan merapikan tempat tidur di 30 rumah Bay Area yang sebelumnya belum pernah ditemui, tanpa pengumpulan data, fine tuning, atau adaptasi di lokasi penguj...
Evaluasi dijalankan oleh Figure dan dilaporkan berlangsung di hunian sewa jangka pendek yang kosong, rapi, serta terang.