Dataset pelatihan terdiri dari lebih dari 1.000.000 jam video egosentris (sudut pandang orang pertama) manusia — yang setara dengan sekitar 170 tahun pengalaman sadar terus-menerus . Video-video tersebut merekam tugas-tugas manipulasi sehari-hari seperti memasak, melipat, merakit, dan membersihkan . Tidak ada data aksi robot yang digunakan selama pra-pelatihan; data robot baru diperkenalkan selama tahap pasca-pelatihan atau fine-tuning yang singkat, biasanya 10 jam atau kurang per tugas .
Selama pra-pelatihan, DYNA-2 menggunakan tujuan prediksi video — belajar memprediksi bingkai video masa depan dari pengamatan masa lalu — yang dikombinasikan dengan algoritma video co-training yang secara bersama-sama mempelajari representasi visual dan prediksi tindakan . Pendekatan ini sangat kontras dengan arsitektur VLA milik DYNA-1, yang secara langsung memetakan persepsi ke tindakan robot tanpa prediksi video perantara .
Perusahaan mendemonstrasikan penskalaan hingga empat kali lipat, dari 1.000 jam hingga 1.000.000 jam data pra-pelatihan .
Perusahaan melakukan perbandingan langsung antara DYNA-2 dan DYNA-1 dalam kondisi pelatihan yang sama dan penerapan di dunia nyata.
Performa normal rata-rata meningkat secara monoton seiring skala pra-pelatihan: 20% → 28% → 45% → 53% dari maksimum yang dapat dicapai saat data diskalakan dari 1rb → 10rb → 100rb → 1 juta jam . Pada skala 1 juta jam, DYNA-2 mencapai performa dunia nyata terkuat pada 9 dari 14 tugas . Peningkatan tingkat tugas utama meliputi:
Dyna Robotics melaporkan apa yang mereka sebut "hukum skala sejati pertama di bidang robotika yang sepenuhnya didukung oleh data manusia" . Karakteristik utamanya:
Perusahaan secara eksplisit menyatakan bahwa ini adalah demonstrasi "pertama dari jenisnya" bahwa penskalaan data observasi manusia, bukan data aksi robot, dapat berfungsi sebagai sumbu yang andal untuk meningkatkan kecerdasan robot fisik .
Jika klaim ini terbukti benar melalui verifikasi independen, Dyna Robotics telah menunjukkan jalur praktis untuk meningkatkan kecerdasan robot tanpa hambatan dalam mengumpulkan data aksi robot yang mahal. Video manusia tersedia dalam skala yang hampir tidak terbatas. Perusahaan mengatakan bahwa mereka sedang bekerja menuju 10 juta jam data pelatihan, yang akan memungkinkan robot untuk menguasai tugas fisik baru hanya dengan beberapa jam penyesuaian lokal .