تكونت مجموعة بيانات التدريب من أكثر من 1,000,000 ساعة من فيديو البشر من منظور الشخص الأول — وهو ما يعادل حوالي 170 عامًا من الخبرة البشرية المتواصلة . التقطت مقاطع الفيديو مهام التلاعب اليومية مثل الطي والطهي والتجميع والتنظيف . لم يتم استخدام أي بيانات حركة روبوتية خلال التدريب الأولي؛ تم إدخال بيانات الروبوت فقط خلال مرحلة صغيرة من ما بعد التدريب أو الضبط الدقيق، عادةً 10 ساعات أو أقل لكل مهمة .
خلال التدريب الأولي، استخدم DYNA-2 هدف التنبؤ بالفيديو — تعلم التنبؤ بإطارات الفيديو المستقبلية من الملاحظات الماضية — بالإضافة إلى خوارزمية التدريب المشترك للفيديو التي تتعلم بشكل مشترك التمثيلات البصرية والتنبؤ بالحركة . يتناقض هذا الأسلوب مع بنية VLA الخاصة بـ DYNA-1، التي تربط الإدراك مباشرة بأفعال الروبوت دون التنبؤ الوسيط بالفيديو .
أظهرت الشركة التوسع عبر أربعة مقاييس حجم، من 1000 ساعة إلى 1,000,000 ساعة من بيانات التدريب الأولي .
أجرت الشركة مقارنات مباشرة بين DYNA-2 و DYNA-1 في ظل ظروف تدريب متطابقة ونشر في العالم الحقيقي.
ارتفع متوسط الأداء الطبيعي بشكل رتيب مع زيادة التدريب الأولي: 20% ← 28% ← 45% ← 53% من الحد الأقصى المحقق مع زيادة البيانات من 1 ألف ← 10 آلاف ← 100 ألف ← 1 مليون ساعة . على مقياس المليون ساعة، حقق DYNA-2 أقوى أداء في العالم الحقيقي في 9 من 14 مهمة . تضمنت التحسينات الرئيسية على مستوى المهام ما يلي:
أبلغت Dyna Robotics عما تسميه "أول قانون توسع حقيقي في الروبوتات مدعوم بالكامل بالبيانات البشرية" . الخصائص الرئيسية:
تذكر الشركة صراحة أن هذا هو "الأول من نوعه" كدليل على أن توسيع بيانات المراقبة البشرية، وليس بيانات الحركة الروبوتية، يمكن أن يكون محورًا موثوقًا لتحسين الذكاء الفيزيائي للروبوت .
إذا ثبتت صحة هذه الادعاءات من خلال التحقق المستقل، فإن Dyna Robotics قد أظهرت مسارًا عمليًا لتوسيع نطاق الذكاء الروبوتي دون عنق الزجاجة المتمثل في جمع بيانات الحركة الروبوتية باهظة الثمن. الفيديو البشري موجود بمقياس غير محدود عمليًا. تقول الشركة إنها تعمل بالفعل نحو 10 ملايين ساعة من بيانات التدريب، مما سيمكن الروبوتات من إتقان مهام فيزيائية جديدة بساعات قليلة فقط من الضبط المحلي .