מערך האימון כלל מעל 1,000,000 שעות של וידאו אנושי אגוצנטרי (מגוף ראשון) – שווה ערך לכ-170 שנות ניסיון רצוף . הסרטונים תיעדו משימות יומיומיות כמו בישול, קיפול, הרכבה וניקוי . בשלב האימון המקדים לא נעשה שימוש בנתוני רובוט; נתוני רובוט הוכנסו רק במהלך שלב ה-post-training או ה-fine-tuning, בדרך כלל 10 שעות או פחות לכל משימה .
במהלך האימון המקדים, DYNA-2 השתמש באובייקטיב חיזוי וידאו (video prediction) – למידה לחזות פריימים עתידיים של וידאו מתצפיות עבר – יחד עם אלגוריתם co-training וידאו (video co-training algorithm) הלומד ייצוגים חזותיים וחיזוי פעולות במקביל . גישה זו מנוגדת לארכיטקטורת VLA של DYNA-1, הממפה תפיסה ישירות לפעולות רובוט ללא חיזוי וידאו ביניים .
החברה הדגימה קנה מידה לאורך ארבעה סדרי גודל, מ-1,000 שעות ועד 1,000,000 שעות של נתוני אימון מקדים .
החברה ביצעה השוואות ישירות בין DYNA-2 ל-DYNA-1 בתנאי אימון תואמים ופריסה בעולם האמיתי.
הביצועים המנורמלים הממוצעים עלו באופן מונוטוני עם קנה מידה: 20% → 28% → 45% → 53% מהמקסימום האפשרי ככל שקנה המידה גדל מ-1k → 10k → 100k → 1M שעות . בקנה המידה של 1M שעות, DYNA-2 השיג את הביצועים החזקים ביותר בעולם האמיתי ב-9 מתוך 14 משימות . שיפורים עיקריים במשימות ספציפיות:
Dyna Robotics דיווחה על מה שהיא מכנה "חוק קנה המידה האמיתי הראשון ברובוטיקה המופעל כולו על ידי נתוני אדם" . מאפיינים עיקריים:
החברה מצהירה במפורש שזוהי הדגמה "ראשונה מסוגה" לכך שהגדלת נתוני התבוננות אנושיים, לא נתוני פעולה של רובוט, יכולה לשמש כציר אמין לשיפור האינטליגנציה הפיזית של רובוטים .
אם הטענות עומדות באימות בלתי תלוי, Dyna Robotics הראתה דרך מעשית להרחיב את האינטליגנציה הרובוטית ללא צוואר הבקבוק של איסוף נתוני פעולה יקרים של רובוט. וידאו אנושי קיים בהיקף בלתי מוגבל למעשה. החברה אומרת שהיא כבר עובדת לקראת 10 מיליון שעות של נתוני אימון, מה שיאפשר לרובוטים לשלוט במשימות פיזיות חדשות עם שעות בודדות של fine-tuning מקומי .