훈련 데이터셋은 100만 시간 이상의 1인칭(egocentric) 인간 비디오로 구성되었으며, 이는 약 170년에 달하는 연속적인 깨어있는 경험에 해당합니다 . 영상은 요리, 접기, 조립, 청소 등 일상적인 조작 작업을 담고 있습니다 . 사전 훈련 중에는 로봇 행동 데이터가 전혀 사용되지 않았으며, 로봇 데이터는 소량의 포스트 훈련 또는 미세 조정 단계에서만 도입되었습니다(보통 작업당 10시간 이하) .
사전 훈련 중 DYNA-2는 비디오 예측 목표(과거 관찰에서 미래 비디오 프레임 예측 학습)와 비디오 공동 훈련 알고리즘(시각적 표현과 행동 예측을 공동으로 학습)을 사용했습니다 . 이 접근 방식은 중간 비디오 예측 없이 지각을 로봇 동작에 직접 매핑하는 DYNA-1의 VLA 아키텍처와 대조됩니다 .
회사는 사전 훈련 데이터를 1,000시간에서 100만 시간까지 4차 규모(orders of magnitude) 에 걸쳐 확장하는 데모를 선보였습니다 .
회사는 동일한 훈련 조건과 실제 환경 배치에서 DYNA-2와 DYNA-1을 직접 비교했습니다.
정규화된 평균 성능은 사전 훈련 규모에 따라 단조롭게 증가했습니다: 1,000시간 → 20%, 10,000시간 → 28%, 100,000시간 → 45%, 100만 시간 → 53% . 100만 시간 규모에서 DYNA-2는 14개 과제 중 9개에서 가장 강력한 실제 성능을 달성했습니다 . 주요 과제별 개선 사항은 다음과 같습니다:
다이나 로보틱스는 "전적으로 인간 데이터로 구동되는 로봇 공학 최초의 진정한 스케일링 법칙" 이라고 주장하는 현상을 보고했습니다 . 주요 특징은 다음과 같습니다:
회사는 이것이 로봇 행동 데이터가 아닌 인간 관찰 데이터의 확장이 물리적 로봇 지능 향상을 위한 신뢰할 수 있는 축이 될 수 있음을 보여주는 "최초의 사례" 라고 명시적으로 밝히고 있습니다 .
이러한 주장이 독립적인 검증을 통해 확인된다면, 다이나 로보틱스는 비용이 많이 드는 로봇 행동 데이터 수집이라는 병목 현상 없이 로봇 지능을 확장할 수 있는 실용적인 경로를 제시한 것입니다. 인간 비디오는 사실상 무제한적인 규모로 존재합니다. 회사는 이미 1,000만 시간의 훈련 데이터를 목표로 작업 중이며, 이를 통해 로봇이 단 몇 시간의 현지 미세 조정만으로 새로운 물리적 작업을 마스터할 수 있게 될 것이라고 밝혔습니다 .