Навчальний набір даних складався з понад 1 000 000 годин егоцентричного (від першої особи) людського відео — що еквівалентно приблизно 170 рокам безперервного активного досвіду . Відео фіксували повсякденні маніпуляційні завдання: приготування їжі, складання речей, збирання конструкцій та прибирання . Під час попереднього навчання не використовувалися жодні дані про дії роботів; дані від роботів вводилися лише на етапі пост-навчання або доналаштування, зазвичай не більше 10 годин на завдання .
Під час попереднього навчання DYNA-2 використовувала мету прогнозування відео — навчання передбачати майбутні кадри на основі минулих спостережень — у поєднанні з алгоритмом спільного навчання на відео, який одночасно вивчає візуальні представлення та прогнозування дій . Цей підхід контрастує з архітектурою VLA моделі DYNA-1, яка безпосередньо відображає сприйняття в дії робота без проміжного прогнозування відео .
Компанія продемонструвала масштабування в чотирьох порядках величини: від 1 000 годин до 1 000 000 годин попереднього навчання .
Компанія провела прямі порівняння між DYNA-2 та DYNA-1 в однакових умовах навчання та реального використання.
Середня нормалізована продуктивність монотонно зростала зі збільшенням обсягу попереднього навчання: 20% → 28% → 45% → 53% від досяжного максимуму при масштабуванні даних від 1 тис. → 10 тис. → 100 тис. → 1 млн годин . При 1 млн годин DYNA-2 досягла найкращої реальної продуктивності в 9 з 14 завдань . Ключові покращення:
Dyna Robotics повідомила про те, що вона називає «першим справжнім законом масштабування в робототехніці, який повністю базується на людських даних» . Ключові характеристики:
Компанія прямо заявляє, що це «перша в своєму роді» демонстрація того, що масштабування людських спостережних даних, а не даних про дії роботів, може слугувати надійною віссю для покращення фізичного інтелекту роботів .
Якщо заявлені результати підтвердяться незалежною верифікацією, Dyna Robotics показала практичний шлях до масштабування інтелекту роботів без вузького місця збору дорогих даних про дії роботів. Людське відео існує в практично необмежених масштабах. Компанія каже, що вже працює над набором даних у 10 мільйонів годин, що дозволить роботам освоювати нові фізичні завдання всього за кілька годин локального доналаштування .