Обучающий набор данных состоял из более 1 000 000 часов эгоцентрического (от первого лица) человеческого видео — это примерно 170 лет непрерывного бодрствования . Видео запечатлели повседневные задачи по манипуляции: приготовление еды, складывание, сборку и уборку . На этапе предварительного обучения не использовались данные с реальных роботов; данные с роботов вводились только на небольшом этапе последующего обучения или точной настройки, как правило, не более 10 часов на задачу .
В ходе предварительного обучения DYNA-2 использовал цель предсказания видео — обучение предсказывать будущие видеокадры на основе прошлых наблюдений, — в сочетании с алгоритмом совместного обучения с видео, который одновременно изучает визуальные представления и предсказания действий . Этот подход контрастирует с архитектурой VLA модели DYNA-1, которая напрямую сопоставляет восприятие с действиями робота без промежуточного предсказания видео .
Компания продемонстрировала масштабирование в четыре порядка, от 1 000 до 1 000 000 часов предварительного обучения .
Компания провела прямые сравнительные испытания DYNA-2 и DYNA-1 в одинаковых условиях обучения и в реальных развёртываниях.
Средняя нормализованная производительность монотонно росла с увеличением масштаба предварительного обучения: 20% → 28% → 45% → 53% от достижимого максимума при масштабировании данных от 1 000 → 10 000 → 100 000 → 1 000 000 часов . При масштабе в 1 млн часов DYNA-2 показал наилучшую реальную производительность по 9 из 14 задач . Ключевые улучшения по отдельным задачам:
Dyna Robotics сообщает о том, что называет «первым настоящим законом масштабирования в робототехнике, основанным исключительно на человеческих данных» . Ключевые характеристики:
Компания прямо заявляет, что это демонстрация «в своём роде первая», показывающая, что масштабирование данных наблюдений за человеком, а не данных действий робота, может служить надёжной осью для улучшения физического интеллекта роботов .
Если заявления подтвердятся при независимой верификации, Dyna Robotics продемонстрировала практический путь к масштабированию интеллекта роботов без узкого места в виде сбора дорогостоящих данных о действиях робота. Человеческие видео существуют в практически неограниченном масштабе. Компания заявляет, что уже работает над набором данных в 10 миллионов часов обучения, что позволит роботам осваивать новые физические задачи всего за несколько часов локальной тонкой настройки .