O conjunto de dados de treinamento consistiu em mais de 1.000.000 de horas de vídeo humano egocêntrico (em primeira pessoa) — o equivalente a aproximadamente 170 anos de experiência contínua acordada . Os vídeos capturavam tarefas diárias de manipulação, como cozinhar, dobrar roupas, montar objetos e limpar . Nenhum dado de ação de robô foi usado durante o pré-treinamento; dados de robô foram introduzidos apenas em uma pequena etapa de pós-treinamento ou ajuste fino, tipicamente 10 horas ou menos por tarefa .
Durante o pré-treinamento, o DYNA-2 usou um objetivo de predição de vídeo — aprender a prever quadros de vídeo futuros a partir de observações passadas — combinado com um algoritmo de co-treinamento de vídeo que aprende conjuntamente representações visuais e predição de ações . Essa abordagem contrasta com a arquitetura VLA do DYNA-1, que mapeia diretamente a percepção para ações do robô sem predição intermediária de vídeo .
A empresa demonstrou escalabilidade em quatro ordens de grandeza, de 1.000 horas até 1.000.000 de horas de dados de pré-treinamento .
A empresa realizou comparações diretas entre o DYNA-2 e o DYNA-1 sob condições de treinamento equivalentes e em implantações reais.
O desempenho normalizado médio aumentou monotonicamente com a escala de pré-treinamento: 20% → 28% → 45% → 53% do máximo atingível, conforme os dados escalaram de 1k → 10k → 100k → 1M horas . Na escala de 1M horas, o DYNA-2 alcançou o melhor desempenho real em 9 de 14 tarefas . Melhorias notáveis em tarefas específicas incluíram:
A Dyna Robotics reportou o que chama de "a primeira verdadeira lei de escala na robótica alimentada inteiramente por dados humanos" . Características principais:
A empresa afirma explicitamente que esta é uma "primeira do tipo" demonstração de que escalar dados observacionais humanos, e não dados de ação de robô, pode servir como um eixo confiável para melhorar a inteligência física de robôs .
Se as alegações se sustentarem após verificação independente, a Dyna Robotics mostrou um caminho prático para escalar a inteligência de robôs sem o gargalo de coletar dados caros de ação de robôs. Vídeo humano existe em escala efetivamente ilimitada. A empresa afirma que já está trabalhando para 10 milhões de horas de dados de treinamento, o que permitiria que robôs dominassem novas tarefas físicas com apenas algumas horas de ajuste fino local .