O DYNA 2, da Dyna Robotics, é um World Action Model (WAM) pré treinado em mais de 1 milhão de horas de vídeo egocêntrico humano — cerca de 170 anos de experiência acordada contínua — e demonstra a primeira lei de esca... Em testes reais, o DYNA 2 elevou as taxas de sucesso em manufatura de alta precisão de 20% para...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is Dyna Robotics' DYNA-2 robot foundation model, how was it trained on over one million hours of first-person human video, what "world. Article summary: Dyna Robotics' **DYNA-2** is a robot foundation model that the company calls a **World-Action Model (WAM)** — a video-prediction architecture trained on over **one million hours of egocentric (first-person) human video**. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
O DYNA-2, da startup californiana Dyna Robotics, representa uma mudança fundamental no jeito como robôs aprendem habilidades físicas. Em vez de depender de caros dados de teleoperação robótica coletados manualmente — o padrão da indústria —, o DYNA-2 foi pré-treinado em mais de um milhão de horas de vídeo egocêntrico (em primeira pessoa) humano, o equivalente a cerca de 170 anos de experiência acordada contínua . Apresentado em 10 de agosto de 2026, o modelo usa uma arquitetura inédita chamada World-Action Model (WAM), que aprende a prever como as ações alteram o mundo físico antes mesmo de o robô se mover
.
A arquitetura do DYNA-2 é baseada em geração de vídeo, e não nos adaptadores Visão-Linguagem-Ação (VLA) que dominam a robótica atualmente . Durante o pré-treinamento, o modelo executa um objetivo duplo: ele prevê tanto o próximo quadro do vídeo quanto a próxima ação a partir do corpus de vídeos humanos
. Essa abordagem permite que o modelo construa um modelo interno de física de contato e raciocínio espacial — aprendendo relações de causa e efeito entre ações e suas consequências físicas — que é transferido entre diferentes corpos robóticos sem nunca ter visto um robô durante o pré-treinamento
.
Corpus de pré-treinamento: A empresa montou quatro subconjuntos hierárquicos de vídeo egocêntrico humano — 1.000, 10.000, 100.000 e 1.000.000 de horas — sem usar nenhum dado de ação robótica durante o pré-treinamento . Depois, o modelo é ajustado (fine-tuning) com uma quantidade relativamente pequena de dados reais de robôs (horas ou até minutos) para transferir a intuição física aprendida para um hardware específico
.
A Dyna Robotics reportou o que chama de primeira lei de escala de transferência entre diferentes corpos (cross-embodiment) em manipulação . A descoberta é significativa porque demonstra que escalar dados de vídeo humano produz melhorias previsíveis e monotônicas no desempenho do robô — espelhando as leis de escala que transformaram os grandes modelos de linguagem.
Lei de escala em dados humanos: Em todas as quatro ordens de grandeza (1.000 → 10.000 → 100.000 → 1.000.000 de horas), todas as métricas de qualidade de predição de vídeo melhoraram monotonicamente, bem descritas por uma lei de potência sem platô observado .
Lei se transfere para dados de robô nunca vistos: Os mesmos checkpoints foram avaliados zero-shot em 39 tarefas robóticas distintas em duas plataformas bimanuais estacionárias. O desempenho melhorou monotonicamente à medida que o pool de vídeo humano de pré-treinamento crescia, antes de qualquer ajuste fino específico para o robô . Uma análise mostrou que, mantendo os dados com rótulos de ação fixos em 50.000 horas e adicionando apenas horas de vídeo, o erro quadrático médio (MSE) da ação zero-shot do robô caiu de 0,340 para 0,120
.
Escala de desempenho pós-treinamento: Após o pós-treinamento, a pontuação normalizada média em 14 tarefas robóticas subiu de 20% → 28% → 45% → 53% do máximo atingível, conforme a escala de pré-treinamento aumentava de 1.000 para 1.000.000 de horas .
Os ganhos de desempenho do DYNA-2 são mais visíveis em três áreas:
Manufatura de alta precisão: O DYNA-2 elevou as taxas de sucesso em tarefas de cerca de 20% para 80–90% apenas com o aumento da escala de pré-treinamento, sem qualquer alteração nos dados de pós-treinamento . Isso representa uma melhoria de 4x a 4,5x simplesmente por assistir a mais vídeos humanos.
Implantações zero-shot em clientes: Em sites reais de clientes, o DYNA-2 alcançou uma taxa de aprovação de qualidade de 87%, contra 46% do seu antecessor DYNA-1, baseado em VLA — uma melhoria de 41 pontos percentuais com orçamentos de pós-treinamento equivalentes . Em avaliações físicas frente a frente com condições de treinamento idênticas, o DYNA-2 completou tarefas 1,55 vez mais frequentemente que o DYNA-1 e venceu 65% das comparações diretas
.
Abrir tampa de garrafa (13 minutos de dados): Com apenas 13 minutos de dados de demonstração específicos do robô, o DYNA-2 foi adaptado para comandar um par de mãos robóticas dextras de cinco dedos e abrir a tampa de uma garrafa . O relatório técnico da empresa esclarece que o valor foi de aproximadamente 10 minutos de dados robóticos, com a escala de pré-treinamento elevando o sucesso de 10% (com orçamentos menores) para 40–50% (com o orçamento total de 1.000.000 de horas)
.
Os resultados do DYNA-2 desafiam a suposição dominante de que robôs precisam de grandes volumes de dados robóticos específicos para cada tarefa. Ao demonstrar uma lei de escala que transfere aprendizado de vídeo humano para hardware robótico, a Dyna Robotics abre um caminho prático para 10 milhões de horas de dados de treinamento — com o potencial de permitir que robôs dominem novas tarefas físicas com apenas horas de ajuste fino local . Atualmente, o modelo opera como um sistema gerenciado pelo fornecedor; a Dyna Robotics não anunciou checkpoint público, API ou licença para o DYNA-2
. A replicação independente pela comunidade de pesquisa em robótica será o próximo passo para validar esses resultados
.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O DYNA 2, da Dyna Robotics, é um World Action Model (WAM) pré treinado em mais de 1 milhão de horas de vídeo egocêntrico humano — cerca de 170 anos de experiência acordada contínua — e demonstra a primeira lei de esca...
O DYNA 2, da Dyna Robotics, é um World Action Model (WAM) pré treinado em mais de 1 milhão de horas de vídeo egocêntrico humano — cerca de 170 anos de experiência acordada contínua — e demonstra a primeira lei de esca... Em testes reais, o DYNA 2 elevou as taxas de sucesso em manufatura de alta precisão de 20% para 80–90% apenas com o aumento da escala de pré treinamento; em uma implantação real em cliente, atingiu 87% de aprovação co...
O modelo se adaptou a uma tarefa de abrir tampa de garrafa com mãos robóticas usando apenas 13 minutos de dados específicos do robô, com desempenho subindo de 10% para 40–50% conforme a escala de pré treinamento cresc...