Para um robô, cumprir uma tarefa com várias etapas exige mais do que reconhecer o que está diante da câmera. Se um objeto muda de lugar ou um movimento sai errado, ele precisa levar em conta o que já fez para decidir o próximo passo. É esse problema que a Songyan Dynamics pretende enfrentar com o HERON-CRA, segundo modelo da linha HERON de sua marca Scalabot, lançado após o HERON-World Model. A proposta reúne memória, correção de ações e transferência de habilidades entre robôs com corpos diferentes.
6
14
15
Memória para agir, reforço para corrigir
O componente Context Expert transforma informações espaciais e sobre o significado da cena, acumuladas ao longo da tarefa, em registros estruturados que orientam as próximas ações. Na descrição do sistema, “4D” significa acompanhar o espaço tridimensional ao longo do tempo. Assim, a decisão não depende apenas da imagem mais recente.
6
9
Já o RL Engine usa aprendizado por reforço — técnica em que um sistema aprende a partir dos resultados de suas ações — para ajustar a política básica de movimentos. A arquitetura descrita é do tipo ator–crítico residual: em vez de substituir a ação planejada, aprende correções. Um modelo de valor estima o progresso da tarefa. A intenção é dar mais precisão ao controle e permitir a recuperação após desvios, mas os dados disponíveis não mostram quanto desse ganho se deve isoladamente a esse componente.
5
9
O pré-treinamento entre diferentes tipos de robô busca permitir que uma habilidade aprendida em um corpo seja aproveitada em outro. Há também uma ligação proposta com o HERON-World Model: estados observados após acertos ou falhas reais podem servir de ponto de partida para gerar trajetórias imaginadas e ampliar o treino. Isso descreve um ciclo de aprendizado pretendido, não comprova que as simulações antecipem com precisão o comportamento de um robô físico.
7
14
15
O que os testes divulgados permitem concluir?
A Scalabot relata que, em um teste de dobrar meias, a taxa de sucesso passou de 38,5% para 97,8%. É um avanço expressivo na tarefa apresentada, mas não uma taxa geral de sucesso em manipulação robótica: o material disponível não estabelece contagens de tentativas, condições e referências de comparação verificadas de forma independente.
12
A demonstração de preparo de café ilustra a importância de manter o contexto durante uma sequência de ações. As apresentações de transferência entre robôs e de resposta a perturbações mostram as capacidades que o sistema pretende alcançar. Por si só, porém, elas não medem com que frequência essas capacidades funcionam em ambientes desconhecidos, com outros robôs ou diante de imprevistos variados.
4
6
15
A distinção principal é entre uma arquitetura promissora e um desempenho comprovado. Testes independentes e comparáveis, capazes também de separar a contribuição da memória, das correções por reforço, do pré-treinamento e das trajetórias imaginadas, são necessários para avaliar a confiabilidade do HERON-CRA fora das demonstrações divulgadas.
4
14
15