En una tarea de varios pasos, a un robot no le basta con reconocer lo que tiene delante: debe recordar qué hizo antes y decidir cómo continuar si algo cambia. Songyan Dynamics presenta HERON-CRA, el segundo modelo de su arquitectura HERON tras HERON-World Model, como una respuesta a ese problema. La propuesta combina memoria, corrección de movimientos y aprendizaje transferible entre robots; sus resultados publicados siguen siendo demostraciones y afirmaciones de la compañía, no una validación independiente.
6
14
15
Memoria para actuar con contexto
El componente Context Expert codifica información espacial y sobre el significado de la escena recogida en momentos anteriores. La organiza en unidades estructuradas —tokens— para que el robot no dependa únicamente de la imagen más reciente. La descripción «4D» alude aquí al espacio tridimensional seguido a lo largo del tiempo. Esa memoria está pensada para orientar la siguiente acción según el desarrollo de toda la tarea.
6
9
Correcciones sin sustituir la acción de base
El RL Engine incorpora aprendizaje por refuerzo —aprender ajustes a partir de los resultados de las acciones— mediante un mecanismo ligero de tipo actor-crítico residual. En lugar de reemplazar la política de acción de base, aprende correcciones; un modelo de valor evalúa cómo progresa la tarea. El objetivo es afinar los movimientos y recuperarse de desvíos, aunque los datos disponibles no permiten atribuir una mejora concreta a este componente por separado.
5
9
El preentrenamiento entre distintos robots busca que las habilidades aprendidas puedan adaptarse a cuerpos diferentes. Además, los estados observados tras éxitos y fallos reales pueden servir de punto de partida para que HERON-World Model genere trayectorias imaginadas con las que seguir aprendiendo. Es el ciclo de aprendizaje propuesto por Scalabot, no una prueba de que esas simulaciones predigan de forma fiable lo que ocurrirá en un robot físico.
7
14
15
Qué indican las pruebas comunicadas
Scalabot afirma que, en su prueba de doblado de calcetines, la tasa de éxito pasó del 38,5 % al 97,8 %. La diferencia es notable para esa tarea, pero no debe extrapolarse a la manipulación robótica en general: el material disponible no establece recuentos de ensayos, condiciones ni referencias de comparación verificados de manera independiente.
12
Las demostraciones comunicadas de preparación de café ilustran la importancia de conservar el contexto durante varios pasos. Las de transferencia entre robots y respuesta a perturbaciones muestran las capacidades que se pretende desarrollar. Ninguna demuestra por sí sola con qué frecuencia funcionaría el sistema ante entornos, cuerpos robóticos o imprevistos desconocidos.
4
6
15
La pregunta pendiente no es si las piezas forman un diseño coherente, sino cuánto aporta cada una y con qué constancia funciona el conjunto. Para responderla harían falta evaluaciones independientes y comparables que distingan los efectos de la memoria, el aprendizaje correctivo, el preentrenamiento y las trayectorias imaginadas.
4
14
15