Los ocho artículos abordan colectivamente los principales desafíos a los que se enfrentan hoy los desarrolladores de robótica, desde la coordinación de múltiples brazos hasta el razonamiento visión-lenguaje-acción.
El software de planificación robótica tradicional procesa los brazos de forma secuencial, creando cuellos de botella en celdas con múltiples manipuladores. ScheduleStream ejecuta los cálculos en GPUs, permitiendo que varios brazos planifiquen sus movimientos y operen en paralelo. Ejecutándose sobre la plataforma de IA en el borde NVIDIA Jetson, ofreció una aceleración de 3x en todos los escenarios de planificación multi-brazo. El marco de trabajo es de código abierto y está disponible en GitHub .
Lograr que robots con cuerpos muy distintos —desde plataformas móviles con ruedas hasta humanoides— compartan una política de navegación es complejo. El marco COMPASS entrena primero una política de navegación base mediante aprendizaje por imitación y después utiliza el aprendizaje por refuerzo residual en NVIDIA Isaac Lab para crear políticas especializadas para cada tipo de robot, todo ello en simulación. En comparación con los modelos de imitación, COMPASS logró una mejora promedio de 4.5x en la tasa de éxito y se transfirió sin problemas al mundo real, demostrando un éxito cercano al 80% en 20 pruebas de navegación real con robots móviles autónomos y humanoides .
Un plan de agarre fijo falla cuando los objetos se mueven o cuando la estimación inicial del robot no es del todo precisa. Grasp-MPC corrige de forma continua el movimiento del robot a medida que se aproxima al objeto. Los investigadores generaron 2 millones de trayectorias simuladas sobre 8,000 objetos usando el conjunto de datos GraspGen y cuRobo (una librería de generación de movimiento acelerada por CUDA). En robots reales, alcanzó una tasa de éxito global de ~75%, frente al 41% del modelo de referencia .
Manipular materiales flexibles y enredados —como ramas sobre líneas eléctricas— exige algo más que una pinza de precisión. Los investigadores de NVIDIA entrenaron políticas para que el robot usara todo el brazo y apartara los cúmulos, generando miles de árboles sintéticos en los marcos de simulación de Isaac. El resultado: políticas desplegadas directamente (zero-shot) sobre ramas reales sin ningún tipo de entrenamiento adicional .
Los elementos distractores en la cámara de un robot pueden hacer descarrilar incluso las políticas de manipulación mejor entrenadas. PEEK utiliza un modelo de visión-lenguaje para leer la instrucción de la tarea y enfocar la visión del robot en los objetos relevantes, difuminando todo lo demás. Al añadirlo a una política entrenada exclusivamente en simulación, PEEK produjo una mejora de precisión de 41x en el mundo real. Para modelos grandes de visión-lenguaje-acción (VLA), las ganancias oscilaron entre 2x y 3.5x. PEEK se integra con cualquier política basada en cámara sin necesidad de modificaciones .
El marco SEAL —fruto de una colaboración con la Universidad Carnegie Mellon, la Universidad de Utah y la Universidad de Sídney— corrige un fallo común pero engañoso: el modelo razona bien y elige el plan correcto, pero ejecuta algo distinto. SEAL genera múltiples secuencias de acción candidatas, simula a dónde conduce cada una y selecciona la que mejor coincide con la intención declarada. Ofrece ganancias de precisión de hasta un 15% respecto a trabajos anteriores y es robusto frente a instrucciones reformuladas, al desorden y a cambios de ángulo de cámara .
En ensamblajes de múltiples piezas, el resultado de cada paso condiciona el siguiente. Refinery entrena políticas que entienden estas dependencias, aprendiendo a lo largo de cientos de escenarios simulados. Alcanza un 91% de éxito en simulación y una mejora media de casi el 11% sobre otros métodos de referencia, con políticas que se encadenan para cubrir secuencias de ensamblaje largas y complejas .
Una propuesta independiente de aprendizaje por refuerzo (RL) basado en visión entrenó a un robot humanoide en tareas de agarre y alcance, levantamiento de cajas y transferencia bimanual. El enfoque demostró altas tasas de éxito con objetos no vistos y comportamientos adaptativos robustos, lo que subraya que la manipulación diestra basada en visión mediante RL sim-to-real no solo es viable, sino escalable y ampliamente aplicable .
Los ocho artículos se apoyan en varias plataformas transversales de NVIDIA que convierten la simulación en un entorno de desarrollo práctico e integral:
El Toyota Research Institute (TRI) personalizó los modelos fundacionales de mundo de NVIDIA Cosmos para síntesis dinámica de vistas y teleoperación robótica, reduciendo la cantidad de datos del mundo real necesarios para entrenar políticas de manipulación basadas en visión .
Mimic Robotics desarrolló un modelo de vídeo-acción usando las plataformas de NVIDIA que logra una eficiencia de muestreo 10 veces mayor y una convergencia 2 veces más rápida en tareas de manipulación real, lo que reduce drásticamente el número de costosas demostraciones en el mundo real .
Doosan utiliza NVIDIA Cosmos Reason para que sus robots de paletizado analicen el contenido de las cajas, detecten daños y ajusten la manipulación en función del peso y la fragilidad, permitiendo una toma de decisiones sensible al contexto sin necesidad de un exhaustivo entrenamiento previo con datos reales .
NVIDIA enmarca todo este trabajo como parte de un cambio fundamental en la industria robótica:
"La robótica está entrando en una nueva fase: está pasando de las demostraciones controladas y la automatización programada hacia una autonomía corpórea fiable y generalizable en el mundo real" .
La transferencia sim-to-real ha dejado de ser una curiosidad académica. Los ocho artículos de la ICRA la muestran abordando la pila completa: coordinación paralela de múltiples brazos, generalización de políticas para diferentes cuerpos robóticos, agarre de objetos desconocidos en entornos desordenados, manipulación de materiales deformables sin entrenamiento previo, ensamblaje secuencial de precisión y modelos de visión-lenguaje-acción que razonan antes de moverse . El mensaje es claro: el entrenamiento basado en simulación —en lugar de la dependencia de una enorme cantidad de demostraciones humanas en el mundo real— es la vía escalable hacia robots que funcionen con robustez en entornos dinámicos y no estructurados.