Pour un robot, réussir une tâche en plusieurs étapes ne consiste pas seulement à reconnaître ce qu’il voit à l’instant présent. Il faut aussi savoir ce qui a déjà été fait, réagir si un geste dévie et, idéalement, réutiliser un savoir-faire sur une autre machine. C’est le problème que Songyan Dynamics entend aborder avec HERON-CRA, deuxième modèle de sa gamme Scalabot après HERON-World Model. Son architecture relie ces ambitions ; les résultats rendus publics restent toutefois des démonstrations et des chiffres rapportés par l’entreprise.
6
14
15
Une mémoire pour agir au-delà de l’image du moment
La première brique, Context Expert, transforme l’historique spatial et sémantique de la tâche en éléments de contexte structurés. Le qualificatif « 4D » désigne ici des informations sur l’espace en trois dimensions suivies dans le temps. L’objectif est que le robot choisisse son prochain geste en tenant compte des étapes précédentes et des changements survenus dans la scène, plutôt qu’en réagissant uniquement à sa dernière observation.
6
9
La deuxième brique, RL Engine, relève de l’apprentissage par renforcement : dans la description publiée, ce composant léger de type acteur-critique résiduel apprend des ajustements à une politique d’action existante, sans la remplacer. Un modèle de valeur est également présenté comme un moyen d’apprécier la progression de la tâche au fil du temps. Cette approche vise un contrôle plus précis et une meilleure reprise lorsqu’une action dévie, mais les éléments disponibles ne permettent pas de mesurer séparément le gain dû à ce seul composant.
5
9
Enfin, le préentraînement sur différents types de robots doit faciliter le transfert des compétences d’une machine à une autre. Scalabot propose aussi d’utiliser des situations réelles, issues de réussites comme d’échecs, comme points de départ pour que HERON-World Model génère des trajectoires imaginées servant à poursuivre l’apprentissage. C’est une boucle d’entraînement envisagée entre les deux modèles, pas la preuve que ces futurs simulés prédisent fidèlement le comportement d’un robot physique.
7
14
15
Ce que les essais permettent — ou non — de conclure
Dans un essai de pliage de chaussettes, Scalabot indique que le taux de réussite est passé de 38,5 % à 97,8 %. La hausse annoncée concerne cette tâche précise : les informations fournies ne permettent pas de vérifier indépendamment le nombre de tentatives, les conditions d’essai ou les références de comparaison. Elle ne doit donc pas être interprétée comme un taux de réussite général en manipulation robotique.
12
La démonstration de préparation du café illustre l’intérêt d’une mémoire de tâche pour enchaîner plusieurs gestes. Celles portant sur le transfert entre robots et la réaction aux perturbations montrent les capacités recherchées : réemployer un savoir-faire et modifier l’action lorsque la situation change. À elles seules, elles n’établissent pas la fréquence à laquelle le système réussirait dans des environnements, sur des robots ou face à des imprévus différents.
4
6
15
La question décisive reste celle de la reproductibilité. Des évaluations indépendantes et comparables, ainsi que des tests isolant l’apport de la mémoire, des corrections par apprentissage, du préentraînement et des trajectoires imaginées, seraient nécessaires pour juger de la fiabilité de HERON-CRA hors des démonstrations rapportées.
4
14
15