Robot wykonujący wieloetapowe zadanie nie może polegać wyłącznie na tym, co widzi w danej chwili. Musi też uwzględnić wcześniejsze kroki i zdecydować, co zrobić, gdy ruch nie przyniesie oczekiwanego skutku. Temu ma służyć HERON-CRA — drugi model w rodzinie HERON marki Scalabot należącej do Songyan Dynamics, wydany po HERON-World Model. Założenia tworzą spójną całość, ale przedstawione wyniki i pokazy nie stanowią jeszcze niezależnego potwierdzenia skuteczności systemu.
6
14
15
Pamięć zadania i korekta ruchu
Context Expert zapisuje wcześniejsze informacje o położeniu obiektów i znaczeniu sytuacji w postaci uporządkowanych tokenów kontekstowych. Dzięki temu wybór następnego działania ma zależeć nie tylko od aktualnego obrazu, lecz także od przebiegu zadania. Określenie „4D” oznacza tu trójwymiarową przestrzeń śledzoną w czasie — nie dodatkowy wymiar przestrzenny.
6
9
RL Engine to opisywany w doniesieniach lekki moduł uczenia przez wzmacnianie typu aktor–krytyk. Ma uczyć się poprawek do podstawowej strategii działania, zamiast zastępować ją w całości. Osobny model wartości ma oceniać postęp w kolejnych chwilach. Taka konstrukcja ma pomagać w precyzyjniejszym sterowaniu i powrocie na właściwy tor po błędzie, lecz dostępne materiały nie pokazują, jaka część poprawy wynika z samego RL Engine.
5
9
Wstępne uczenie na robotach o różnej budowie ma ułatwiać przenoszenie umiejętności między maszynami. Scalabot opisuje też połączenie z wcześniejszym HERON-World Model: rzeczywiste sukcesy i porażki mogą być punktami wyjścia do generowania wyobrażonych przebiegów zadania, wykorzystywanych w dalszym uczeniu. To koncepcja pętli treningowej, a nie dowód, że przewidywane przez model zdarzenia wiernie odtwarzają zachowanie fizycznego robota.
7
14
15
Co mówią pokazy i liczby?
Najbardziej konkretny wynik dotyczy składania skarpetek: według Scalabot skuteczność w jego teście wzrosła z 38,5% do 97,8%. To wynik podany dla jednego zadania, nie ogólny wskaźnik skuteczności robotów. Dostępne materiały nie pozwalają niezależnie sprawdzić liczby prób, warunków testu ani punktu odniesienia.
12
Pokaz przygotowywania kawy ilustruje, po co robotowi pamięć obejmująca kolejne etapy pracy. Prezentacje przenoszenia umiejętności między robotami oraz reagowania na zakłócenia pokazują z kolei, do czego system jest projektowany. Żaden z tych pokazów sam w sobie nie określa jednak, jak często HERON-CRA poradzi sobie w nieznanym otoczeniu, na innym robocie lub po nieprzewidzianym zakłóceniu.
4
6
15
Aby ocenić rzeczywistą niezawodność rozwiązania, potrzebne byłyby niezależne, porównywalne testy. Warto byłoby również osobno zmierzyć wkład pamięci, korekt uczonych przez wzmacnianie, wstępnego treningu na różnych robotach i wyobrażonych przebiegów zadania. Na razie HERON-CRA jest obiecującym projektem sterowania, nie potwierdzonym dowodem na ogólną sprawność robotów w długich zadaniach.
4
14
15