Een sok oppakken is één ding; een reeks handelingen afmaken terwijl voorwerpen verschuiven of een greep mislukt, is lastiger. Een robot moet dan niet alleen zien wat er nú voor hem ligt, maar ook rekening houden met wat hij eerder heeft gedaan. Daarvoor introduceerde Songyan Dynamics onder de naam Scalabot HERON-CRA, het tweede model in zijn HERON-reeks na HERON-World Model. Het doel: taakgeschiedenis gebruiken, handelingen corrigeren en aangeleerde vaardigheden op verschillende robotlichamen toepassen.
6
14
15
Geheugen, correcties en oefenen
Context Expert houdt de taakgeschiedenis bij. Dit onderdeel zet eerdere ruimtelijke informatie en de betekenis van de situatie om in gestructureerde gegevens die het model bij volgende stappen kan gebruiken. De aanduiding ‘4D’ betekent hier: driedimensionale ruimtelijke informatie gevolgd door de tijd. De robot hoeft daardoor niet uitsluitend op het laatste camerabeeld af te gaan.
6
9
De RL Engine is bedoeld om bij te sturen. Volgens de beschrijvingen gebruikt HERON-CRA een lichte vorm van versterkend leren die correcties toevoegt aan het bestaande handelingsbeleid, in plaats van dat beleid volledig te vervangen. Een waardemodel schat daarbij de voortgang van de taak in. Of juist dit onderdeel afzonderlijk voor betere resultaten zorgt, valt uit het beschikbare materiaal niet op te maken.
5
9
Training moet vaardigheden overdraagbaar maken. Vooraf trainen met gegevens van verschillende robotlichamen moet helpen om een aangeleerde handeling op een andere robot toe te passen. Daarnaast kunnen echte successen en mislukkingen dienen als vertrekpunt voor HERON-World Model. Dat wereldmodel genereert dan denkbeeldige vervolgen waarop verder kan worden geleerd. Dit is een voorgestelde leercyclus, geen bewijs dat zulke voorspelde situaties op een fysieke robot steeds uitkomen.
7
14
15
Wat zeggen de demonstraties?
Scalabot meldt dat het succespercentage bij sokken vouwen van 38,5% naar 97,8% steeg in zijn test. Dat is een forse gerapporteerde verbetering bij één taak, maar geen algemeen slagingspercentage voor robotmanipulatie. Het beschikbare materiaal biedt geen onafhankelijk gecontroleerde aantallen pogingen, testomstandigheden of vergelijkingsbasis.
12
Een demonstratie van koffiezetten laat zien waarom geheugen bij een taak met meerdere stappen nuttig kan zijn. Demonstraties van overdracht tussen robots en van reacties op verstoringen illustreren eveneens de beoogde mogelijkheden. Ze tonen op zichzelf niet aan hoe vaak het systeem slaagt met onbekende voorwerpen, andere robots of onverwachte onderbrekingen.
4
6
15
De kern: HERON-CRA heeft een samenhangende opzet, maar de brede prestatieclaims zijn nog niet onafhankelijk bevestigd. Vergelijkbare, onafhankelijk herhaalde tests moeten uitwijzen hoe betrouwbaar het systeem buiten de getoonde voorbeelden werkt — en hoeveel geheugen, versterkend leren, vooraf trainen en denkbeeldige oefentrajecten elk afzonderlijk bijdragen.
4
14
15