Per un robot, svolgere un compito lungo non significa soltanto sapere quale movimento fare adesso. Deve anche ricordare che cosa ha già fatto, accorgersi se qualcosa è andato storto e adattare ciò che ha imparato quando cambia il proprio corpo. È il problema a cui Songyan Dynamics, con il marchio Scalabot, vuole rispondere con HERON-CRA, secondo modello della famiglia HERON dopo HERON-World Model. L’architettura mette insieme questi obiettivi; le prestazioni riportate, però, restano dimostrazioni e dichiarazioni aziendali, non una convalida indipendente.
6
14
15
Come funziona la combinazione
Una memoria del compito. Il componente Context Expert codifica le informazioni spaziali e il significato della scena osservati nei passaggi precedenti in elementi strutturati, chiamati token di contesto. Il modello può così scegliere l’azione successiva tenendo conto della sequenza, anziché basarsi soltanto sull’immagine più recente. In questo caso «4D» indica lo spazio tridimensionale seguito nel tempo.
6
9
Correzioni durante l’esecuzione. Il cosiddetto RL Engine usa, secondo le descrizioni disponibili, un approccio leggero di apprendimento per rinforzo actor–critic residuo: apprende aggiustamenti alla strategia di azione di base, senza sostituirla interamente. Un modello di valutazione stima inoltre l’avanzamento del compito nel tempo. Lo scopo è rendere i movimenti più precisi e recuperare quando l’esecuzione devia dal previsto; i dati forniti non permettono però di stabilire quanto del miglioramento dipenda da questo componente, preso da solo.
5
9
Abilità da riutilizzare e tentativi da simulare. Il preaddestramento su robot con corpi diversi mira a rendere trasferibili le abilità apprese. In parallelo, gli stati osservati dopo successi ed errori nel mondo reale possono diventare punti di partenza per HERON-World Model, che genera traiettorie immaginate da usare nell’apprendimento. È il ciclo di apprendimento proposto per collegare i due modelli, non la prova che gli sviluppi simulati prevedano con regolarità ciò che accadrà su un robot fisico.
7
14
15
Che cosa mostrano i risultati comunicati
Scalabot riferisce che, nel suo test di piegatura dei calzini, il tasso di successo è salito dal 38,5% al 97,8%. È un miglioramento dichiarato per un compito specifico, non un tasso di successo valido per la manipolazione robotica in generale. Il materiale disponibile non chiarisce con verifiche indipendenti il numero di prove, le condizioni del test o i termini del confronto.
12
La dimostrazione della preparazione del caffè serve a illustrare perché ricordare i passaggi precedenti può essere utile in un’attività composta da più azioni. Le dimostrazioni di trasferimento tra robot e di reazione ai disturbi mostrano, allo stesso modo, le capacità a cui il sistema punta. Da sole, però, non indicano con quale frequenza il robot riesca a ripetere quei risultati con oggetti, ambienti, corpi robotici o imprevisti differenti.
4
6
15
Il punto, quindi, è distinguere un progetto tecnico coerente da una prestazione verificata. Servono valutazioni indipendenti e comparabili, oltre a test che separino il contributo di memoria, correzioni tramite apprendimento per rinforzo, preaddestramento e traiettorie immaginate, per capire quanto HERON-CRA sia affidabile fuori dalle dimostrazioni riportate.
4
14
15