로봇이 여러 단계의 작업을 하다가 물체를 놓쳤다면, 다음 동작을 정할 때 지금 보이는 장면만으로는 부족할 수 있다. 앞서 무엇을 했고 상황이 어떻게 달라졌는지도 알아야 한다. 쑹옌다이내믹스의 Scalabot이 HERON-World Model에 이어 공개한 두 번째 모델 HERON-CRA는 이 문제에 기억, 동작 보정, 기술 전이를 결합하는 방식으로 접근한다. 다만 현재 제시된 성과는 시연과 회사 측 발표를 중심으로 읽어야 한다.
6
14
15
이전 과정을 기억하고, 어긋난 동작을 고친다
Context Expert는 과거 장면의 공간 정보와 의미 정보를 시간에 따라 구조화된 토큰으로 기록한다. 여기서 ‘4D’는 3차원 공간 정보에 시간의 흐름을 더했다는 뜻이다. 로봇이 현재 화면뿐 아니라 작업이 진행된 과정도 다음 행동의 판단에 활용하도록 설계됐다.
6
9
RL Engine은 기본 동작 방식을 통째로 바꾸기보다, 실행 중 생긴 오차를 바로잡는 조정을 학습하는 가벼운 잔차형 행위자–비평가 강화학습 구성 요소로 설명된다. 작업 진행 정도를 평가하는 가치 모델도 포함된다. 목표는 더 정밀한 조작과 실수 후 복구지만, 공개된 자료만으로는 성능 향상 중 어느 정도가 이 엔진만의 효과인지 가려낼 수 없다.
5
9
다른 로봇에 적용하고, 가상 경로로 연습한다
서로 다른 로봇을 활용한 사전학습은 몸체 구조가 다른 로봇 사이에서도 배운 기술을 활용하려는 접근이다. 또 실제 작업에서 얻은 성공·실패 당시의 상태를 출발점으로 삼아, 앞서 공개된 HERON-World Model이 가능한 이후 경로를 가상으로 생성하고 추가 학습에 활용하는 순환 구조도 제시됐다. 이는 두 모델을 잇는 학습 구상이지, 가상으로 생성한 미래가 실제 로봇의 결과를 일관되게 맞힌다는 증거는 아니다.
7
14
15
시연이 보여준 것과 아직 모르는 것
Scalabot은 자체 시험에서 양말 접기 성공률이 38.5%에서 97.8%로 올랐다고 발표했다. 특정 작업에서 보고된 큰 폭의 개선이지만, 이를 로봇 조작 전반의 성공률로 받아들여서는 안 된다. 제공된 자료에는 시험 횟수와 조건, 비교 기준이 독립적으로 확인됐다는 근거가 없다.
12
커피 만들기 시연은 여러 단계에 걸쳐 작업 이력을 활용하려는 목적을 보여준다. 로봇 간 기술 전이와 방해 상황 대응 시연도 각각 배운 기술의 재사용과 행동 수정이라는 목표를 설명한다. 그러나 이들 시연만으로 낯선 환경·다른 로봇 몸체·다양한 돌발 상황에서 얼마나 자주 성공하는지 판단할 수는 없다.
4
6
15
결국 설계가 서로 맞물린다는 것과 성능이 검증됐다는 것은 별개다. 장시간 작업에서 HERON-CRA가 얼마나 안정적으로 작동하는지 알려면 독립적인 조건별 비교 시험과 함께 기억, 강화학습, 사전학습, 가상 경로 생성의 기여도를 각각 분리해 확인할 필요가 있다.
4
14
15