로봇이 여러 작업을 해내는 영상보다 연구자에게 중요한 질문은 따로 있다. 같은 시스템을 내려받아 성능을 재현할 수 있는가? 유니트리가 발표한 UnifoLM-WLA-1.0은 장면 이해, 앞으로 일어날 변화의 예측, 손·팔·몸의 움직임을 연결하려는 약 60억 파라미터 모델이다. 다만 제공된 공개 현황 자료로는 전체 로봇 제어 모델이 완전히 공개됐다고 볼 수 없다.
5
8
13
지금 받을 수 있는 것과 아직 없는 것
공개된 것은 약 40억 파라미터 규모의 체화 추론 구성요소 UnifoLM-ER-1과, 예상되는 장면 변화 및 행동 표현을 결합한 UnifoLM-ER-Flow의 가중치다. 9월 16일 공개 목록을 검토한 자료에는 UniBot-V1 Challenge Dataset도 공개된 것으로 표시됐다.
8
17
반면 같은 목록에서 UnifoLM-WLA-Base 가중치, 후속 학습 코드, Unitree-WBT-Dataset, Unitree-Manipulation-Dataset은 공개 예정 항목이었다. 9월 20일 보도 역시 전체 모델 가중치와 코드, 나머지 데이터셋을 향후 공개 대상으로 설명했다. 앞서 공개된 구성요소를 곧바로 내려받아 실행할 수 있는 완전한 60억 파라미터 전신 제어 모델과 혼동해서는 안 된다.
8
13
20
‘64개 작업을 모델 하나로’의 의미
유니트리는 약 2,500시간의 실제 로봇 데이터로 학습한 모델 하나가 탁상 작업 54개와 전신·이동 조작 작업 10개, 총 64개 작업을 수행한다고 밝혔다. 평가에 사용된 장비에는 두 손가락 집게와 여러 종류의 다섯 손가락 로봇 손이 포함된다. 이는 회사가 제시한 작업·장비 범위를 뜻하지, 모든 로봇에서 수정 없이 작동한다는 뜻은 아니다.
5
6
13
구성요소의 역할도 다르다. ER-1-4B는 시각·공간 정보를 추론하고, ER-Flow는 장면이 어떻게 바뀔지와 관련 행동을 표현한다. 여기에 움직임을 생성하는 ‘액션 엑스퍼트’를 결합해 지시와 관찰 장면을 손·팔·몸의 동작으로 이어가도록 설계됐다.
8
17
30
이때 연속적인 손끝 위치, 손 관절, 하체 움직임을 이산적인 행동 토큰으로 바꾸고 같은 시간 단계에 맞춘다. 서로 다른 부위가 언제 움직여야 하는지를 예상되는 장면 변화와 함께 다루기 위한 방식이다. 설계 방식에 대한 설명일 뿐, 예상 밖 상황에서 로봇이 안정적으로 대처한다는 증거는 아니다.
18
22
벤치마크가 말해 주지 않는 것
유니트리가 보고한 결과에 따르면 ER-1-4B는 16개 다중모달 지각·이해 평가 중 7개에서 비교 대상 오픈 모델을 앞섰다. 이는 추론 구성요소를 해당 비교 집단과 평가한 성적이다. WLA 전체의 작업 성공률을 일곱 차례 검증했다거나, 현장 운용의 안전성과 신뢰성을 입증했다는 의미는 아니다.
13
18
64개 작업은 회사가 제시한 평가 범위의 폭을 보여준다. 하지만 제공된 자료에는 실제 작업 성능을 외부에서 독립적으로 재현했다는 근거가 없다. 전체 제어 모델과 후속 학습 자료가 빠진 상태에서는 외부 연구팀이 확인할 수 있는 범위도 제한된다. 타사 로봇으로의 손쉬운 이전이나 안정적인 현장 운용을 판단하려면, 추가 공개와 평가 절차 설명, 서로 다른 몸체·센서·손을 이용한 독립 시험이 필요하다.
8
13
22