HOST와 GEN 1.5는 작업마다 모델을 다시 미세 조정하는 대신, 짧은 시연 영상을 추론 단계의 맥락으로 활용해 로봇을 즉시 제어한다. HOST는 평균 29초의 인간 영상을 바탕으로 50개 신규 조작 과제에서 평균 62%의 성공률을 보고했다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
로봇을 가르치려면 작업별 데이터 수집과 긴 재훈련이 필요하다는 것이 기존의 상식이었다. HOST와 GEN-1.5는 이 방식을 바꿔, 이미 대규모 사전학습을 마친 시스템에 짧은 인간 시연을 ‘맥락’으로 제공하고 곧바로 행동하게 하는 방향을 제시한다.
다만 두 사례의 증거 수준은 다르다. HOST는 학술 프리프린트 기반의 통제된 실험 결과가 공개돼 있어 비교적 구체적으로 평가할 수 있다. 반면 GEN-1.5는 기업이 공개한 시연과 설명이 중심이어서, 가능성은 흥미롭지만 독립 검증에는 아직 거리가 있다.
HOST의 핵심은 인간의 손 움직임을 로봇 관절 움직임으로 단순 변환하는 데 있지 않다. 시스템은 먼저 영상 속 작업이 어느 단계까지 진행됐는지 파악하고, 로봇 자신의 시점에서 시연된 결과를 예측한다. 그런 다음 현재 상태에서 그 결과에 도달하기 위한 행동을 계산한다.
이 방식은 인간과 로봇의 몸 형태, 시점, 움직임이 서로 다르다는 문제를 피하려는 접근이다. 사람의 손 궤적을 그대로 재생하는 대신, ‘현재 작업 진행도에 맞는 다음 상태’를 기준으로 로봇의 행동을 정렬하는 것이다.
연구진은 학습 단계에서 보지 못한 50개 조작 과제와 과제당 20회의 시험을 진행했다. 평균 성공률은 62%로, 한 번의 짧은 시연만으로도 새로운 물체와 도구, 조작 원리에 일정 수준 대응할 수 있음을 보여준다. 동시에 약 10번 중 4번은 실패한다는 뜻이기도 하므로, 모든 환경에서 안정적으로 사용할 수 있는 수준이라고 보기는 어렵다.
조명, 물체, 장면, 사람의 방해가 달라지는 조건에서도 성능 저하는 각각 1%, 4%, 6%, 9%로 보고됐다. 하지만 이런 결과 역시 연구진이 설계한 실험 환경 안에서의 강건성 평가라는 점은 감안해야 한다.
Generalist AI의 GEN-1.5는 비슷한 아이디어를 더 큰 범용 체화형 모델의 능력으로 설명한다. 모델은 짧은 센서운동 시연을 새 정책으로 다시 학습하는 대신, 일정한 맥락 창에 ‘물리적 프롬프트’로 넣고 즉시 작업을 시도한다.
공개된 사례에는 병 뚜껑 열기, 파우치 지퍼 열기, 블록을 그릇 안으로 밀어 넣기, 컵에 마커 넣기 등이 포함된다. 회사는 인간이 직접 수행한 시연을 로봇이 따라 하는 인간-로봇 전이, 두 가지 시연 행동을 조합하는 능력, 시뮬레이션 영상으로 배운 행동을 실제 로봇에서 수행하는 제로샷 전이도 제시한다.
다만 ‘재훈련이 없다’는 표현은 모든 사용 사례에 적용되는 것은 아니다. 한 번의 시연을 맥락으로 사용하는 원샷 방식에는 업데이트가 필요 없지만, 더 어려운 작업에서는 몇 분 분량의 데이터를 활용한 그래디언트 기반 적응 경로도 제공한다. 따라서 GEN-1.5는 완전한 무학습 시스템이라기보다, 상황에 따라 원샷 추론과 소량 적응을 선택하는 구조에 가깝다.
두 시스템의 중요한 점은 로봇 학습의 인터페이스를 바꾼다는 데 있다. 기존에는 작업을 단계별로 프로그래밍하거나, 보상 함수를 설계하거나, 수백 개의 로봇 시연을 모은 뒤 과제별로 모델을 다시 훈련해야 했다. 새로운 접근에서는 사용자가 로봇에게 ‘무엇을 해야 하는지’를 말로만 설명하는 대신 직접 보여줄 수 있다.
물론 로봇이 아무런 사전 지식 없이 영상 하나만 보고 배우는 것은 아니다. 대규모 사전학습 과정에서 물체, 접촉, 움직임, 작업 구조에 대한 일반적인 물리 지식을 미리 익혀야 한다. 짧은 영상은 그 위에 새로운 목표와 절차, 현재 상황에 필요한 상호작용을 지정한다.
즉, 효율성의 원천은 학습 비용이 사라진 것이 아니라 미리 분산돼 있다는 데 있다. 개발 단계에서 큰 데이터와 연산을 투입해 범용 능력을 만들어두고, 실제 사용자는 새로운 작업을 가르칠 때 짧은 시연만 제공하는 방식이다. HOST는 평균 29초의 습득 시간과 507배의 속도 향상이라는 수치로 이 교환 관계를 구체화했다.
HOST는 통제된 실험의 결과다. 50개로 선정된 신규 과제에서 평균 62%를 기록했지만, 가정 환경, 복잡한 산업 현장, 긴 시간에 걸친 작업, 안전이 중요한 작업에서의 성능과 독립적인 재현은 아직 확인되지 않았다.
GEN-1.5는 독립 검증이 제한적이다. 모델의 성능, 8개월 이상의 학습 기간, 시뮬레이션 데이터 미사용, 시연 시간, 적응 방식에 관한 핵심 정보가 주로 Generalist AI의 발표나 이를 인용한 자료에 의존한다.
두 시스템을 직접 비교할 수 있는 공통 벤치마크가 없다. GEN-1.5에 대해서는 표준화된 과제 수, 시험 횟수, 평균 원샷 성공률, 기준선 비교, 모델·데이터 공개, 제3자 재현 결과가 충분히 제시되지 않았다. 따라서 현재 공개된 시연은 잠재력을 보여주는 증거이지, 검증된 성능 한계치를 확정하는 자료는 아니다.
종합하면 HOST는 정해진 조작 실험에서 ‘단일 영상·파라미터 업데이트 없음’ 방식의 기술 습득이 실제로 가능하다는 학술적 근거를 제시한다. GEN-1.5는 충분히 폭넓은 체화형 사전학습이 이와 유사한 능력을 범용 모델의 맥락 내 학습으로 끌어올릴 수 있음을 시사한다.
방향성은 분명히 흥미롭다. 그러나 현재 단계에서 인간의 시연만으로 로봇이 어떤 환경에서도 안정적으로 일한다고 결론 내리기는 이르다. 실제 배치에는 여전히 과제별 검증, 안전 설계, 실패 복구, 필요할 경우 추가 적응이 필요하다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
HOST와 GEN 1.5는 작업마다 모델을 다시 미세 조정하는 대신, 짧은 시연 영상을 추론 단계의 맥락으로 활용해 로봇을 즉시 제어한다.
HOST와 GEN 1.5는 작업마다 모델을 다시 미세 조정하는 대신, 짧은 시연 영상을 추론 단계의 맥락으로 활용해 로봇을 즉시 제어한다. HOST는 평균 29초의 인간 영상을 바탕으로 50개 신규 조작 과제에서 평균 62%의 성공률을 보고했다. [1]
GEN 1.5는 3 12초의 시연만으로 새 작업을 수행할 수 있다고 Generalist AI가 주장하지만, 독립적으로 검증된 종합 벤치마크는 아직 부족하다.