Omega 0는 걷기, 몸의 방향 전환, 시선 조절, 균형 유지, 손을 이용한 물체 조작을 하나의 정책으로 조율하는 전신 월드 액션 모델이다. 모델은 행동을 바로 출력하기보다 다음에 로봇이 보게 될 시각적 상태를 먼저 예측한 뒤, 그 결과에 맞는 전신 동작을 생성한다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
휴머노이드 로봇이 물건을 집으려면 손만 잘 움직여서는 충분하지 않다. 물체가 있는 곳까지 걸어가고, 몸과 카메라의 방향을 맞추고, 균형을 유지하면서 팔을 뻗어야 한다. **Omega-0(오메가-0, ω-0)**는 이처럼 서로 얽힌 동작을 각각의 문제로 나누지 않고 하나의 모델로 처리하려는 연구다.
이 모델은 휴머노이드 로봇을 위한 **전신 월드 액션 모델(whole-body world action model)**이다. 로봇의 시각 정보와 언어 지시, 현재 몸 상태를 입력으로 받아 앞으로 어떤 시각적 상태에 도달할지를 예측하고, 그 상태에 맞는 전신 동작을 생성한다. 따라서 로봇은 걷기와 물체 조작을 별개의 정책으로 실행하는 대신, 이동·자세·시선·팔과 손의 움직임을 하나의 작업 안에서 조율할 수 있다. 1
다만 현재 공개된 결과는 연구 논문 저자들이 제시한 주장이다. 독립적인 기관이 재현한 벤치마크 결과로 받아들여서는 안 된다. 1
첫 단계에서는 Whole-Body FAST 토크나이저를 사용해 고차원 전신 궤적을 더 작은 액션 토큰 또는 잠재 표현(latent)으로 압축한다. 다리와 몸통, 팔을 동시에 움직이는 복잡한 동작을 모델이 다루기 쉬운 형태로 바꾸는 과정이다. 1
동시에 연구진은 Qwen3-VL-2B-Instruct 비전·언어 모델을 로봇 환경에 맞게 조정했다. 여기에는 로봇이 직접 보는 **1인칭 시점(egocentric)**과 외부 카메라가 바라보는 **3인칭 시점(exocentric)**을 구분하는 학습 가능한 토큰이 포함된다.
이 방식은 학습 단계에서 외부 카메라의 넓은 시야를 활용하면서도, 실제 실행 단계에서는 로봇 자신의 카메라를 중심으로 작동하도록 돕는다. 1
두 번째 단계가 Omega-0의 핵심이다. 모델은 V-JEPA에서 영감을 받은 목표를 사용해 시각 정보, 언어 지시, 고유수용감각(proprioception)—관절 각도와 로봇의 자세·상태를 측정하는 정보—을 결합한다. 이후 미래의 모든 픽셀을 재구성하는 대신, 앞으로 얻게 될 시각적 특징을 예측한다. 1
그다음 확산 트랜스포머(diffusion transformer)가 이 예측을 바탕으로 컨트롤러가 실행할 수 있는 전신 액션 잠재 표현의 시퀀스를 생성한다.
쉽게 말해 로봇은 ‘이 화면에서 어떤 동작을 해야 하는가’만 묻는 것이 아니다. ‘이 동작을 하면 다음에 무엇을 보게 되는가’를 함께 고려한다. 예를 들어 물체를 향해 이동하고, 몸통과 카메라의 방향을 조절한 뒤, 손을 뻗어 물체를 조작하는 식이다. 1
세 번째 단계에서는 공개된 인간의 시연 데이터를 시뮬레이션 기반 그라운딩을 통해 로봇의 액션 잠재 공간으로 옮긴다. 이후 실제 휴머노이드 로봇이 가정에서 작업하는 데이터를 활용해 모델을 추가로 조정한다. 1
실행 방식도 중요하다. Omega-0는 긴 작업 전체의 궤적을 한 번에 정해두지 않는다. 대신 짧은 **액션 청크(action chunk)**를 생성해 실행한 뒤, 주변을 다시 관찰하고 다음 동작을 재계획한다.
이러한 리시딩 호라이즌(receding-horizon) 방식은 로봇이 새로운 시각 정보와 몸 상태에 따라 경로를 수정할 수 있게 한다. 처음부터 끝까지 정해진 궤적을 그대로 따르는 오픈 루프 방식보다, 중간에 발생한 작은 오차에 대응하기 쉽다는 의미다. 1
연구진은 학습과 평가를 위해 Omega-HOME이라는 실제 가정 환경 데이터셋도 구축했다. 데이터셋에는 다음이 포함된다. 1
수집 항목은 다음과 같다.
작업은 8개 능력 범주로 구성됐다.
따라서 이 데이터셋은 테이블 위의 물체를 집는 정적인 작업에만 머물지 않는다. 로봇은 이동 기반을 옮기고, 자세와 몸통을 조절하며, 균형을 유지하고, 가구·물체·도구를 더 긴 동작 순서에 걸쳐 다뤄야 한다. 1
벤치마크 오염을 줄이기 위해 연구진은 평가에 사용한 11개 작업 유형을 Omega-HOME의 학습 데이터에서 제외했다. 이후 남은 로봇 데이터를 공개 인간 시연 데이터와 결합해 사전학습을 진행하고, 실제 가정 데이터는 로봇 그라운딩과 후속 학습에 사용했다. 1
이렇게 하면 모델이 테스트에 등장하는 동일한 시연을 단순히 기억했을 가능성을 낮출 수 있다. 하지만 완벽한 일반화를 보장하는 것은 아니다. 학습과 테스트 환경 사이에 방 구조, 물체, 작업 순서, 로봇 하드웨어, 데이터 수집 방식의 유사성이 남아 있을 수 있기 때문이다.
더 엄격한 검증을 위해서는 전혀 새로운 집과 다른 휴머노이드 플랫폼에서 독립적으로 재현하는 평가가 필요하다.
연구진은 **11개 실제 가정 내 이동·조작 작업(real-home loco-manipulation tasks)**에서 Omega-0가 평균 81.8%의 단일 모델 성공률을 기록했다고 보고했다. 이 결과는 작업별 정책이나 별도의 액션 헤드, 보행과 조작을 위한 독립 모듈을 조합하지 않고 하나의 모델을 사용한 결과다. 1
평가에는 테이블 위 조작, 청소, 세탁물 처리, 물체 옮기기, 가전제품과의 상호작용, 이동형 조작 등이 포함됐다. 연구 논문은 Omega-0가 해당 테스트 세트에서 π-0.5, EgoVLA, GR00T-N1.7, ψ-0 등 비교 기준선보다 높은 성능을 보였다고 설명한다. 1
다만 현재 제공된 자료만으로는 각 기준선의 정확한 종합 성공률을 충분히 확인하기 어렵다. 따라서 확실하게 말할 수 있는 내용은 논문이 보고한 비교 우위와 Omega-0의 81.8% 수치다. 기준선별 세부 수치를 임의로 추정해서는 안 된다. 1
Omega-0의 가장 중요한 기여는 단순한 점수보다 구조적 접근법에 있다. 미래의 지각적 잠재 표현을 예측하는 과정을 통해 인간의 시연, 언어, 시각 정보, 로봇의 몸 상태, 전신 제어를 하나의 모델 안에서 연결하려 했다는 점이다. 1
기존의 단순한 대응 방식이 ‘이 화면에서 어떤 동작을 해야 하는가’에 집중한다면, Omega-0는 그 동작이 로봇을 어떤 상태로 데려갈지도 함께 고려한다. 이는 로봇이 어디에 설지, 무엇을 바라볼지, 손으로 무엇을 할지를 동시에 결정해야 하는 가정용 작업에 특히 중요하다.
그러나 이번 결과가 휴머노이드 로봇이 곧바로 사람의 감독 없이 어떤 집안일이든 수행할 수 있다는 뜻은 아니다. 해결해야 할 과제는 여전히 많다.
결국 Omega-0는 휴머노이드 로봇의 이동과 조작을 하나로 통합하는 방향에서 중요한 연구 성과다. 다만 81.8%는 특정 벤치마크에서의 강력한 결과일 뿐, 가정용 로봇의 무감독·범용 자율성이 이미 완성됐다는 증거는 아니다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Omega 0는 걷기, 몸의 방향 전환, 시선 조절, 균형 유지, 손을 이용한 물체 조작을 하나의 정책으로 조율하는 전신 월드 액션 모델이다.
Omega 0는 걷기, 몸의 방향 전환, 시선 조절, 균형 유지, 손을 이용한 물체 조작을 하나의 정책으로 조율하는 전신 월드 액션 모델이다. 모델은 행동을 바로 출력하기보다 다음에 로봇이 보게 될 시각적 상태를 먼저 예측한 뒤, 그 결과에 맞는 전신 동작을 생성한다. [1]
Omega HOME 데이터셋은 40.3시간의 실제 가정 환경 데이터와 4,827개의 원격조작 에피소드, 24개 가정용 작업으로 구성됐다. [1]