아지봇은 GE Act 2.0의 체화 조작 데이터 규모를 300시간에서 3만 시간으로 100배 확장했을 때, 실제 로봇 제로샷 성공률이 G1 OP에서 17.1%→44.1%, G2 90D에서 13.4%→31.1%로 높아졌다고 보고했다. 이 모델은 웹 동영상 사전학습 모델을 가져와 적응시키는 방식이 아니라, 무작위 초기화 상태에서 조작 데이터로 학습했다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is AgiBot’s GE-Act 2.0 native world-action model, and how do its random-initialization training approach, 100-fold embodied-data scalin. Article summary: GE-Act 2.0 is AgiBot’s “native” world–action model: its visual representation, future-state generation, and action-prediction components are trained from random initialization on manipulation data, rather than adapting a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
GE-Act 2.0은 아지봇(AgiBot)이 로봇 조작용으로 처음부터 구축한 **월드-액션 모델(World–Action Model)**이다. 일반 웹 데이터로 미리 학습한 비디오 모델을 가져와 적용하는 대신, 학습 가능한 시각·미래 상태·행동 구성 요소를 무작위 초기화한 뒤 체화 조작 데이터로 사전학습한다. 핵심 주장은 단순히 데이터가 늘수록 성능이 좋아진다는 데 있지 않다. 아지봇은 학습 규모를 300시간에서 3만 시간으로 키우자, 이전에는 실패하던 정교한 조작 과제가 성공하기 시작했다고 보고했다. 17
이는 의미 있는 연구 결과지만, 해석에는 선을 그을 필요가 있다. 근거는 두 종류의 로봇 본체와 100개 원자 과제를 대상으로 한 아지봇의 평가 프로토콜에서 나왔다. GE-Act 2.0이 어떤 가정집·공장·로봇 하드웨어에서도 자율적으로 작업할 수 있음을 입증한 것은 아니다.
월드-액션 모델은 지각, 예측, 제어를 연결한다. 예를 들어 언어 지시가 ‘물체를 특정 위치에 놓으라’는 것이라면, 시스템은 현재 장면을 파악하고 성공한 직후의 상태가 어떻게 보여야 하는지 예측한 뒤, 이를 만들 모터 명령을 내야 한다.
GE-Act 2.0은 이 과업을 다음 세 구성 요소로 나눈다.
아지봇은 이 학습법을 **지식 정렬 선택 최적화(KASO·Knowledge-Aligned Selective Optimization)**라고 부른다. 논문은 상호 보완적인 데이터로 시각 계획과 행동 학습을 사전학습할 수 있도록 두 부분을 조율하는 방식으로 이를 제시한다. 17
연구진은 단일 RTX 5090에서 행동 청크를 추론하는 데 104밀리초가 걸린다고도 보고했다. 조작 정책은 관측과 반응을 계속 반복해야 하므로, 그럴듯한 시각 계획만 만들고 다음 제어 명령 생성이 느리다면 충분하지 않다. 5
많은 로봇 학습 시스템은 광범위한 이미지나 웹 비디오 코퍼스로 먼저 학습한 모델의 도움을 받는다. 반면 GE-Act 2.0은 학습 가능한 생성·행동 구성 요소를 처음부터 초기화하고 조작 데이터로 훈련한다. 17
따라서 이 스케일링 실험은 더 명확한 질문을 던진다. 기존 웹 비디오 기반 파운데이션 모델의 가치를 측정하는 것이 아니라, 물리적 상호작용과 행동에 연결된 체화 데이터를 더 많이 투입했을 때 로봇 조작 능력이 체계적으로 개선되는지를 보는 것이다.
보고된 학습 구성에는 로봇 텔레오퍼레이션 궤적, 인간 1인칭 영상, 라벨 없는 롤아웃 데이터, 실패 데이터 등 여러 데이터 유형을 활용할 수 있다. 로봇 시연 데이터 수집은 비용이 크기 때문에, 완벽하지 않거나 일부 라벨만 있는 상호작용 데이터에서도 배울 수 있다면 데이터 수집의 실용성이 높아질 수 있다. 6
20
아지봇은 조작 데이터 300시간, 1,200시간, 5,000시간, 3만 시간을 사용해 각각의 모델을 학습했다. 가장 작은 조건과 가장 큰 조건의 차이는 100배다. 4
17
주요 평가는 실제 로봇에서의 제로샷 시험으로 설계됐다.
이 프로토콜에서 보고된 전체 성공률은 데이터 규모와 함께 상승했다.
| 로봇 본체 | 300시간 성공률 | 3만 시간 성공률 |
|---|---|---|
| G1-OP | 17.1% | 44.1% |
| G2-90D | 13.4% | 31.1% |
이는 GE-Act 2.0 연구가 보고한 결과다. 3
17
가장 직접적인 결론은 이 모델과 과제 분포에서는 체화 데이터 증가가 제로샷 과제 성공률의 큰 향상과 연관됐다는 것이다. 연구진은 5,000시간에서 3만 시간 구간의 곡선에서 뚜렷한 포화 징후가 없었다고 보고하며, 추가 스케일링도 도움이 될 수 있다고 해석했다. 5
평균 성공률이 높아졌다는 것은 원래 할 수 있던 작업을 더 안정적으로 수행하게 됐다는 뜻일 수 있다. 하지만 아지봇은 대형 모델·데이터 조건에서 한 단계 더 강한 현상이 나타났다고 주장한다. 성공률이 0보다 큰 과제 자체가 늘어났다는 것이다.
G1-OP에서는 300시간에서 3만 시간으로 학습 데이터를 확대했을 때, 성공 완료가 관측된 원자 과제가 100개 중 39개에서 76개로 증가했다고 보고됐다. 4
대표 사례로는 다음이 언급됐다.
이것이 논문이 말하는 ‘점등’ 효과의 근거다. 보고된 시험에서 데이터 스케일링은 이미 가능했던 능력의 실행 품질만 높인 것이 아니라, 작은 규모에서는 실패했던 정교한 기술이 제로샷 조건에서 가능해지는 것과 연관됐다.
다만 ‘점등’을 갑작스러운 범용지능의 증거로 읽어서는 안 된다. 이는 한정된 벤치마크에서 관측된 과제 커버리지의 표현이다. 더 다양한 물체, 더 긴 작업 단계, 안전이 중요한 환경, 새로운 로봇 설계에서도 같은 패턴이 유지되는지는 아직 열린 질문이다.
G2-90D는 이 연구에서 서로 다른 로봇 본체 사이의 전이 가능성을 보여주는 근거다. 아지봇에 따르면 바퀴형 이동 매니퓰레이터인 G2-90D의 데이터는 공동 학습 데이터에서 2% 미만이었지만, 소규모와 대규모 데이터 조건 사이의 전체 성공률은 17.7%포인트 상승했다. 3
17
이 결과는 시각 및 행동과 관련해 학습된 구조 중 일부가 서로 다른 로봇 몸체 사이에서 공유될 수 있음을 시사한다. 로봇마다 정책을 처음부터 다시 만들 필요가 없는 미래를 향한 유의미한 신호다.
그러나 이것이 하드웨어에 구애받지 않는 로봇 지능을 뜻하지는 않는다. 근거는 평가된 두 본체와 연구의 과제 분포로 제한된다. G2-90D도 공동 학습에 포함됐으므로, 완전히 새로운 임의의 로봇으로 데이터를 전혀 쓰지 않고 전이할 수 있음을 보여준 결과도 아니다.
GE-Act는 아지봇의 더 큰 Genie Envisioner(GE) 플랫폼에 속한다. 이 플랫폼은 하나의 비디오 생성 프레임워크 안에서 로봇 정책 학습, 평가, 시뮬레이션을 통합하는 구조로 설명된다. 18
이 구도에서 GE-Act는 행동 지향 구성 요소이고, GE-Sim은 평가와 개발을 위해 행동 조건부 롤아웃을 생성하는 월드 시뮬레이션 구성 요소다. 18
19
구분은 중요하다. GE-Act 2.0의 핵심 결과는 실제 로봇에서의 제로샷 시험에 기반한다. GE-Sim은 더 넓은 플랫폼의 관련 인프라일 수 있지만, 과제별 미세조정이나 평가용 시연 없이 보고된 실제 조작 과제를 수행했다는 중심 주장의 근거는 아니다.
아지봇은 시뮬레이션 지향 벤치마크에서의 미세조정 결과도 보고했다. 제공된 자료에 따르면, 미세조정된 GE-Act 2.0은 RoboTwin 미지 환경 시험에서 60.52% 성공률을, GenieSim 지시 이행 시험에서 0.770점을 기록했다. 후자는 비교 대상인 π0.5와 GR00T N1.7보다 높았다고 보고됐다. 20
이 결과는 적응 능력과 벤치마크 성능을 보는 데 유용할 수 있지만, 실제 로봇 제로샷 실험과는 다른 질문에 답한다. 미세조정 벤치마크 점수를 과제별 적응 없이 같은 역량을 달성했다는 증거로 사용해서는 안 된다.
GE-Act 2.0이 주목받는 이유는 체화 AI의 단순하지만 중요한 명제를 시험했기 때문이다. 조작 데이터로 직접 학습한 월드-액션 모델이 데이터 증가에 따라 예측 가능하게 개선될 수 있는가라는 질문이다.
아지봇이 보고한 실험에서 답은 ‘그렇다’이다. 학습 데이터를 300시간에서 3만 시간으로 늘리자 G1-OP와 G2-90D에서 제로샷 성공률이 크게 올랐고, 수행 가능한 과제 범위도 넓어졌으며, 수건 접기와 컵 포개기 같은 정교한 기술이 대규모 조건에서 나타났다. 3
4
17
다만 적절한 결론은 ‘범용 로봇의 완성’보다 좁다. GE-Act 2.0은 통제된 실제 로봇 평가에서 체화 조작 데이터를 스케일링하면 새롭고 측정 가능한 능력이 나타날 수 있다는 증거를 제시한다. 이를 일반적인 로봇 자율성의 해법으로 보기 전에는 독립적 재현, 더 폭넓은 하드웨어 시험, 긴 작업 단계와 안전성에 대한 강한 평가가 더 필요하다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
아지봇은 GE Act 2.0의 체화 조작 데이터 규모를 300시간에서 3만 시간으로 100배 확장했을 때, 실제 로봇 제로샷 성공률이 G1 OP에서 17.1%→44.1%, G2 90D에서 13.4%→31.1%로 높아졌다고 보고했다.
아지봇은 GE Act 2.0의 체화 조작 데이터 규모를 300시간에서 3만 시간으로 100배 확장했을 때, 실제 로봇 제로샷 성공률이 G1 OP에서 17.1%→44.1%, G2 90D에서 13.4%→31.1%로 높아졌다고 보고했다. 이 모델은 웹 동영상 사전학습 모델을 가져와 적응시키는 방식이 아니라, 무작위 초기화 상태에서 조작 데이터로 학습했다. 시각 계획과 역동학 모델을 결합해 실행 가능한 로봇 동작을 만든다.
가장 주목할 결과는 큰 데이터셋에서 수건 접기와 컵 포개기처럼 작은 규모에서는 성공하지 못했던 기술이 수행 가능해졌다는 점이다. 다만 검증 범위는 두 로봇과 정해진 과제 분포에 한정된다.