중국에서는 휴머노이드 로봇 데이터 수집·훈련 센터가 최소 90곳 운영 중이거나 건설되고 있는 것으로 전해졌다. [13] Lightwheel AI의 EgoSuite Open100K는 1만5,000개 이상의 작업과 실제 수집 장면을 아우르는 10만 시간 규모의 1인칭 인간 행동 데이터 세트를 목표로 하며, 첫 1만 시간은 Hugging Face에서 공개됐다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did the 2026 World Robot Conference in Beijing reveal about China’s shift from building humanoid-robot bodies to collecting the data ne. Article summary: The conference signaled a strategic shift: China’s humanoid-robot race is moving from demonstrating capable bodies toward building the data pipelines, sensors, compute components, and models needed for general-purpose em. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
2026년 베이징 세계로봇대회(WRC)는 중국 휴머노이드 로봇 산업의 방향 전환을 선명하게 보여줬다. 경쟁의 중심이 점점 더 정교한 로봇 몸체를 만드는 데서, 그 몸체가 무엇을 보고 어떻게 움직일지 학습시키는 데이터 인프라를 구축하는 쪽으로 옮겨가고 있는 것이다.
중국 전역에서는 휴머노이드 로봇 데이터 수집·훈련 센터가 최소 90곳 운영 중이거나 건설되고 있는 것으로 전해졌다. 투자 우선순위가 로봇의 하드웨어에서 ‘로봇 두뇌’의 학습 기반으로 이동하고 있다는 신호다. 다만 산업 규모가 커졌다는 사실만으로, 이 데이터가 서로 다른 로봇과 작업 현장에 통하는 지능으로 이어진다고 단정할 수는 없다. 13
휴머노이드 로봇을 학습시키는 데 필요한 것은 사진이나 텍스트만이 아니다. 유용한 물리 지능을 만들려면 사람이 무엇을 보고, 어떻게 움직이며, 물체가 힘에 어떻게 반응하고, 행동이 시간에 따라 어떻게 전개되는지를 함께 기록해야 한다.
따라서 1인칭 영상, 손과 전신의 자세 정보, 깊이 데이터, 촉각 신호, 로봇의 관절·상태 데이터가 모두 중요해진다. 이는 언어 모델이 인터넷상의 방대한 텍스트를 학습하는 것과 달리, 로봇에는 ‘행동이 일어나는 과정’ 자체가 학습 교재가 된다는 뜻이다.
Lightwheel AI는 이런 구상을 EgoSuite-Open100K로 구체화했다. 이 데이터 세트는 총 10만 시간 분량의 1인칭 인간 행동 데이터를 목표로 하며, 1만5,000개 이상의 작업과 1만5,000개 이상의 실제 수집 장면을 포함한다. 머리와 손목에 장착한 카메라 시점에 손·전신 자세, 의미론적 주석, 깊이 정보를 더해 세밀한 조작, 전신 협응, 사건의 내용과 시간적 순서를 학습할 수 있도록 설계됐다. 첫 1만 시간은 Hugging Face를 통해 공개됐으며, AtomGit 배포도 추진되고 있다. 1
12
인간 시연 데이터의 장점은 분명하다. 값비싼 로봇을 모든 상황에 투입하지 않고도 일상적인 움직임과 물체 조작 사례를 폭넓게 수집할 수 있다. 하지만 인간이 수행한 행동이 곧바로 로봇의 경험과 같아지는 것은 아니다. 사람은 균형, 마찰, 접촉 변화에 자연스럽게 대응하지만, 로봇은 자신의 센서와 구동계를 통해 그런 물리적 효과를 감지하고 제어해야 한다.
SenseTime 산하 Intelligent Industries Research Institute의 톈펑 연구원은 텔레오퍼레이션, 모션 캡처, 합성 데이터, 실제 생산라인 수집 등을 포함한 6가지 데이터 수집 패러다임이 병행되고 있다고 설명했다. 13
각 방식은 서로 다른 문제를 포착한다.
톈펑 연구원이 제시한 비용 차이는 상당하다. 로봇 본체 없이 인간의 행동을 수집하는 방식은 실제 로봇으로 시연을 모으는 비용의 약 5분의 1 수준이 될 수 있다. 대신 그 데이터가 숙련된 현장 노동자보다 전문 데이터 수집 인력이 작업을 수행하는 방식에 치우칠 가능성이 있다. 13
그렇다고 인간 데이터를 배제해야 한다는 의미는 아니다. 인간 시연은 텔레오퍼레이션, 로봇 상태 데이터, 시뮬레이션, 실제 배치 현장의 피드백과 함께 더 큰 학습 체계의 한 층으로 활용해야 한다는 뜻에 가깝다.
이번 대회가 던진 또 하나의 메시지는 로봇 인프라의 범위가 넓어지고 있다는 점이다. 이제 핵심 부품은 모터, 배터리, 로봇 프레임에 그치지 않는다. 시연과 감각·운동 행동을 기록하는 장비도 산업 생태계의 일부가 된다.
1인칭·휴대형 캡처 장치, 데이터 장갑, 촉각 인터페이스, 카메라, 마이크로컨트롤러, 메모리, 아날로그 부품까지 모두 데이터 파이프라인에 편입된다. 이는 대규모 시연 데이터를 더 낮은 비용으로 확보할 수 있는 길을 열지만, 동시에 표준화라는 숙제를 만든다. 센서, 보정 절차, 동작 공간, 미들웨어, 라벨링 방식이 제각각이면 각기 다른 데이터 세트를 한데 묶기 어렵기 때문이다. 13
업계에서 말하는 **‘섬 데이터(island data)’**가 바로 이 문제를 가리킨다. 특정 하드웨어와 소프트웨어 스택에서 만들어진 기록이 다른 로봇이나 플랫폼으로 이동하지 못하고 고립되는 현상이다.
공개 데이터 세트는 문제를 줄이는 데 도움이 될 수 있지만, 공개됐다는 사실만으로 재사용성이 보장되지는 않는다. 서로 다른 장비에서 수집한 데이터를 결합하려면 공통 스키마, 보정 메타데이터, 시간 동기화 규칙, 인터페이스, 평가 프로토콜이 필요하다. 데이터 양이 산업 전반의 공통 역량으로 축적되려면 이런 기반이 먼저 갖춰져야 한다. 13
또 하나의 미해결 질문은 언어와 영상 분야에서 익숙해진 패턴이 로봇에도 적용되는지다. 즉, 데이터와 모델 규모를 키우면 로봇의 능력도 예측 가능하게 향상되는가 하는 문제다.
Generalist AI가 2025년 11월 공개한 GEN-0 보고서는 제한적이지만 긍정적인 단서를 제시했다. 회사의 실험에서는 더 다양해지는 감각·운동 데이터를 소형 모델이 충분히 흡수하지 못했고, 이를 **‘모델 경화(ossification)’**라고 불렀다. 반면 모델 규모가 커지자 성능 향상이 이어졌으며, 약 70억 개 파라미터 부근에서 전환점이 관찰됐다는 설명이다. 36
의미 있는 결과이지만, 이것이 로봇 분야 전체에 적용되는 법칙으로 확립된 것은 아니다. 하나의 회사가 사용한 모델과 데이터, 평가 설계에 기반한 실험 결과이기 때문이다. 로봇에는 언어 모델과 다른 난제도 있다. 정책이 특정한 몸체를 통해 특정 환경에서 실제 물리적 제약을 받으며 행동해야 한다는 점이다.
따라서 중요한 것은 모델이 단순히 충분히 큰가가 아니다. 학습 데이터에 적절한 물리 신호가 포함돼 있는지, 학습한 정책이 다른 형태의 로봇과 실제 작업으로 이전되는지가 핵심이다.
중국의 제조 역량은 실험과 데이터 수집을 위해 로봇을 대량 배치하는 데 강점으로 작용한다. 그러나 출하 대수만 보면 시장이 실제로 성숙하고 있는지 오판할 수 있다. 많은 로봇이 반복적인 수익을 내는 현장보다 기술 시연, 연구, 데이터 수집에 사용되고 있을 수 있기 때문이다.
Interact Analysis에 따르면 2025년 전 세계 휴머노이드 로봇 생산량은 2만 대를 넘어섰지만, 실제 현장에 배치된 비중은 약 10%에 그쳤다. 대부분은 연구, 데이터 수집 또는 엔터테인먼트 용도로 사용됐다. 같은 분석은 중국을 공급과 초기 도입 모두를 이끈 국가로 지목했다. 21
이 배경은 중국의 데이터 센터 확대를 해석할 때 중요하다. 정부 지원, 대량 구매, 데이터 재구매 프로그램은 로봇과 시설 수, 기록 시간의 증가를 빠르게 만들어 학습 생태계를 조성할 수 있다. 그러나 그것만으로 고객이 비용을 절감하거나 생산량을 늘리는 로봇에 실제로 비용을 지불할 것이라는 증거가 되지는 않는다.
베이징 대회가 보여준 것은 중국이 이미 범용 로봇 지능을 완성했다는 사실이 아니다. 중국이 가능한 해법을 구성할 요소들을 이례적인 규모로 조립하고 있다는 사실이다.
Lightwheel AI가 제시한 생태계 구상도 이 같은 순환 구조를 겨냥한다. 공개 데이터 표준을 만들고, 모델 실패를 바탕으로 데이터를 추가 수집하며, 데이터와 모델 설계를 함께 최적화하겠다는 접근이다. 1
결론은 ‘중국이 로봇의 두뇌를 만들었다’는 식으로 넓게 말하기보다 더 좁고 정확하게 표현하는 편이 낫다. 중국은 그런 두뇌가 가능해지도록 데이터 공장과 측정 장비, 학습용 데이터 세트를 구축하고 있다. 이 인프라가 실제로 폭넓게 쓰이는 휴머노이드 로봇으로 이어질지는 데이터 품질, 물리적 충실도, 하드웨어 간 호환성, 그리고 시연장과 연구실 밖에서 로봇이 지속적인 가치를 만들어낸다는 증거에 달려 있다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
중국에서는 휴머노이드 로봇 데이터 수집·훈련 센터가 최소 90곳 운영 중이거나 건설되고 있는 것으로 전해졌다. [13]
중국에서는 휴머노이드 로봇 데이터 수집·훈련 센터가 최소 90곳 운영 중이거나 건설되고 있는 것으로 전해졌다. [13] Lightwheel AI의 EgoSuite Open100K는 1만5,000개 이상의 작업과 실제 수집 장면을 아우르는 10만 시간 규모의 1인칭 인간 행동 데이터 세트를 목표로 하며, 첫 1만 시간은 Hugging Face에서 공개됐다.
업계의 진짜 과제는 단순한 데이터 양이 아니라 인간 시연 데이터와 로봇의 물리 데이터를 결합하고, 하드웨어·데이터 표준 및 지속 가능한 매출을 확보하는 데 있다.