샤오미는 2026년 7월 15일 로봇용 합성 학습 데이터를 생성·변형하기 위한 380억 파라미터 멀티모달 자기회귀 월드 모델 Xiaomi Robotics U0를 공개했다. 가중치, 추론 도구, Gradio 진입점, AR·FlashAR 백엔드가 Apache 2.0으로 제공되며, 9월에는 40억 파라미터 및 시퀀스 계열 가중치와 FSDP 학습 코드도 추가됐다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
질문에 언급된 날짜는 두 차례의 업데이트가 섞인 것으로 보인다. 샤오미의 대규모 Xiaomi-Robotics-U0 공개는 2026년 7월 15일에 보도됐고, 9월에는 저장소를 통해 40억 파라미터 모델과 시퀀스 모델 가중치, FSDP 학습 코드가 추가로 발표됐다. 7
9
Xiaomi-Robotics-U0의 핵심은 로봇 동작을 출력하는 모델이 아니라, 로봇 학습에 쓸 수 있는 제어 가능한 합성 시각 데이터를 대량으로 만드는 생성 시스템이라는 점이다. 로봇 관측 화면, 조작 상황, 카메라 시점, 장면의 일관성처럼 학습에 중요한 요소를 유지하면서 로봇 중심의 시나리오를 새로 만들거나 바꾸는 용도를 내세운다. 1
6
대표 모델 U0는 380억 파라미터 멀티모달 자기회귀 월드 파운데이션 모델로 소개된다. 공개 패키지에는 모델 가중치, 소스 및 추론 코드, 조합형 설정(config), Gradio 진입점, 자기회귀(AR) 및 FlashAR/vLLM 추론용 패치가 포함됐다. 저장소 라이선스는 Apache-2.0이다. 2
4
9
9월에는 Xiaomi-Robotics-U0-4B, Xiaomi-Robotics-U0-Sequence, Xiaomi-Robotics-U0-4B-Sequence 가중치와 FSDP 학습 코드가 더해졌다. 따라서 U0는 초기의 대형 체크포인트 하나만을 뜻하기보다, 확장 중인 모델 계열로 보는 편이 맞다. 9
샤오미는 하나의 아키텍처가 다음 작업을 지원한다고 설명한다.
가장 눈에 띄는 활용처는 데이터 증강이다. 실제 로봇의 궤적 또는 관측 데이터를 출발점으로 삼아 배경, 조명, 재질, 물체 등을 바꿔 새로운 학습 예시를 만든다. 모든 조건 변화마다 실제 로봇으로 데이터를 다시 수집하지 않아도 된다는 것이 목표다. 3
7
일반 이미지 생성기가 한 장의 완성도 높은 이미지를 만드는 데 주로 최적화된다면, U0는 로봇에 필요한 기하 구조와 상호작용 맥락을 보존한 채 조건부 변형을 만드는 데 초점을 둔다. 3
7
U0는 자기회귀 시각 모델이다. 확산(diffusion) 모델처럼 반복적인 노이즈 제거를 수행하는 대신, 이산화된 시각 토큰을 순서대로 생성한다. 보도 자료는 EMU3.5와 Qwen-3-32B를 결합한 기반 모델과, 여러 지원 작업에서 공유하는 이산 시각 토크나이저를 언급한다. 4
7
이미지와 로봇 관측, 시간에 따른 시퀀스를 토큰 흐름으로 다루기에는 자연스러운 방식일 수 있다. 다만 고해상도 이미지는 토큰을 순차적으로 생성해야 하므로 비용이 커질 수 있으며, 이것이 샤오미가 별도의 고속 추론 경로를 결합한 배경이다. 1
5
FlashAR+는 시각 토큰 디코딩을 가속하는 샤오미의 방식이다. 모든 토큰을 한 개씩 엄격히 순서대로 만들지 않고, 대각선 방향의 병렬 생성을 이용한다. vLLM은 조건부 프리픽스 처리, 배치 실행, Paged KV 캐시 관리를 맡고, FlashAR+의 디코딩 규칙은 유지하는 방식으로 통합된다. 1
9
샤오미는 FlashAR와 vLLM 조합이 H20 GPU 1장 기준 이미지 1장을 5.44초에 생성했으며, 자체 기존 AR eager 구현보다 82.86배, FlashAR eager보다 3.04배 빨랐다고 밝혔다. 7
다만 비교 기준을 분명히 해야 한다. 이는 샤오미가 보고한 설정에서 자체 자기회귀 eager 기준선과 비교한 수치다. U0가 확산형 이미지 생성기, 다른 로봇 데이터 파이프라인, 최상위 범용 영상 생성 시스템보다 83배 빠르다는 뜻은 아니다. 하드웨어, 이미지 설정, 배치 크기, 모델 경로, 작업 유형에 따라 실제 처리량은 달라질 수 있다. 1
7
저장소는 AR·FlashAR 모두에 eager 및 vLLM 백엔드를 지원한다. 그러나 모든 기능이 모든 엔진에서 동일하게 지원되거나 같은 성능을 낸다는 의미는 아니다. 시간축 처리나 특수 멀티모달 워크플로를 도입하려는 팀이라면, 사용하려는 체크포인트와 추론 경로를 개별적으로 검증할 필요가 있다. 9
| 시스템 유형 | 주된 목적 | U0의 위치 |
|---|---|---|
| 로봇 정책 모델 | 관측을 로봇 행동으로 변환 | U0는 정책을 대체하지 않는다. 정책 학습 전 단계에서 합성 데이터 생성·증강을 담당하며, 분포 변화 상황에서의 정책 학습 개선이 주요 활용 주장이다. |
| 로봇 중심 월드·데이터 모델 | 로봇 장면, 관측, 궤적, 시뮬레이션성 데이터 생성 | U0의 차별점으로 제시된 것은 장면 합성, 전환, 이미지 편집, 영상 지향 롤아웃을 하나의 모델에 통합했다는 점이다. |
| 범용 이미지 생성 모델 | 폭넓은 텍스트·이미지 생성과 편집 | U0도 텍스트-이미지와 이미지-이미지를 지원하지만, 샤오미는 범용 이미지 품질의 전면적 우위보다 로봇 환경의 일관성을 강조한다. |
| 범용 영상 생성 모델 | 영화적·범용적 영상 생성 | U0의 영상 기능은 로봇 관측과 작업 맥락을 겨냥한다. 이를 근거로 개방형 범용 영상 품질에서 선도 모델을 능가한다고 보기는 어렵다. |
샤오미는 U0가 참여 모델 126개가 포함된 것으로 보고된 WorldArena에서 1위를 차지했으며, 지시 이행, 상호작용 품질, 다중 시점 일관성에서 강점을 보였다고 발표했다. 공식 프로젝트 페이지도 100개 이상 모델 중 1위라고 설명한다. 7
10
로봇 적용 측면에서는 U0가 생성한 합성 데이터를 추가했을 때, 낯선 조명과 배경 등 분포 밖(OOD) 조건에서 실제 로봇의 성공률이 36.9%에서 63.2%로 상승했다고 샤오미는 보고했다. 6
7
이 결과는 U0가 합성 데이터 증강 도구로서 가질 수 있는 가치를 뒷받침한다. 그러나 이는 프로젝트 측이 보고한 성과다. WorldArena 순위 하나만으로 모든 로봇, 정책, 작업, 시뮬레이터, 범용 이미지·영상 벤치마크에서의 우위가 입증되는 것은 아니다. 독립 재현에는 정확한 모델 버전, 프롬프트, 샘플링 설정, 평가 절차, 채점 구성, 비교 모델 버전이 필요하다. 7
10
저장소·가중치·추론 도구에 Apache-2.0이 적용된다는 설명은, 충분한 연산 자원을 보유한 개발자에게 비교적 접근하기 쉬운 선택지라는 뜻이다. 다만 실제 도입 시에는 체크포인트별 라이선스와 모델 문서를 확인하고, 원본 데이터 및 생성된 학습 데이터의 출처와 허용 사용 범위도 검토해야 한다. 4
9
영상 생성은 통합 기능 목록에 포함돼 있다. 하지만 제공된 공개 자료만으로는 최초 7월 출시 시점에 영상 체크포인트, 가속 경로, 학습 데이터, 평가 절차가 이미지·전환 기능만큼 완전하고 재현 가능하게 제공됐다고 단정하기 어렵다. 현재로서는 이미지 생성과 장면 전환 워크플로가 가장 명확히 문서화된 활용처로 보며, 영상 기능을 제품·연구 파이프라인의 중심에 둘 계획이라면 해당 경로를 직접 확인하는 편이 안전하다. 4
6
Xiaomi-Robotics-U0의 의미는 로봇 제어나 범용 미디어 생성 모델을 대체한다는 데 있기보다, 제어 가능하고 로봇 맥락에 맞는 합성 시각 데이터를 생성하는 대형 통합 자기회귀 파이프라인을 공개했다는 데 있다. 380억 파라미터 대표 모델, 후속 소형·시퀀스 가중치, 공개 도구, FlashAR+/vLLM 추론 경로는 로봇 연구팀과 개발팀이 데이터 증강을 실험할 수 있는 출발점을 제공한다. 7
9
자체 기준선 대비 82.86배 가속, WorldArena 선두, OOD 정책 성공률 36.9%→63.2%라는 주장은 주목할 만하다. 다만 실제 가치는 목표 로봇, 작업량, 하드웨어, 평가 프로토콜에서 직접 검증한 뒤 판단해야 한다. 7
10
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
샤오미는 2026년 7월 15일 로봇용 합성 학습 데이터를 생성·변형하기 위한 380억 파라미터 멀티모달 자기회귀 월드 모델 Xiaomi Robotics U0를 공개했다.
샤오미는 2026년 7월 15일 로봇용 합성 학습 데이터를 생성·변형하기 위한 380억 파라미터 멀티모달 자기회귀 월드 모델 Xiaomi Robotics U0를 공개했다. 가중치, 추론 도구, Gradio 진입점, AR·FlashAR 백엔드가 Apache 2.0으로 제공되며, 9월에는 40억 파라미터 및 시퀀스 계열 가중치와 FSDP 학습 코드도 추가됐다.
WorldArena 1위와 실제 로봇 OOD 성공률 36.9%→63.2% 개선은 유망한 프로젝트 발표 수치지만, 모든 로봇·정책·생성 작업에서의 우위를 뜻하는 독립 검증 결과로 일반화할 수는 없다.