Atlas는 텍스트, 이미지, 영상, 3D 정보를 하나의 공간적 맥락에서 처리해 카메라 제어 영상과 3D 장면 재구성을 수행하도록 설계된 멀티모달 월드 모델입니다. 사용자는 기준 이미지와 카메라 위치 또는 이동 경로를 지정할 수 있으며, 모델은 촬영되지 않은 영역까지 추론해 새로운 시점의 이미지와 영상을 생성합니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Atlas, the multimodal AI world model launched by Fei-Fei Li’s World Labs, and how does it work, what 3D generation and reconstructio. Article summary: Atlas is World Labs’ next-generation “omni” world model: a single pretrained system that natively accepts text, images, video, and 3D/camera information to generate, reconstruct, and simulate spatially consistent environ. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
월드 랩스(World Labs)는 Atlas를 공간 지능을 위한 ‘옴니(omni)’ 월드 모델이라고 소개합니다. 텍스트, 이미지, 영상, 3D 정보를 한 시스템에서 본래부터 처리하도록 학습한 모델로, 그 목표는 그럴듯한 영상 한 편을 만드는 데 그치지 않습니다. 카메라가 움직이거나 장면이 달라질 때 공간의 구조와 사물의 관계가 일관되도록 이미지와 영상을 생성하고, 실제 공간을 3D로 재구성하는 것이 핵심입니다. 9
이 점에서 Atlas는 일반적인 이미지·영상 생성 모델과 구별됩니다. 기존 모델은 대체로 프레임마다 시각적으로 자연스러운 결과를 만드는 데 최적화돼 있습니다. 반면 Atlas는 카메라 시점, 사물의 위치, 장면 전체의 공간적 관계를 함께 유지하는 방향에 초점을 맞춥니다.
월드 랩스에 따르면 Atlas는 처음부터 사전 학습된 멀티모달 자기회귀 확산 트랜스포머입니다. 시각 정보를 하나의 공유된 공간적 맥락 안에서 위치와 함께 이해한 뒤, 그 맥락에 맞는 새로운 프레임·시점·3D 출력을 예측합니다. 9
사용자는 한 장 또는 여러 장의 기준 이미지와 카메라 정보, 혹은 직접 설계한 카메라 이동 경로를 입력할 수 있습니다. Atlas는 이를 바탕으로 요청된 시점의 장면을 렌더링하고, 원본에서 직접 관찰되지 않은 부분도 추론해 채웁니다. 이때 보이지 않는 영역은 실제 측량값을 복원한 것이 아니라, 입력된 단서와 모델이 학습한 시각적 패턴을 바탕으로 추정됩니다.
주요 기능은 크게 두 가지입니다.
월드 랩스는 동일한 공간 표현이 조명, 움직임, 배경, 사물 배치 등을 바꾸는 시뮬레이션에도 활용될 수 있다고 설명합니다. 이는 향후 로보틱스 작업을 염두에 둔 설계입니다. 9
월드 랩스가 공개한 Atlas의 생성 모드는 다음과 같습니다.
회사는 카메라 제어를 ‘픽셀 퍼펙트(pixel-perfect)’라고 표현합니다. 카메라 경로를 나중에 편집하는 부가 기능이 아니라, 생성 과정 자체의 핵심 입력으로 취급한다는 의미입니다. 이에 따라 기존 영상을 다른 구도로 재구성하거나, 가상 카메라 움직임을 합성하거나, 적은 수의 시각 자료만으로 새로운 장면을 만들 수 있다는 설명입니다. 9
결국 Atlas의 차별점은 ‘무엇을 만들 것인가’를 프롬프트로 정하고, ‘어디에 무엇이 있으며 어떻게 바라볼 것인가’를 이미지와 카메라 정보로 통제하려는 데 있습니다. 생성형 영상과 전통적인 3D 제작 파이프라인 사이를 겨냥한 접근이라고 볼 수 있습니다.
월드 랩스는 Atlas가 한 장부터 수십 장의 입력 이미지로 실제 장면을 재구성할 수 있다고 말합니다. 두세 장의 사진만으로도 충실한 결과를 얻는 경우가 있으며, 추론보다 정확도를 우선할 때는 100개가 넘는 시점의 이미지도 활용할 수 있다는 설명입니다. 9
출력물은 새로운 시점의 이미지뿐 아니라 명시적인 3D 표현도 포함하도록 설계됐습니다. 특정 각도에서만 자연스럽게 보이는 영상을 만드는 데 머무르지 않고, 추가 시점을 생성할 만큼 장면을 표현하려는 것입니다.
다만 중요한 한계가 있습니다. 입력 이미지가 적을수록 가려진 표면과 보이지 않는 공간은 모델이 추정해야 합니다. 결과가 매우 사실적으로 보여도 가려진 사물의 형태, 숨겨진 방, 실제 치수, 표면의 기하 구조가 틀릴 수 있습니다. 따라서 시각적 완성도를 실제 측량 수준의 검증된 3D 재구성과 동일시해서는 안 됩니다.
월드 랩스는 Atlas가 자사의 재구성 평가에서 최신 전문 3D 재구성 모델보다 우수한 성능을 보였다고 주장합니다. 공개 자료에는 카메라 조건부 생성과 3D 재구성에 대한 정량 평가가 제시돼 있지만, 하나의 벤치마크만으로 Atlas의 전체적인 범용성을 평가할 수는 없다고 회사 스스로도 설명합니다. 9
회사가 공개한 결과는 의미 있는 참고 자료지만, 독립적인 검증과는 다릅니다. 현재 확인 가능한 자료에는 모든 데이터셋과 평가 절차, 모델별 세부 점수, 불확실성 추정치, 모델 가중치, 제3자 재현 결과를 포함한 완전한 재현 평가 패키지가 제시돼 있지 않습니다. 따라서 성능 우위는 확정된 업계 표준이라기보다 월드 랩스가 발표한 회사 측 결과로 이해하는 편이 정확합니다.
특히 다음 항목에 대한 추가 검증이 필요합니다.
Marble은 월드 랩스가 제공해 온 사용자용 제품으로, 텍스트·이미지·영상·파노라마·간단한 3D 구조를 입력해 지속적으로 탐색할 수 있는 3D 세계를 만드는 서비스입니다. 생성된 공간은 사용자가 직접 돌아다니며 살펴보고, 이후 다른 제작·개발 작업에 활용할 수 있습니다. 6
Atlas는 Marble의 이름을 바꾼 기능이 아니라, 월드 랩스가 앞으로의 제품 전략을 위해 개발한 차세대 기반 모델에 가깝습니다. 회사는 향후 Marble 버전과 다른 제품에 Atlas를 적용할 계획이라고 밝혔습니다. 9
정리하면 Atlas가 보다 범용적인 공간 모델을 제공하고, Marble은 사용자가 생성된 세계를 만들고 감상하는 접근 가능한 제품 역할을 맡는 구조입니다. Marble 문서 역시 텍스트, 이미지, 영상 등을 이용해 세계를 만들고 생성된 공간을 탐색하는 흐름을 설명합니다. 6
월드 랩스는 텍스트, 이미지, 파노라마, 여러 시점의 이미지, 영상으로 탐색 가능한 3D 세계를 생성하는 공개 인터페이스인 World API를 선보였습니다. API 문서에 따르면 애플리케이션이 생성 요청을 보낸 뒤 작업이 완료되면 생성된 세계를 조회하는 비동기 방식으로 작동합니다. 8
3
이는 Atlas 자체를 내려받아 로컬 컴퓨터에서 실행하거나 실시간 모델로 직접 호출할 수 있다는 뜻은 아닙니다. 현재 공개 문서는 비동기 세계 생성과 결과 조회에 초점을 두고 있으며, 공개 Atlas 모델 엔드포인트나 로컬 가중치, 실시간 추론 옵션이 제공된다는 내용은 확인되지 않습니다. 3
8
9
개발자 입장에서 현재 공개된 제품 접점은 Marble과 World API를 이용한 세계 생성 흐름입니다. 연구 발표에서 설명된 Atlas의 모든 기능에 개발자가 직접 접근할 수 있다고 보기는 어렵습니다.
카메라 제어 생성은 아티스트가 영상을 다른 구도로 재구성하거나, 가상 카메라 이동을 만들고, 적은 수의 참고 이미지에서 새로운 쇼트를 제작하는 데 도움을 줄 수 있습니다. 핵심은 단일 생성 프레임이 아니라 공간적으로 통제 가능한 변형입니다. 9
Marble은 지속적이고 탐색 가능한 환경을 만드는 데 초점을 맞춥니다. Atlas는 이 방향을 확장해 게임과 가상 세계 제작자가 시점과 공간 관계를 유지하면서 장면을 생성하거나 재구성하도록 돕는 모델이 될 수 있습니다. 6
9
건축·산업·콘텐츠 제작자는 텍스트와 이미지 등 여러 참고 자료를 바탕으로 이동하며 살펴볼 수 있는 공간 콘셉트를 만들 수 있습니다. 서로 무관한 렌더링을 여러 장 비교하는 것보다, 시점을 바꿔가며 하나의 공간을 검토하고 수정하는 작업이 쉬워질 가능성이 있습니다. 6
9
월드 랩스는 스마트폰으로 촬영한 영상이나 일상적인 기록에서 시뮬레이션 환경을 만드는 ‘리얼-투-심(real-to-sim)’ 활용 사례도 제시합니다. 로봇 시점의 RGB·깊이 데이터를 생성하고, 물체·조명·움직임·배경을 바꿔가며 내비게이션과 조작 훈련에 사용할 수 있다는 구상입니다. 9
다만 시각적으로 현실적인 장면을 만든다고 해서 물리 법칙, 실제 치수, 충돌 결과, 시뮬레이션에서 현실 로봇으로의 전이 성능까지 정확하다는 뜻은 아닙니다. 이러한 주장은 작업별 별도 평가가 필요합니다.
Atlas는 현재 공개 자료에서 누구나 바로 사용할 수 있는 서비스로 소개되지 않았습니다. 월드 랩스는 얼리 액세스 신청을 받고 있으며, 현재 문서로 확인되는 공개 선택지는 Marble과 World API입니다. 9
8
검토한 출시 자료에는 Atlas의 표준 요금표, 모델 규모, 학습 데이터, 하드웨어 구성, 추론 지연시간, 처리량, 영상·세계 생성에 드는 컴퓨팅 비용도 공개되지 않았습니다. 9
이 정보는 실제 도입을 검토하는 기업과 제작자에게 중요합니다. 인상적인 데모만으로는 대규모 제작에 감당할 만한 비용인지, 대화형 작업에 충분히 빠른지, 여러 장면에서 결과를 안정적으로 재현할 수 있는지 판단하기 어렵기 때문입니다.
Atlas는 생성형 영상, 3D 재구성, 공간 시뮬레이션을 하나의 멀티모달 모델로 통합하려는 월드 랩스의 시도입니다. 가장 중요한 아이디어는 각 프레임을 서로 독립된 이미지로 다루는 대신, 카메라 위치와 3D 맥락을 생성 과정의 핵심 입력으로 삼는 것입니다.
월드 랩스가 제시한 기능은 상당합니다. 카메라를 통제한 이미지·영상 생성, 적은 시점에서의 장면 재구성, 명시적 3D 출력, 로보틱스 시뮬레이션 가능성이 한 모델에 담겨 있습니다. 하지만 현재 확인된 자료 기준으로 Atlas는 얼리 액세스 단계의 시스템입니다. 독립 평가, 가격, 지연시간, 물리적 정확도에 관한 데이터가 공개되기 전까지는 이를 검증이 끝난 상용 성능이라기보다 유망한 연구 결과이자 제품 방향으로 보는 것이 타당합니다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Atlas는 텍스트, 이미지, 영상, 3D 정보를 하나의 공간적 맥락에서 처리해 카메라 제어 영상과 3D 장면 재구성을 수행하도록 설계된 멀티모달 월드 모델입니다.
Atlas는 텍스트, 이미지, 영상, 3D 정보를 하나의 공간적 맥락에서 처리해 카메라 제어 영상과 3D 장면 재구성을 수행하도록 설계된 멀티모달 월드 모델입니다. 사용자는 기준 이미지와 카메라 위치 또는 이동 경로를 지정할 수 있으며, 모델은 촬영되지 않은 영역까지 추론해 새로운 시점의 이미지와 영상을 생성합니다.
월드 랩스는 Atlas가 한두 장부터 수십 장의 이미지로 실제 장면을 재구성하고, 최대 1분·1440p 영상과 360도 파노라마를 지원한다고 설명합니다.