Atlasは、テキスト・画像・動画・3D情報を同じ空間的コンテキストで扱い、カメラ位置を指定した画像・動画生成やシーンの3D再構成を行うWorld Labsの「omni」世界モデルです。 1枚から数十枚の画像を使い、直接見えていない場所も推定しながら新しい視点を生成できます。ただし、見えない部分の推定は実測に基づく完全な3D測量とは異なります。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is Atlas, the multimodal AI world model launched by Fei-Fei Li’s World Labs, and how does it work, what 3D generation and reconstructio. Article summary: Atlas is World Labs’ next-generation “omni” world model: a single pretrained system that natively accepts text, images, video, and 3D/camera information to generate, reconstruct, and simulate spatially consistent environ. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
World Labsが発表したAtlasは、空間知能(spatial intelligence)を目的とする「omni world model」です。テキスト、画像、動画、3D情報をもともと同じモデルで扱い、もっともらしい1本の動画を作るだけでなく、カメラの移動に合わせて空間の見え方を一貫して生成・再構成することを目指しています。 9
一般的な画像・動画生成AIは、フレームごとの見た目の自然さを主に最適化します。一方、Atlasが強調するのは、物体同士の位置関係、カメラの視点、背後にある環境の整合性です。つまり「その映像がきれいか」だけでなく、「カメラを動かしても同じ空間に見えるか」が中心になります。
World Labsによると、Atlasはゼロから事前学習したマルチモーダルな自己回帰型拡散トランスフォーマーです。入力された視覚情報を共有された空間コンテキスト内の位置と結び付け、その関係に合う新しいフレーム、視点、3D出力を予測します。 9
ユーザーは、1枚または複数枚の参照画像に加え、カメラ情報や設計したカメラパスを与えられます。Atlasは指定された視点からシーンを描画し、元画像では直接確認できなかった部分も推定して補います。
ここで重要なのは、見えない部分が「復元」されるとはいっても、物理的に確認済みの測定値が戻ってくるわけではないことです。入力画像と、モデルが学習した視覚的な傾向をもとに、もっともらしい形状や外観が推論されます。
Atlasの主な能力は、次の2つに整理できます。
同じ空間表現は、照明、物体の配置、背景、動きなどを変えるシミュレーションにも使えるとされており、ロボット向けのデータ生成への応用も想定されています。 9
World Labsが示しているAtlasの生成機能には、以下が含まれます。
同社はカメラ制御を「pixel-perfect」と表現しています。これは、カメラの軌道を後から映像に加えるのではなく、生成そのものの中心的な条件として扱うという意味です。少数の参照画像から別のカメラワークを合成したり、既存映像を異なる構図にリフレームしたりする用途が考えられます。 9
Atlasの狙いは、生成動画と従来型の3D制作の間を埋めることです。テキストは「何を存在させるか」を示し、画像やカメラ情報は「物体がどこにあり、どの方向から見えるか」の手掛かりになります。
World Labsは、Atlasが1枚から数十枚の入力画像を使って現実世界のシーンを再構成できると説明しています。2〜3枚の写真でも忠実な結果を得られることが多く、推測よりも忠実度を重視する場合には100以上の視点を取り込めるとしています。 9
出力は、新しい視点からの画像だけではありません。Atlasは、追加の視点を生成できるだけの情報を含む明示的な3D表現も作ることを目指しています。あらかじめ決められた1方向だけで正しく見える映像ではなく、カメラを動かしても空間的な関係が保たれるモデルを志向している点が特徴です。
ただし、入力画像が少ないほど、遮蔽された部分や画面外の領域は推定に頼ることになります。見た目が説得力のある再構成でも、隠れた物体、部屋の奥行き、表面の寸法、実際の形状が正しいとは限りません。したがって、Atlasの高い視覚品質を、測量用途で保証された3D再構成と同一視することはできません。
World Labsは、自社の再構成評価において、Atlasが最先端の専門3D再構成モデルを上回ったと説明しています。発表資料では、カメラ条件付き生成と3D再構成という2つの主要タスクについて定量評価を示していますが、Atlasの多様な能力全体を単一のベンチマークで測ることはできないともしています。 9
これは企業が公表した結果としては意味があります。しかし、独立機関による再現結果とは別のものです。今回確認できる資料には、データセットの完全な評価手順、各モデルの詳細スコア、誤差範囲、重み、第三者による追試をそろえた再現可能な評価パッケージは含まれていません。したがって、「専門モデルを上回る」という性能差は、現時点ではWorld Labsによる主張として読むのが適切です。
特に、次の条件では追加検証が必要です。
Marbleは、World Labsがすでに提供している、持続的に探索できる3D世界の作成サービスです。テキスト、1枚または複数枚の画像、動画、パノラマ、粗い3D構造などを入力し、ユーザーが歩き回れる空間を生成します。 6
Atlasは、Marbleの単なる機能名の変更ではありません。World Labsは、Atlasを次世代の基盤モデルとして、今後のMarbleやほかの製品に組み込む方針を示しています。 9
役割分担としては、Atlasがより汎用的な空間モデルを担い、Marbleがユーザーにとって扱いやすい作成・閲覧環境になる構図です。Marbleのドキュメントでも、テキスト、画像、動画などから世界を作り、生成後の空間を探索したり、後工程で利用したりする流れが説明されています。 6
World Labsは、Marbleの世界生成機能を外部アプリケーションから利用するためのWorld APIも公開しています。テキスト、画像、パノラマ、複数視点の入力、動画から、探索可能な3D世界を生成できるインターフェースです。ドキュメントでは、アプリケーションが生成リクエストを送信し、処理完了後に生成された世界を取得する非同期型の流れが示されています。 8
3
これは、Atlasそのものをダウンロードしたり、手元のPCでリアルタイム推論したりできるという意味ではありません。現時点で確認できる公開資料は、主にMarbleを使ったAPI経由の世界生成と取得を説明しており、Atlasの公開エンドポイント、ローカル実行用の重み、リアルタイム推論が提供されているとは示していません。 3
8
9
開発者にとって、現在の公開窓口はMarbleとWorld APIです。Atlasの発表で説明されたすべての機能に、直接アクセスできるとは限りません。
少数の参照画像からカメラの移動を作ったり、既存映像を別の構図にリフレームしたり、仮想カメラによるショットを合成したりできます。単発の画像生成よりも、空間を保ったまま視点を変えられることが主な価値です。 9
Marbleが目指してきた持続的で探索可能な環境生成を、Atlasがさらに広げる可能性があります。ゲームや仮想空間の制作者は、1枚の映像ではなく、視点を変えても関係性が保たれるシーンの生成・再構成を利用できるかもしれません。 6
9
建築、製品設計、クリエイティブ制作では、テキストや画像から歩き回れる空間の案を作り、視点やレイアウトを変えながら検討する用途が考えられます。視点を固定したレンダリングを何度も作り直すより、空間として確認しやすくなる可能性があります。 6
9
World Labsは、日常的な撮影からシミュレーション環境を作る「リアルからシミュレーションへ(real-to-sim)」の用途も掲げています。ロボットの視点から見たRGB画像や深度情報を生成し、物体、照明、動き、背景を変えながら、ナビゲーションや物体操作の訓練データを作る構想です。 9
SceniXの買収も、こうしたロボット・シミュレーション分野への方向性と結び付けられています。 また、World Labsはこれまでに総額12億3,000万ドルを調達したと報じられています。 ただし、資金調達額は事業基盤の大きさを示す情報であって、Atlasが実運用レベルの物理シミュレーションを達成した証拠ではありません。
Atlasは、発表資料上では一般公開されたサービスとして提供されていません。World Labsは早期アクセスの申し込みを受け付けており、現在ドキュメントで確認できる公開サービスはMarbleとWorld APIです。 9
8
今回確認できる発表資料では、Atlasについて標準価格、モデル規模、学習データ、使用ハードウェア、推論レイテンシ、処理量、1回の生成に必要な計算コストは明らかにされていません。 9
これらは本番導入を検討するうえで重要な情報です。デモ映像が印象的でも、大規模運用に耐える価格か、対話的に使える速度か、多数のシーンで同じ結果を再現できるかまでは分かりません。
Atlasは、生成動画、3D再構成、空間シミュレーションを1つのマルチモーダルモデルにまとめようとするWorld Labsの取り組みです。特徴は、カメラ位置と3Dコンテキストを重要な入力として扱い、生成フレームを互いに独立した画像として処理しない点にあります。
カメラ制御付きの画像・動画生成、少数画像からのシーン再構成、明示的な3D出力、ロボット向けシミュレーションという構想は大きな可能性を持ちます。一方で、Atlasは今回確認できる資料では早期アクセス段階です。独立評価、価格、処理速度、計算コスト、物理的な正確さに関するデータがそろうまでは、現時点の強い主張は「有望な研究・製品の方向性」として捉えるのが妥当でしょう。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Atlasは、テキスト・画像・動画・3D情報を同じ空間的コンテキストで扱い、カメラ位置を指定した画像・動画生成やシーンの3D再構成を行うWorld Labsの「omni」世界モデルです。
Atlasは、テキスト・画像・動画・3D情報を同じ空間的コンテキストで扱い、カメラ位置を指定した画像・動画生成やシーンの3D再構成を行うWorld Labsの「omni」世界モデルです。 1枚から数十枚の画像を使い、直接見えていない場所も推定しながら新しい視点を生成できます。ただし、見えない部分の推定は実測に基づく完全な3D測量とは異なります。 [9]
Atlasは今後のMarbleやWorld Labsの製品を支える基盤モデルと位置づけられています。現在、公開ドキュメントで利用できる主な窓口はMarbleとWorld APIです。