Atlas es el modelo multimodal de World Labs para la inteligencia espacial: trabaja de forma nativa con texto, imágenes, vídeo y datos 3D. La compañía afirma que puede generar imágenes y vídeos con trayectorias de cámara controladas, reconstruir escenas a partir de pocas fotografías y producir representaciones 3D.
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Atlas, the multimodal AI world model launched by Fei-Fei Li’s World Labs, and how does it work, what 3D generation and reconstructio. Article summary: Atlas is World Labs’ next-generation “omni” world model: a single pretrained system that natively accepts text, images, video, and 3D/camera information to generate, reconstruct, and simulate spatially consistent environ. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
World Labs presenta Atlas como un modelo “omni” de mundo para la inteligencia espacial: un único sistema entrenado desde cero para trabajar con texto, imágenes, vídeo y datos 3D. Su objetivo va más allá de crear un clip visualmente convincente. Atlas busca generar imágenes y vídeo desde puntos de vista controlados, reconstruir escenas reales en tres dimensiones y modelar cómo cambiaría un entorno cuando se mueve la cámara o se modifican sus elementos. 9
La diferencia está en la coherencia espacial. Los generadores convencionales de imágenes y vídeo suelen optimizar la plausibilidad visual de cada fotograma. Atlas, en cambio, se presenta como un sistema que intenta mantener estables las relaciones entre objetos, posiciones y perspectivas mientras la cámara recorre el escenario.
World Labs describe Atlas como un transformador de difusión autorregresivo y multimodal, preentrenado desde cero. El modelo relaciona las entradas visuales con su posición dentro de un contexto espacial común y, a partir de ahí, predice nuevos fotogramas, vistas o salidas 3D que encajen con ese contexto. 9
El usuario puede aportar una o varias imágenes de referencia, junto con información de cámara o una trayectoria diseñada manualmente. Atlas puede renderizar entonces los puntos de vista solicitados, incluso zonas que no aparecen directamente en las imágenes originales. Esas partes ocultas no se recuperan como mediciones físicas verificadas: se infieren a partir de la evidencia disponible y de los patrones visuales aprendidos por el modelo.
Sus dos capacidades principales son:
La misma representación espacial también pretende servir para simulaciones en las que cambien la iluminación, el movimiento, el fondo o la configuración de los objetos, con posibles usos posteriores en robótica. 9
Según World Labs, Atlas admite varios modos de generación:
La compañía define el control de cámara como “pixel-perfect” —o de precisión a nivel de píxel— para destacar que la trayectoria solicitada forma parte central del proceso de generación, en lugar de ser un ajuste añadido después. En la práctica, esto podría servir para reencuadrar material, sintetizar movimientos de cámara o crear planos a partir de unas pocas referencias visuales. 9
La propuesta combina dos tipos de información: el texto indica qué debería aparecer y las imágenes, junto con la geometría de cámara, aportan pistas sobre la posición de los objetos y la forma de observar la escena. Por eso Atlas se sitúa en el punto de encuentro entre el vídeo generativo y los flujos de producción 3D tradicionales.
World Labs afirma que Atlas puede reconstruir escenas del mundo real a partir de entre una y varias decenas de imágenes. La empresa sostiene que dos o tres fotografías suelen bastar para obtener resultados fieles, mientras que el modelo puede incorporar más de 100 vistas cuando se prioriza la fidelidad y no la inferencia. 9
El resultado está pensado para incluir tanto imágenes desde nuevos puntos de vista como representaciones 3D explícitas. Es decir, Atlas no se limita a producir una secuencia que parezca correcta desde un único ángulo; intenta representar suficiente información de la escena para generar perspectivas adicionales.
Hay, sin embargo, una salvedad importante. Cuando un entorno se observa de manera escasa, las superficies ocultas deben ser inferidas. Una reconstrucción puede resultar convincente y aun así equivocarse sobre un objeto tapado, una distancia, una habitación oculta o la geometría de una superficie. La calidad visual de Atlas no equivale, por tanto, a una reconstrucción topográfica o arquitectónica verificada.
World Labs asegura que Atlas supera a modelos especializados de última generación en sus evaluaciones de reconstrucción 3D. El anuncio destaca resultados cuantitativos en dos tareas: generación condicionada por cámara y reconstrucción 3D. La propia compañía advierte, no obstante, que ningún benchmark refleja por completo la amplitud de un modelo de propósito general. 9
Son resultados relevantes comunicados por la empresa, pero no equivalen a una validación independiente. El material disponible no incluye un paquete completo y reproducible con todos los protocolos de los conjuntos de datos, puntuaciones detalladas por modelo, estimaciones de incertidumbre, pesos del modelo y réplicas de terceros. Por eso, la ventaja anunciada debe leerse como una afirmación de World Labs, no como un resultado industrial ya establecido.
Serían especialmente útiles pruebas adicionales sobre:
Marble es el producto de World Labs orientado al usuario para crear mundos 3D persistentes y explorables. Acepta texto, una o varias imágenes, vídeo, panoramas y estructuras 3D aproximadas, y genera entornos que pueden explorarse y utilizarse en otros flujos de trabajo. 6
Atlas no es simplemente un nuevo nombre para una función de Marble. Es el modelo de nueva generación que, según World Labs, impulsará futuras versiones de Marble y otros productos de la compañía. 9
La estrategia queda así definida: Atlas aporta un modelo espacial más general, mientras Marble funciona como la puerta de entrada para crear y visualizar mundos persistentes. La documentación de Marble describe precisamente la creación de entornos a partir de texto, imágenes y vídeo, con resultados disponibles para exploración y usos posteriores. 6
World Labs presentó la World API como una interfaz pública para generar mundos 3D explorables desde texto, imágenes, panoramas, entradas multivista y vídeo. La documentación describe un flujo asíncrono: una aplicación envía una solicitud de generación y recupera el mundo cuando el proceso termina. 8
3
Eso no significa que Atlas esté disponible como modelo descargable o como sistema local en tiempo real. La API documentada se centra en generar y recuperar mundos, y los materiales revisados no confirman un endpoint público de Atlas, pesos para ejecución local ni una opción de inferencia en tiempo real. 3
8
9
Para los desarrolladores, la superficie pública actual es Marble y el flujo de generación de mundos mediante API; no necesariamente el acceso directo a todas las capacidades descritas en el anuncio de investigación de Atlas.
El control de cámara podría ayudar a reencuadrar material, crear movimientos de cámara virtuales y producir planos a partir de pocas referencias. La promesa principal es generar variaciones espaciales controlables, no solo un fotograma aislado. 9
Marble ya está orientado a entornos persistentes y explorables. Atlas podría ampliar esa línea al ofrecer a diseñadores y desarrolladores una forma de crear o reconstruir escenas manteniendo las relaciones entre los objetos y los distintos puntos de vista. 6
9
Equipos de arquitectura, industria y diseño creativo podrían usar textos, imágenes y otras referencias para explorar conceptos espaciales navegables. El control de perspectiva permitiría inspeccionar y modificar una idea con más continuidad que una serie de renders independientes. 6
9
World Labs también plantea un flujo de “real a sim”: crear entornos simulados a partir de grabaciones cotidianas, generar observaciones RGB y de profundidad desde la perspectiva de un robot, y variar objetos, iluminación, movimiento y fondos para entrenar navegación y manipulación. 9
Es una aplicación ambiciosa. El realismo visual por sí solo no demuestra que una escena tenga físicas correctas, dimensiones fiables o un rendimiento suficiente en la transferencia de la simulación al mundo real. Esas capacidades requieren evaluaciones específicas para cada tarea.
Atlas no aparece presentado como un producto de disponibilidad general. World Labs está recopilando solicitudes de acceso anticipado, mientras que Marble y la World API son las opciones públicas documentadas. 9
8
En la información de lanzamiento revisada no se detallan un precio estándar para Atlas, el tamaño del modelo, los datos de entrenamiento, la configuración de hardware, la latencia, el rendimiento ni el coste computacional por generación. 9
La financiación comunicada en fuentes secundarias sitúa el capital captado por World Labs en 1.230 millones de dólares, pero esa cifra describe la capacidad financiera de la empresa, no prueba que Atlas ofrezca una simulación física preparada para producción.
La adquisición de SceniX encaja con la orientación de World Labs hacia la robótica y los entornos “real a sim”, aunque los materiales disponibles no permiten concluir por sí solos que Atlas haya resuelto el problema de trasladar de forma fiable el aprendizaje simulado a robots reales.
Estos datos pendientes son importantes para cualquier equipo que evalúe Atlas como herramienta de producción. Una demostración visualmente impresionante no indica si el flujo será asequible a escala, suficientemente rápido para una experiencia interactiva o reproducible en muchos tipos de escenas.
Atlas puede entenderse como el intento de World Labs de reunir en un mismo modelo el vídeo generativo, la reconstrucción 3D y la simulación espacial. Su idea diferencial es tratar la posición de la cámara y el contexto tridimensional como elementos centrales de entrada, en lugar de considerar cada fotograma como una imagen independiente.
Las capacidades anunciadas son amplias: generación de imágenes y vídeo con cámara controlada, reconstrucción desde vistas escasas, salidas 3D explícitas y posibles entornos de simulación para robótica. Pero, según la información revisada, Atlas sigue siendo un sistema de acceso anticipado. Hasta que existan evaluaciones independientes, precios, datos de latencia y pruebas de precisión física, sus afirmaciones más contundentes deben considerarse una dirección prometedora de investigación y producto, no un rendimiento de producción demostrado de forma independiente.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Atlas es el modelo multimodal de World Labs para la inteligencia espacial: trabaja de forma nativa con texto, imágenes, vídeo y datos 3D.
Atlas es el modelo multimodal de World Labs para la inteligencia espacial: trabaja de forma nativa con texto, imágenes, vídeo y datos 3D. La compañía afirma que puede generar imágenes y vídeos con trayectorias de cámara controladas, reconstruir escenas a partir de pocas fotografías y producir representaciones 3D.
Atlas está pensado para impulsar futuras versiones de Marble y aplicaciones en efectos visuales, videojuegos, diseño y robótica, aunque su acceso, precio, latencia y rendimiento físico independiente aún no están claros.