Atlas er World Labs’ multimodale verdensmodel til rumlig intelligens og kan arbejde med tekst, billeder, video og 3D information. Modellen er udviklet til at fastholde en sammenhængende rumlig kontekst, så brugeren kan styre virtuelle kameraer og skabe nye synsvinkler.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Atlas, the multimodal AI world model launched by Fei-Fei Li’s World Labs, and how does it work, what 3D generation and reconstructio. Article summary: Atlas is World Labs’ next-generation “omni” world model: a single pretrained system that natively accepts text, images, video, and 3D/camera information to generate, reconstruct, and simulate spatially consistent environ. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
World Labs beskriver Atlas som en “omni”-verdensmodel til rumlig intelligens: ét system, der fra bunden er trænet til at arbejde med tekst, billeder, video og 3D-information. Målet er ikke blot at producere et overbevisende videoklip. Atlas skal kunne generere billeder og video fra kontrollerede synsvinkler, rekonstruere virkelige scener i 3D og modellere, hvordan et rum ser ud, når kameraet eller selve scenen ændrer sig. 9
Det er en vigtig forskel fra mange konventionelle billed- og videogeneratorer, som primært optimerer hvert billede eller videoframe for sig. Atlas er i stedet bygget op omkring rumlig sammenhæng: Forholdet mellem objekter, kameraets position og det underliggende miljø skal helst forblive stabilt, når kameraet bevæger sig.
World Labs kalder Atlas en multimodal, autoregressiv diffusionstransformer, der er fortrænet fra bunden. Modellen kobler visuelle input til deres placering i en fælles rumlig kontekst og forudsiger derefter nye frames, synsvinkler eller 3D-output, som passer ind i denne kontekst. 9
Brugeren kan indsætte ét eller flere referencebilleder sammen med kameraoplysninger eller en selvdesignet kamerabane. Atlas kan derefter gengive de ønskede synsvinkler – også dele af scenen, som ikke blev fotograferet direkte. De usete områder bliver dog udledt fra det tilgængelige materiale og modellens indlærte visuelle antagelser. De er ikke nødvendigvis dokumenterede, fysiske målinger.
Det giver Atlas to nært beslægtede funktioner:
Den samme rumlige repræsentation skal også kunne bruges til simulering – eksempelvis ved at ændre lys, bevægelse, baggrunde eller objekters placering i forbindelse med robotteknologi. 9
Ifølge World Labs understøtter Atlas flere former for generering:
Virksomheden beskriver kamerastyringen som “pixel-perfect”. Det betyder, at den ønskede kamerabane er en central del af genereringen og ikke blot en efterfølgende redigering. I praksis kan det gøre det muligt at omkomponere optagelser, skabe virtuelle kamerabevægelser eller producere nye indstillinger ud fra få visuelle referencer. 9
Den praktiske pointe er kontrol. En tekstprompt kan beskrive, hvad der skal være i scenen, mens billeder og kamerageometri giver modellen oplysninger om, hvor objekterne befinder sig, og hvordan scenen skal ses. Atlas placerer sig derfor i feltet mellem generativ video og traditionelle 3D-produktionsværktøjer.
World Labs siger, at Atlas kan rekonstruere virkelige scener ud fra ét til dusinvis af inputbilleder. Virksomheden oplyser også, at to eller tre fotografier ofte kan give troværdige resultater, mens modellen kan inddrage mere end 100 synsvinkler, hvis høj præcision er vigtigere end at udfylde manglende information. 9
Outputtet skal både kunne bestå af billeder fra nye synsvinkler og egentlige 3D-repræsentationer. Atlas er altså ikke begrænset til at lave en sekvens, der kun ser rigtig ud fra én bestemt vinkel. Modellen er udviklet til at repræsentere tilstrækkeligt meget af scenen til at kunne generere flere perspektiver.
Der er dog et afgørende forbehold. Når en scene kun er sparsomt fotograferet, må skjulte overflader og områder udledes. En rekonstruktion kan derfor se overbevisende ud og stadig tage fejl af et skjult objekt, et mål, et rum bag en væg eller en overflades geometri. Høj visuel kvalitet er ikke det samme som en dokumenteret opmåling på landmåler- eller inspektionsniveau.
World Labs hævder, at Atlas klarer sig bedre end specialiserede 3D-rekonstruktionsmodeller på virksomhedens egne evalueringer. Lanceringen fremhæver kvantitative resultater for kamerakonditioneret generering og 3D-rekonstruktion, men understreger samtidig, at ingen enkelt benchmark kan dække modellens fulde spændvidde. 9
Det er relevante resultater rapporteret af virksomheden, men de er ikke det samme som uafhængig validering. Det tilgængelige materiale indeholder ikke en komplet, reproducerbar evalueringspakke med alle datasæt- og testprotokoller, resultater for hver model, usikkerhedsestimater, modelvægte og tredjepartsreplikationer. Den påståede fordel bør derfor læses som World Labs’ egen vurdering – ikke som et endeligt dokumenteret branchegennembrud.
Yderligere test er især nødvendig for:
Marble er World Labs’ eksisterende produkt til at skabe vedvarende 3D-verdener, som brugerne kan udforske. Tjenesten tager imod tekst, ét eller flere billeder, video, panoramaer og grove 3D-strukturer og producerer verdener, der kan udforskes og bruges i efterfølgende arbejdsgange. 6
Atlas er den næste generation af modellen bag denne produktstrategi – ikke blot et nyt navn for en Marble-funktion. World Labs siger, at Atlas skal drive fremtidige versioner af Marble og andre produkter. 9
Forholdet mellem de to kan derfor beskrives sådan: Atlas leverer den mere generelle rumlige model, mens Marble er den mere tilgængelige brugerflade til at skabe og se vedvarende verdener. Marble-dokumentationen beskriver verdensskabelse ud fra tekst, billeder og video med mulighed for udforskning og videre brug. 6
World Labs introducerede World API som en offentlig grænseflade til at generere udforskbare 3D-verdener ud fra tekst, billeder, panoramaer, input fra flere synsvinkler og video. API-dokumentationen beskriver en arbejdsgang, hvor en applikation sender en genereringsanmodning og senere henter den færdige verden. 8
3
Det er ikke det samme som at få Atlas udleveret som en model, der kan downloades eller køre lokalt i realtid. Den dokumenterede API fokuserer på asynkron generering og efterfølgende hentning, og det tilgængelige materiale fastslår ikke, at der findes et offentligt Atlas-endpoint, lokale modelvægte eller en mulighed for realtidsinferens. 3
8
9
For udviklere betyder det, at den aktuelle offentlige produktadgang er Marble og den API-baserede arbejdsgang til verdensgenerering – ikke nødvendigvis direkte adgang til alle de funktioner, som World Labs beskriver for Atlas.
World Labs præsenterer Atlas som et generelt rumligt system med flere potentielle markeder.
Kamerastyret generering kan hjælpe kunstnere med at omkomponere optagelser, skabe virtuelle kamerabevægelser og producere nye indstillinger ud fra få referencer. Det centrale løfte er kontrolleret variation i rummet frem for et enkelt, isoleret AI-genereret billede. 9
Marble er allerede rettet mod vedvarende, udforskbare miljøer. Atlas kan udvide denne retning ved at give spil- og leveldesignere en model, der kan generere eller rekonstruere scener, samtidig med at synsvinkler og rumlige relationer bevares. 6
9
Arkitektfirmaer, industrivirksomheder og kreative teams kan potentielt bruge tekst, billeder og andre referencer til at udforske rumlige koncepter, man kan navigere i. Kontrol over synsvinklen kan gøre det lettere at inspicere og justere et koncept end at arbejde med en række uafhængige renderinger. 6
9
World Labs beskriver også et “real-to-sim”-scenarie: Et simuleret miljø kan skabes ud fra hverdagsoptagelser, hvorefter modellen genererer RGB- og dybdedata fra en robots perspektiv. Objekter, lys, bevægelser og baggrunde kan varieres til træning af robotter i navigation og manipulation. 9
Det er en ambitiøs anvendelse. Visuel realisme alene dokumenterer dog ikke, at en scene har korrekte fysiske egenskaber, pålidelige mål eller tilstrækkelig sim-to-real-ydeevne. Det kræver særskilte, opgavespecifikke evalueringer.
Atlas bliver ikke præsenteret som bredt tilgængelig i det lanceringsmateriale, der er gennemgået her. World Labs indsamler anmodninger om tidlig adgang, mens Marble og World API er de offentligt dokumenterede muligheder. 9
8
Materialet oplyser heller ikke en standardpris for Atlas, modellens størrelse, træningsdata, hardwareopsætning, latenstid, kapacitet eller beregningsomkostning pr. generering. 9
Det har betydning for alle, der overvejer Atlas som produktionsværktøj. En imponerende demonstration fortæller ikke, om arbejdsgangen er økonomisk overkommelig i stor skala, hurtig nok til interaktiv brug eller reproducerbar på tværs af mange forskellige scener.
Atlas bør først og fremmest forstås som World Labs’ forsøg på at samle generativ video, 3D-rekonstruktion og rumlig simulering i én multimodal model. Den bærende idé er, at kameraets placering og den tredimensionelle kontekst skal være grundlæggende input – i stedet for at behandle hvert videoframe som et selvstændigt billede.
De funktioner, virksomheden beskriver, er omfattende: kontrolleret billed- og videogenerering, rekonstruktion ud fra få synsvinkler, eksplicitte 3D-output og mulig simulering til robotteknologi. Men Atlas er stadig et system med tidlig adgang i det materiale, der er gennemgået her. Indtil der foreligger uafhængige evalueringer samt data om pris, latenstid og fysisk præcision, bør de stærkeste påstande ses som lovende forskning og produktretning – ikke som uafhængigt dokumenteret ydeevne i produktion.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Atlas er World Labs’ multimodale verdensmodel til rumlig intelligens og kan arbejde med tekst, billeder, video og 3D information.
Atlas er World Labs’ multimodale verdensmodel til rumlig intelligens og kan arbejde med tekst, billeder, video og 3D information. Modellen er udviklet til at fastholde en sammenhængende rumlig kontekst, så brugeren kan styre virtuelle kameraer og skabe nye synsvinkler.
World Labs hævder, at Atlas kan generere op til ét minuts video i 1440p og rekonstruere scener ud fra få billeder.