Atlas er en multimodal verdensmodell som er utviklet for å arbeide med tekst, bilder, video og 3D informasjon i én og samme modell. Modellen skal kunne generere bilder og opptil ett minutt med video i 1440p fra referansebilder og en spesifisert kamerabane.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Atlas, the multimodal AI world model launched by Fei-Fei Li’s World Labs, and how does it work, what 3D generation and reconstructio. Article summary: Atlas is World Labs’ next-generation “omni” world model: a single pretrained system that natively accepts text, images, video, and 3D/camera information to generate, reconstruct, and simulate spatially consistent environ. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
World Labs beskriver Atlas som en «omni»-modell for romlig intelligens: ett system som er trent til å arbeide direkte med tekst, bilder, video og 3D-informasjon. Målet er større enn å lage et videoklipp som ser troverdig ut. Atlas skal kunne generere bilder og video fra kontrollerte kameravinkler, rekonstruere virkelige omgivelser i 3D og modellere hvordan en scene kan se ut når kameraet eller omgivelsene endres. 9
Det er en viktig forskjell fra mange vanlige bilde- og videogeneratorer, som først og fremst optimaliserer hvert bilde eller videobilde for visuell troverdighet. Atlas er i stedet bygget rundt romlig sammenheng: Forholdet mellom objekter, perspektiv og miljø skal henge bedre sammen når kameraet beveger seg.
World Labs beskriver Atlas som en multimodal, autoregressiv diffusion-transformer som er forhåndstrent fra bunnen av. Modellen kobler visuelle inntrykk til deres posisjon i en felles romlig kontekst, og kan deretter forutsi nye bilder, kameravinkler eller 3D-resultater som passer inn i denne konteksten. 9
Brukeren kan legge inn ett eller flere referansebilder, sammen med kamerainformasjon eller en forhåndsdefinert kamerabane. Atlas kan så gjengi scenen fra ønskede vinkler – også steder som ikke var synlige i originalmaterialet.
De usette delene blir imidlertid ikke «funnet» som fysiske fakta. De blir anslått ut fra det som faktisk er observert, kombinert med mønstre og antakelser modellen har lært fra treningsdataene.
Dette gir Atlas to nært beslektede funksjoner:
Den samme romlige representasjonen skal også kunne brukes i simuleringer, der man endrer lys, bevegelse, bakgrunner eller objekter for videre arbeid med robotikk. 9
Ifølge World Labs støtter Atlas flere genereringsmoduser:
Selskapet omtaler kamerastyringen som «pixel-perfect». Det betyr at den ønskede kamerabevegelsen skal være en sentral del av selve genereringen, og ikke bare en redigering som legges oppå et ferdig resultat. I praksis kan dette brukes til å komponere om opptak, lage virtuelle kamerabevegelser eller produsere nye scener fra et lite antall visuelle referanser. 9
Det viktigste poenget er kontroll. Tekst kan beskrive hva som skal finnes i scenen, mens bilder og kamerageometri gir informasjon om hvor objektene befinner seg og hvordan miljøet skal sees. Atlas forsøker dermed å bygge bro mellom generativ video og tradisjonelle 3D-produksjoner.
World Labs sier at Atlas kan rekonstruere virkelige scener fra ett bilde til flere titalls bilder. Selskapet hevder også at to eller tre fotografier ofte kan gi troverdige resultater, mens over 100 synsvinkler kan tas i bruk når nøyaktighet er viktigere enn modellens egne antakelser. 9
Resultatet skal kunne inneholde både bilder fra nye synsvinkler og eksplisitte 3D-representasjoner. Atlas er altså ikke bare ment å lage en videosekvens som ser riktig ut fra én bestemt vinkel. Modellen skal representere nok av scenen til å kunne generere flere perspektiver.
Her ligger også en viktig begrensning. Når en scene bare er delvis observert, må skjulte overflater anslås. En rekonstruksjon kan derfor se overbevisende ut, men likevel ta feil av et skjult objekt, et mål, et rom bak en vegg eller formen på en overflate.
Høy visuell kvalitet er dermed ikke det samme som en oppmåling på landmåler- eller ingeniørnivå.
World Labs hevder at Atlas gjør det bedre enn spesialiserte, toppmoderne modeller for 3D-rekonstruksjon i selskapets egne evalueringer. Lanseringsmaterialet fremhever kvantitative resultater for kamerakondisjonert generering og 3D-rekonstruksjon, men understreker samtidig at ingen enkeltstående test fanger hele bredden i en slik modell. 9
Resultatene er relevante som selskapets egne målinger, men de er ikke det samme som uavhengig validering. Materialet som er tilgjengelig her, inneholder ikke en komplett og reproduserbar evaluering med alle datasettprotokoller, resultater for hver modell, usikkerhetsanslag, modellvekter og tredjepartstester.
Påstanden om at Atlas leder, bør derfor foreløpig leses som et resultat World Labs rapporterer – ikke som et endelig etablert bransjefaktum.
Videre testing blir særlig viktig for:
Marble er World Labs’ eksisterende brukerprodukt for å lage vedvarende, utforskbare 3D-verdener. Tjenesten kan ta imot tekst, ett eller flere bilder, video, panoramaer og grove 3D-strukturer, og lager deretter verdener som kan utforskes og brukes videre i andre arbeidsflyter. 6
Atlas er neste generasjon av modellen bak denne produktstrategien – ikke bare et nytt navn på en Marble-funksjon. World Labs sier at Atlas skal drive fremtidige versjoner av Marble og andre produkter fra selskapet. 9
Forenklet kan man si at Atlas er den mer generelle romlige modellen, mens Marble er den tilgjengelige tjenesten der brukere kan lage og se vedvarende 3D-verdener. Dokumentasjonen for Marble beskriver verdensgenerering fra tekst, bilder og video, med resultater som kan utforskes og brukes i videre produksjon. 6
World Labs har lansert World API, et offentlig grensesnitt for å generere utforskbare 3D-verdener fra tekst, bilder, panoramaer, flervisningsmateriale og video. Dokumentasjonen beskriver en arbeidsflyt der en applikasjon sender inn en forespørsel, før den henter den ferdige verdenen når genereringen er fullført. 8
3
Dette er ikke det samme som at Atlas er tilgjengelig som en modell som kan lastes ned eller kjøres lokalt i sanntid. Den dokumenterte API-en er rettet mot asynkron generering og uthenting av verdener. Materialet som er gjennomgått her, bekrefter heller ikke at det finnes et offentlig Atlas-endepunkt, lokale modellvekter eller en løsning for sanntidsinferens. 3
8
9
For utviklere betyr det at den offentlige produktflaten foreløpig er Marble og den API-baserte arbeidsflyten for verdensgenerering – ikke nødvendigvis direkte tilgang til alle egenskapene World Labs beskriver for Atlas.
World Labs ser for seg Atlas som et bredt romlig system med flere mulige markeder.
Kamerastyrt generering kan hjelpe artister med å komponere om opptak, lage virtuelle kamerabevegelser og produsere nye bilder fra et lite antall referanser. Løftet handler først og fremst om kontrollerbar romlig variasjon, ikke bare om å lage ett enkelt bilde. 9
Marble er allerede rettet mot vedvarende, utforskbare miljøer. Atlas kan videreføre denne retningen ved å gi spill- og verdensdesignere en modell som genererer eller rekonstruerer scener uten å miste oversikten over perspektiv og romlige forhold. 6
9
Arkitekt-, industri- og kreative team kan bruke tekst, bilder og andre referanser til å utforske romlige konsepter som kan navigeres. Kontroll over synsvinkel kan gjøre det enklere å vurdere og videreutvikle en idé enn når man bare har en serie uavhengige rendere. 6
9
World Labs beskriver også et «real-to-sim»-bruksområde: å lage simulerte miljøer fra uformelle opptak, generere RGB- og dybdedata fra robotens perspektiv og variere objekter, lys, bevegelser og bakgrunner for trening innen navigasjon og håndtering. 9
Dette er en ambisiøs anvendelse. Realistisk grafikk alene beviser imidlertid ikke at scenen har riktige fysiske egenskaper, pålitelige mål eller god nok overføring fra simulering til virkelige roboter. Slike påstander må testes for hver enkelt oppgave.
Atlas presenteres ikke som bredt tilgjengelig i lanseringsmaterialet. World Labs tar imot forespørsler om tidlig tilgang, mens Marble og World API er de offentlige alternativene som er dokumentert. 9
8
Materialet som er gjennomgått her, oppgir heller ingen standardpris for Atlas, modellstørrelse, treningsdata, maskinvarekonfigurasjon, svartid, kapasitet eller beregningskostnad per generering. 9
Dette er avgjørende informasjon for alle som vurderer Atlas som et produksjonsverktøy. En imponerende demonstrasjon sier lite om hvor rimelig løsningen er i stor skala, om den er rask nok til interaktiv bruk, eller om resultatene kan gjenskapes stabilt på tvers av mange scener.
Atlas er World Labs’ forsøk på å samle generativ video, 3D-rekonstruksjon og romlig simulering i én multimodal modell. Den sentrale ideen er å gjøre kameraets posisjon og den tredimensjonale konteksten til førsteklasses innsignaler, i stedet for å behandle hvert videobilde som et uavhengig bilde.
Selskapet beskriver omfattende muligheter: kontrollert bilde- og videogenerering, rekonstruksjon fra få synsvinkler, eksplisitte 3D-resultater og mulig bruk i robotsimulering. Men Atlas er fortsatt et system med tidlig tilgang i materialet som er vurdert her.
Før det finnes uavhengige tester, tydelige priser og mer informasjon om svartid og fysisk nøyaktighet, bør de sterkeste påstandene behandles som lovende forskning og produktretning – ikke som uavhengig dokumentert ytelse i produksjon.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Atlas er en multimodal verdensmodell som er utviklet for å arbeide med tekst, bilder, video og 3D informasjon i én og samme modell.
Atlas er en multimodal verdensmodell som er utviklet for å arbeide med tekst, bilder, video og 3D informasjon i én og samme modell. Modellen skal kunne generere bilder og opptil ett minutt med video i 1440p fra referansebilder og en spesifisert kamerabane.
World Labs hevder at Atlas kan rekonstruere 3D scener fra alt fra ett bilde til flere titalls bilder, men skjulte områder blir basert på modellens antakelser – ikke verifiserte målinger.