Atlas to multimodalny model świata firmy World Labs, który natywnie pracuje z tekstem, obrazami, wideo i danymi 3D, aby generować oraz rekonstruować spójne przestrzennie środowiska. Model ma pozwalać określać położenie kamery lub całą jej trajektorię, a następnie tworzyć obrazy i wideo z ujęć niewystępujących w mate...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Atlas, the multimodal AI world model launched by Fei-Fei Li’s World Labs, and how does it work, what 3D generation and reconstructio. Article summary: Atlas is World Labs’ next-generation “omni” world model: a single pretrained system that natively accepts text, images, video, and 3D/camera information to generate, reconstruct, and simulate spatially consistent environ. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Atlas to zaprezentowany przez World Labs multimodalny „model świata” przeznaczony do zadań związanych z inteligencją przestrzenną. Jeden system ma natywnie obsługiwać tekst, obrazy, wideo i informacje 3D, a następnie wykorzystywać je do generowania obrazów i filmów, rekonstrukcji rzeczywistych scen oraz modelowania tego, jak dana przestrzeń może wyglądać z innego miejsca. 9
To podejście różni się od typowych generatorów obrazu i wideo. One zwykle koncentrują się na tym, by każda klatka wyglądała wiarygodnie. Atlas ma natomiast pilnować spójności przestrzennej: relacji między obiektami, punktu widzenia i środowiska, gdy kamera się porusza.
World Labs opisuje Atlas jako multimodalny, autoregresyjny transformator dyfuzyjny, wytrenowany od podstaw. Model wiąże dane wizualne z ich położeniem we wspólnym kontekście przestrzennym, a następnie przewiduje kolejne klatki, ujęcia lub reprezentacje 3D, które powinny pasować do tego kontekstu. 9
Użytkownik może przekazać jedno albo kilka zdjęć referencyjnych, a także informacje o kamerze lub zaprojektowaną ścieżkę jej ruchu. Atlas ma wtedy renderować wskazane punkty widzenia — również takie, których bezpośrednio nie pokazano na zdjęciach.
W tym drugim przypadku niewidoczne fragmenty nie są „odzyskiwane” na podstawie pomiaru fizycznego. Model je wnioskuje, korzystając z dostępnych danych i wyuczonych wzorców wizualnych. Dlatego przekonujący wygląd rekonstrukcji nie oznacza automatycznie, że każdy jej element odpowiada rzeczywistości.
Atlas ma łączyć dwie główne funkcje:
Ta sama reprezentacja przestrzeni ma również wspierać symulacje, między innymi zmianę oświetlenia, ruchu, tła i konfiguracji obiektów na potrzeby dalszych zastosowań w robotyce. 9
Według World Labs Atlas obsługuje kilka trybów generowania:
Firma określa kontrolę kamery mianem „pixel-perfect”, czyli „pikselowo precyzyjnej”. W praktyce oznacza to, że zaplanowana trajektoria kamery ma być centralnym elementem procesu generowania, a nie tylko późniejszą korektą gotowego materiału. Atlas może więc potencjalnie pomóc w zmianie kadru, tworzeniu wirtualnych przejazdów kamery i budowaniu ujęć na podstawie niewielkiej liczby referencji. 9
Najważniejsza obietnica dotyczy tu kontroli. Tekst może określać, co ma znaleźć się w scenie, a zdjęcia i geometria kamery dostarczają informacji o położeniu obiektów oraz sposobie oglądania przestrzeni. Atlas plasuje się tym samym pomiędzy generatywnym wideo a klasycznym procesem produkcji 3D.
World Labs twierdzi, że Atlas potrafi rekonstruować rzeczywiste sceny na podstawie od jednego do kilkudziesięciu zdjęć. Według firmy dwie lub trzy fotografie często wystarczają do uzyskania wiernego rezultatu, natomiast w sytuacjach, w których ważniejsza jest wierność niż uzupełnianie brakujących informacji, model może wykorzystać ponad 100 widoków. 9
Wynik ma obejmować zarówno obrazy z nowych punktów widzenia, jak i jawną reprezentację 3D. Atlas nie ma więc ograniczać się do stworzenia sekwencji wyglądającej poprawnie z jednego, z góry ustalonego kąta. Jego zadaniem jest modelowanie sceny na tyle szeroko, by można było generować kolejne ujęcia.
Jest jednak istotne zastrzeżenie. Jeśli scena została sfotografowana tylko częściowo, zasłonięte powierzchnie muszą zostać przewidziane. Rekonstrukcja może wyglądać bardzo wiarygodnie, a mimo to błędnie przedstawiać ukryty obiekt, wymiary, niewidoczne pomieszczenie albo geometrię powierzchni. Jakości wizualnej Atlasa nie należy więc utożsamiać z geodezyjnie lub pomiarowo potwierdzoną rekonstrukcją.
World Labs informuje, że Atlas przewyższa wyspecjalizowane, najnowocześniejsze modele do rekonstrukcji 3D w przeprowadzonych przez firmę testach. Materiał premierowy przedstawia wyniki ilościowe dla generowania zależnego od kamery i rekonstrukcji 3D, jednocześnie zaznaczając, że pojedynczy benchmark nie jest w stanie uchwycić pełnego zakresu możliwości modelu. 9
Są to interesujące wyniki raportowane przez producenta, ale nie należy mylić ich z niezależną walidacją. Dostępne materiały nie zawierają kompletnego, powtarzalnego pakietu ewaluacyjnego obejmującego wszystkie procedury dotyczące danych, wyniki poszczególnych modeli, przedziały niepewności, wagi modelu i powtórzenia wykonane przez zewnętrzne zespoły. Deklarowaną przewagę należy zatem traktować jako twierdzenie World Labs, a nie jako rozstrzygnięty fakt dotyczący całej branży.
Dalszych testów wymagają zwłaszcza:
Marble to obecny, przeznaczony dla użytkowników produkt World Labs do tworzenia trwałych, eksplorowalnych światów 3D. Przyjmuje tekst, pojedyncze lub wiele obrazów, wideo, panoramy i uproszczone struktury 3D, a następnie tworzy środowiska, po których można się poruszać i które można wykorzystywać w dalszych procesach. 6
Atlas jest kolejnym generacyjnie modelem stojącym za tą strategią produktową, a nie po prostu nową nazwą funkcji Marble. World Labs zapowiada, że Atlas będzie zasilać przyszłe wersje Marble oraz inne produkty firmy. 9
Podział ról jest więc dość jasny: Atlas ma dostarczać ogólniejszy model przestrzenny, a Marble pozostaje łatwiejszym w użyciu środowiskiem do tworzenia i oglądania trwałych światów. Dokumentacja Marble opisuje generowanie takich światów z tekstu, obrazów i wideo, a następnie ich eksplorowanie oraz wykorzystywanie w kolejnych narzędziach. 6
World Labs uruchomiło World API — publiczny interfejs do generowania eksplorowalnych światów 3D z tekstu, obrazów, panoram, danych wielowidokowych i wideo. Dokumentacja opisuje proces, w którym aplikacja wysyła żądanie wygenerowania świata, a po zakończeniu pobiera gotowy rezultat. 8
3
Nie jest to jednak równoznaczne z udostępnieniem samego Atlasa jako modelu do pobrania lub lokalnego generowania w czasie rzeczywistym. Opisane API koncentruje się na asynchronicznym tworzeniu i pobieraniu światów, a dostępne materiały nie potwierdzają istnienia publicznego endpointu Atlasa, lokalnych wag ani opcji generowania w czasie rzeczywistym. 3
8
9
Dla deweloperów oznacza to, że obecnie udokumentowaną powierzchnią produktową są Marble i oparte na API generowanie światów — niekoniecznie bezpośredni dostęp do każdej funkcji opisanej w zapowiedzi badawczej Atlasa.
Generowanie sterowane kamerą mogłoby pomóc artystom zmieniać kadrowanie materiału, tworzyć wirtualne ruchy kamery i przygotowywać ujęcia na podstawie niewielkiej liczby referencji. Kluczową wartością ma być kontrolowana zmienność przestrzeni, a nie pojedyncza, efektowna klatka. 9
Marble już koncentruje się na trwałych, eksplorowalnych środowiskach. Atlas może rozwinąć ten kierunek, oferując projektantom model, który generuje lub rekonstruuje sceny przy zachowaniu punktu widzenia i relacji przestrzennych między obiektami. 6
9
Zespoły architektoniczne, przemysłowe i kreatywne mogłyby wykorzystywać tekst, obrazy oraz inne referencje do badania nawigowalnych koncepcji przestrzennych. Kontrola punktu widzenia może ułatwić analizę i modyfikowanie projektu w porównaniu z serią niezależnych renderów. 6
9
World Labs opisuje również zastosowanie typu „real-to-sim”, czyli przejście od rzeczywistego świata do symulacji. Pomysł zakłada tworzenie środowisk symulacyjnych na podstawie zwykłych nagrań, generowanie obserwacji RGB i głębi z perspektywy robota oraz zmienianie obiektów, oświetlenia, ruchu i tła na potrzeby treningu nawigacji oraz manipulacji. 9
To ambitny scenariusz, ale realizm wizualny nie dowodzi jeszcze, że scena ma poprawną fizykę, wiarygodne wymiary ani wystarczającą skuteczność w przejściu z symulacji do rzeczywistości. Takie twierdzenia wymagają testów dopasowanych do konkretnych zadań.
Atlas nie jest przedstawiany w materiałach premierowych jako produkt powszechnie dostępny. World Labs zbiera zgłoszenia do wczesnego dostępu, natomiast Marble i World API są obecnie opisanymi publicznie opcjami. 9
8
W analizowanych materiałach nie podano standardowego cennika Atlasa, wielkości modelu, danych treningowych, konfiguracji sprzętowej, opóźnień generowania, przepustowości ani kosztu obliczeniowego pojedynczej generacji. 9
To ważne informacje dla firm, które rozważają użycie Atlasa w produkcji. Imponująca demonstracja nie mówi, czy dany proces będzie opłacalny na dużą skalę, wystarczająco szybki do interaktywnej pracy ani powtarzalny w przypadku wielu różnych scen.
Atlas najlepiej rozumieć jako próbę połączenia w jednym multimodalnym modelu generatywnego wideo, rekonstrukcji 3D i symulacji przestrzeni. Jego wyróżnikiem ma być potraktowanie pozycji kamery oraz kontekstu 3D jako kluczowych danych wejściowych, zamiast generowania każdej klatki jak niezależnego obrazu.
Deklarowane możliwości są szerokie: generowanie obrazu i wideo z kontrolą kamery, rekonstrukcja z niewielkiej liczby widoków, jawne wyjścia 3D oraz potencjalne zastosowania w symulacji dla robotyki. Jednocześnie w analizowanych materiałach Atlas pozostaje systemem w fazie wczesnego dostępu. Dopóki nie pojawią się niezależne ewaluacje, informacje o cenie, opóźnieniach i dokładności fizycznej, jego najmocniejsze obietnice należy traktować jako obiecujący kierunek badań i rozwoju produktu, a nie niezależnie potwierdzoną wydajność produkcyjną.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Atlas to multimodalny model świata firmy World Labs, który natywnie pracuje z tekstem, obrazami, wideo i danymi 3D, aby generować oraz rekonstruować spójne przestrzennie środowiska.
Atlas to multimodalny model świata firmy World Labs, który natywnie pracuje z tekstem, obrazami, wideo i danymi 3D, aby generować oraz rekonstruować spójne przestrzennie środowiska. Model ma pozwalać określać położenie kamery lub całą jej trajektorię, a następnie tworzyć obrazy i wideo z ujęć niewystępujących w materiale źródłowym.
World Labs deklaruje rekonstrukcję scen na podstawie od jednego do kilkudziesięciu zdjęć, a także generowanie wideo o długości do minuty w rozdzielczości 1440p.