Puffin World modeluje jednocześnie trzy stany świata: fizykę związaną z grawitacją, gęstą mapę głębi oraz wygląd RGB. Udostępniono kod, trzy checkpointy modeli oraz zbiór Puffin 16M: około 15 mln par wizja–język–kamera i 1 mln wymagających trajektorii.
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Puffin-World, the open-source multimodal world model developed by ACE Robotics, NTU S-Lab, Beijing Jiaotong University, and the Univ. Article summary: Puffin-World is an open-source, camera-centric multimodal world model that treats a world not merely as RGB video, but as three jointly modeled native states: gravity-aware physics, dense 3D geometry, and visual appearan. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Puffin-World to otwarty, multimodalny model świata 3D przygotowany przez badaczy związanych z ACE Robotics, S-Lab na Nanyang Technological University, Beijing Jiaotong University i University of Michigan. Zamiast traktować scenę wyłącznie jako kolejne klatki RGB, model łączy trzy wzajemnie powiązane stany: fizykę, geometrię i wygląd. Ma to pomóc systemowi AI rozumieć orientację kamery, tworzyć kontrolowane ujęcia z nowych punktów widzenia oraz odtwarzać sceny RGB-D w jednym środowisku. 1
5
Model generatywny może stworzyć przekonujący pojedynczy kadr, ale nie oznacza to jeszcze, że przy zmianie punktu widzenia zachowa stabilny horyzont, pozycję kamery i spójną strukturę 3D. W Puffin-World te elementy są reprezentowane wprost:
To model zorientowany na kamerę. Ma określać nie tylko, jak wygląda scena, lecz także jak kamera jest ustawiona względem grawitacji i jak zmieni się obserwacja, gdy kamera wykona zadany ruch.
Kluczową reprezentacją warunkującą model jest Omni-Camera — gęsty, 9-kanałowy opis kamery. Łączy on dwa typy danych: bezwzględne pole perspektywy uwzględniające grawitację oraz względną geometrię opartą na promieniach. 5
Model przenosi kierunek grawitacji wywnioskowany z widoku referencyjnego wzdłuż żądanej trajektorii kamery. Według autorów ma to utrzymywać generowane obserwacje w jednym spójnym układzie fizycznym i ograniczać dryf grawitacji lub horyzontu, który może narastać przy sekwencyjnym generowaniu kolejnych widoków. 5
6
Gałąź rozumiejąca model może z pojedynczego obrazu przewidzieć bezwzględne wartości roll (przechylenie), pitch (pochylenie) oraz pionowego pola widzenia (vertical FoV). Następnie szacunki są przekształcane w pola grawitacji i perspektywy wykorzystywane przez reprezentację kamery. 5
Puffin-World może tworzyć widoki na podstawie tekstu i parametrów kamery albo obrazu wejściowego oraz wskazanej trajektorii. Kontrola obejmuje zmianę orientacji, translację, parametrów wewnętrznych kamery i ruchy złożone, w tym roll, pitch i yaw. 5
Model nie ogranicza się do koloru: wspólnie generuje RGB i głębię na całej trajektorii. Z wyjść RGB-D można następnie złożyć kolorową chmurę punktów 3D, bez przekazywania rekonstrukcji do osobnego, offline’owego potoku geometrii. 5
Publiczne materiały zawierają demonstracje eksploracji naśladującej oraz samokalibracji. Dokumentacja opisuje układ odniesienia związany z grawitacją jako sposób na ponowne zakotwiczenie trajektorii i ograniczanie narastającej niespójności pozy. Udostępnione materiały nie wyjaśniają jednak w pełni algorytmu korekcji dryfu, więc należy to traktować jako pokazaną funkcję, a nie kompletny opis pętli sterowania. 5
6
Puffin-World łączy dopasowany do geometrii enkoder wizyjny C-RADIO, model językowy Qwen, generator dyfuzyjny SD3.5 i lekki konektor. Projekt rozdziela autoregresyjne rozumienie kamery oraz stanu fizycznego od dyfuzyjnego generowania wielowidokowego RGB-D, utrzymując je zarazem w jednym systemie. 5
Wydanie obejmuje trzy checkpointy:
Publiczne wydanie zawiera kod, wskazówki dotyczące trenowania i ewaluacji, dokumentację tworzenia danych, modele oraz zbiory danych. 5
Puffin-16M opisano jako zbiór liczący około 16,5 mln próbek, złożony z dwóch uzupełniających się części. 14
Puffin-Cam-15M zawiera około 15 mln trójek wizja–język–kamera, wyrenderowanych z mniej więcej 900 tys. panoram. Podany zakres obejmuje roll i pitch od −45° do +45° oraz pionowe pole widzenia od 20° do 105°. 5
Puffin-Traj-1M dodaje 1 mln wymagających trajektorii kamery. Materiały projektu wskazują na długie trajektorie, ekstremalne obroty i ruchy złożone — w tym pitch, yaw oraz roll — ale nie podają wiarygodnego liczbowego podziału według klas ruchu. 5
11
Dostępne materiały potwierdzają obecność scen wnętrz, plenerów, obrazów rzeczywistych i syntetycznych, lecz nie ustalają dokładnego rozkładu kategorii scen. 7
Zespół wykorzystał też Puffin-World do dodania oszacowań bezwzględnego roll, pitch i pionowego FoV do 28 publicznych zbiorów danych — 22 zbiorów pojedynczych obrazów oraz sześciu zbiorów sekwencyjnych lub 3D. W efekcie powstało około 44,5 mln adnotacji kamery. Autorzy wskazują, że dane ujawniają częsty bias obrazów robionych „poziomą” kamerą, zazwyczaj skierowanie kamery nieco w dół oraz znaczną zmienność pola widzenia między zbiorami. 1
Ma to znaczenie dla modeli świata, które potrzebują nie tylko informacji o zawartości sceny, lecz także kontekstu kamery. Sam względny ruch między klatkami nie określa w pełni ustawienia kamery wobec grawitacji lub wspólnego układu świata.
Projekt raportuje najniższy błąd medianowy we wszystkich 12 porównaniach na zestawach Stanford2D3D, MegaDepth, TartanAir i LaMAR, a także najlepszy AUC w 33 z 36 raportowanych metryk, jeśli uwzględnić remisy. Są to wyniki podane przez autorów; nie zostały niezależnie odtworzone w dostarczonych źródłach. 5
Wybrane deklarowane liczby:
Wydanie raportuje również dobre wyniki kontroli kamery w Puffin-Cam-Bench, w tym niskie błędy dla wektora „w górę”, szerokości geograficznej i grawitacji. Osobne podsumowanie podaje 1,32° błędu grawitacji, podczas gdy README raportuje inną metrykę grawitacyjną. Dostępne źródła nie definiują tych ocen na tyle jasno, by wartości można było bezpośrednio porównać. 4
5
„Fizyka” w Puffin-World oznacza przede wszystkim grawitację i szerokość geograficzną, a nie kompletny symulator fizyczny. Wydanie koncentruje się głównie na statycznych scenach i nie deklaruje pełnego modelowania interakcji obiektów, dynamicznych środowisk ani procesów rozciągniętych na długi horyzont czasowy. 5
Najtrafniej więc postrzegać Puffin-World jako istotny krok ku wizualnym modelom świata osadzonym w przestrzeni i fizycznym układzie odniesienia — a nie jako uniwersalny symulator wszystkich zmiennych procesów fizycznych.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Puffin World modeluje jednocześnie trzy stany świata: fizykę związaną z grawitacją, gęstą mapę głębi oraz wygląd RGB.
Puffin World modeluje jednocześnie trzy stany świata: fizykę związaną z grawitacją, gęstą mapę głębi oraz wygląd RGB. Udostępniono kod, trzy checkpointy modeli oraz zbiór Puffin 16M: około 15 mln par wizja–język–kamera i 1 mln wymagających trajektorii.
Wyniki benchmarków są deklarowane przez autorów: dla Stanford2D3D podano medianę błędu 0,29° dla roll, 0,53° dla pitch i 1,62° dla pionowego pola widzenia.