Puffin World, yalnızca inandırıcı görüntüler üretmek yerine yerçekimine göre kamera yönünü, yoğun derinliği ve RGB görünümünü birlikte temsil eden açık kaynaklı, kamera merkezli bir dünya modelidir. Yayın; kodu, üç model kontrol noktasını ve yaklaşık 15 milyon görüntü dil kamera üçlüsü ile 1 milyon zorlu kamera rota...
YayımlayanGPT-5.6 Terra ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Puffin-World, the open-source multimodal world model developed by ACE Robotics, NTU S-Lab, Beijing Jiaotong University, and the Univ. Article summary: Puffin-World is an open-source, camera-centric multimodal world model that treats a world not merely as RGB video, but as three jointly modeled native states: gravity-aware physics, dense 3D geometry, and visual appearan. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Puffin-World, ACE Robotics, Nanyang Teknoloji Üniversitesi (NTU) S-Lab, Beijing Jiaotong University ve University of Michigan bağlantılı araştırmacıların geliştirdiği açık kaynaklı çok modlu bir dünya modeli. Sistem, bir sahneyi yalnızca RGB piksel dizisi olarak değil; birbiriyle ilişkili üç durum üzerinden ele alıyor: fizik, geometri ve görünüm. Böylece yapay zekânın kameranın yerçekimine göre konumunu anlaması, denetlenebilir yeni bakış açıları üretmesi ve RGB-D sahneleri tek çerçevede yeniden kurması hedefleniyor. 1
5
Üretken modeller gerçekçi görünen görüntüler üretebilir. Ancak kamera açısı değiştikçe ufkun sabit kalması, kameranın duruşunun tutarlı olması ve sahnenin 3B yapısının korunması ayrı bir problemdir. Puffin-World bu nedenle şu üç bileşeni açık biçimde temsil ediyor:
Bu yaklaşım modeli kamera merkezli hâle getiriyor: Sistem yalnızca “sahne nasıl görünüyor?” sorusunu değil, kameranın yerçekimine göre nasıl yöneldiğini ve sahne içinde hangi hareketle yeni bir görüntü elde edilebileceğini de ele alıyor.
Puffin-World’ün ana koşullandırma temsili Omni-Camera adını taşıyor. Bu 9 kanallı yoğun kamera koşulu, yerçekimi farkındalığı olan mutlak perspektif alanını ışın tabanlı göreli geometriyle birleştiriyor. İki bileşenin işlevi farklı: 5
Model, referans görüntüden çıkardığı yerçekimi bilgisini istenen kamera rotası boyunca taşıyor. Amaç, ardışık üretilen bakış açılarında fiziksel referans çerçevesini tutarlı tutmak ve ufuk ya da yerçekimi yönündeki kaymayı azaltmak. 5
6
Proje, genellikle ayrı sistemler gerektiren birkaç görevi aynı çatı altında topluyor.
Anlama dalı, tek bir görüntüden mutlak roll (yan yatış), pitch (yukarı-aşağı eğim) ve dikey görüş alanını (vertical FoV) tahmin ediyor. Bu çıktılar, modelin kamera temsilinde kullanılan yerçekimi ve perspektif alanlarına dönüştürülebiliyor. 5
Puffin-World, metin ile kamera kontrolü verildiğinde ya da bir girdi görseli ile belirli kamera rotası sağlandığında yeni bakış açıları üretebiliyor. Kontroller; yön değişimi, öteleme, kamera iç parametreleri ve roll, pitch, yaw içeren birleşik hareketleri kapsıyor. 5
Model yalnızca renk üretmiyor; rota boyunca RGB ile derinliği ortaklaşa oluşturuyor. Ardından bu RGB-D çıktıları, ayrı bir çevrimdışı geometri hattına devredilmeden renkli 3B nokta bulutunda birleştirilebiliyor. 5
Açık sürümde taklit keşif (mimic-exploration) ve öz-kalibrasyon demoları bulunuyor. Dokümantasyon, yerçekimi farkındalığı olan çerçevenin üretilen rotaları yeniden sabitleyerek biriken poz tutarsızlığını sınırlamaya yardımcı olduğunu belirtiyor. Bununla birlikte, kamuya açık materyaller kayma düzeltme algoritmasının tüm ayrıntılarını vermiyor; dolayısıyla bu nokta, kontrol döngüsünün eksiksiz teknik açıklamasından çok gösterilmiş bir yetenek olarak değerlendirilmelidir. 5
6
Puffin-World; geometriye hizalı bir C-RADIO görsel kodlayıcıyı, Qwen dil modelini, SD3.5 difüzyon üretecini ve hafif bir bağlayıcıyı bir araya getiriyor. Tasarım, otoregresif kamera/fizik anlayışını difüzyon tabanlı çoklu bakış açısı RGB-D üretiminden ayırırken bunları tek bir sistemde tutuyor. 5
Yayın üç kontrol noktası listeliyor:
Açık sürümde kod, eğitim ve değerlendirme rehberleri, veri seti oluşturma dokümantasyonu, modeller ve veri setleri de yer alıyor. 5
Puffin-16M, iki tamamlayıcı bölümde yaklaşık 16,5 milyon örnek içeren veri seti olarak tanımlanıyor. 14
Puffin-Cam-15M, yaklaşık 900 bin panoramadan işlenen yaklaşık 15 milyon görüntü-dil-kamera üçlüsünü içeriyor. Bildirilen aralıkta roll ve pitch −45° ile +45° arasında, dikey görüş alanı ise 20° ile 105° arasında değişiyor. 5
Puffin-Traj-1M ise 1 milyon zorlu kamera rotası ekliyor. Proje materyalleri uzun rotaları, aşırı dönüşleri ve pitch, yaw, roll içeren birleşik hareketleri doğruluyor; ancak hareket türlerine göre güvenilir sayısal dağılım sunmuyor. 5
11
Sunulan kaynaklar, iç ve dış mekânlar ile gerçek ve sentetik görüntülerde kapsama işaret ediyor; ancak sahne kategorilerinin kesin oranlarını ortaya koymuyor. 7
Ekip, Puffin-World’ü 28 açık veri setine mutlak roll, pitch ve dikey FoV tahminleri eklemek için de kullandı. Bunların 22’si tek görüntü, altısı ise ardışık veya 3B veri seti; toplamda yaklaşık 44,5 milyon kamera etiketi üretildi. Makaleye göre bu etiketler, veri setlerinde yaygın olan yatay kamera eğilimini, genelde aşağı bakan pitch değerlerini ve önemli FoV farklılıklarını gösteriyor. 1
Bu çalışma önemli; çünkü dünya modellerinin yalnızca sahne içeriğine değil, kameranın bağlamına da ihtiyacı var. Göreli hareket bilgisi tek başına, kameranın yerçekimine veya ortak bir dünya referansına göre yönünü bütünüyle tanımlamıyor.
Proje ekibi; Stanford2D3D, MegaDepth, TartanAir ve LaMAR üzerinde 12 karşılaştırmanın tamamında en iyi medyan hatayı, beraberlikler dâhil 36 metriğin 33’ünde de en iyi AUC sonucunu bildirdi. Bunlar yazarların açıkladığı sonuçlardır; sağlanan kaynaklarda bağımsız yeniden üretim bulunmuyor. 5
Öne çıkan bildirilen değerler şöyle:
Yayın ayrıca Puffin-Cam-Bench üzerinde yukarı yön vektörü, enlem ve yerçekimi için düşük hatalı kamera kontrol sonuçları bildiriyor. Ayrı bir proje özeti 1,32° yerçekimi hatası verirken README farklı bir yerçekimi metriği raporluyor. Eldeki kaynaklar değerlendirme tanımlarını değerlerin doğrudan karşılaştırılmasına yetecek açıklıkta sunmuyor. 4
5
Puffin-World’deki “fizik” temsili esas olarak yerçekimi ve enlemden oluşuyor; sistem tam kapsamlı bir fizik simülatörü değil. Yayın ağırlıklı olarak durağan sahnelere odaklanıyor ve nesne etkileşimleri, hareketli ortamlar veya uzun zaman ufuklu dinamiklerin bütünüyle modellendiği iddiasında bulunmuyor. 5
Bu nedenle Puffin-World, değişen fiziksel süreçlerin tümünü simüle eden genel amaçlı bir sistemden ziyade, uzamsal ve fiziksel olarak daha iyi temellendirilmiş görsel dünya modellemeye doğru güçlü bir adım olarak görülmeli.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Puffin World, yalnızca inandırıcı görüntüler üretmek yerine yerçekimine göre kamera yönünü, yoğun derinliği ve RGB görünümünü birlikte temsil eden açık kaynaklı, kamera merkezli bir dünya modelidir.
Puffin World, yalnızca inandırıcı görüntüler üretmek yerine yerçekimine göre kamera yönünü, yoğun derinliği ve RGB görünümünü birlikte temsil eden açık kaynaklı, kamera merkezli bir dünya modelidir. Yayın; kodu, üç model kontrol noktasını ve yaklaşık 15 milyon görüntü dil kamera üçlüsü ile 1 milyon zorlu kamera rotasından oluşan Puffin 16M veri setini içeriyor.
Yazarların bildirdiği sonuçlara göre model, Stanford2D3D’de medyan 0,29° roll, 0,53° pitch ve 1,62° dikey görüş alanı hatasına ulaştı.