Puffin World نموذج عالم متعدد الوسائط ومتمحور حول الكاميرا، يعالج الجاذبية والعمق الكثيف ومظهر RGB معاً بدلاً من الاكتفاء بتوقع بكسلات الفيديو. يتضمن الإصدار الشيفرة وثلاث نقاط تحقق وبيانات Puffin 16M، التي تضم نحو 15 مليون ثلاثية رؤية لغة كاميرا ومليون مسار كاميرا صعب.
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Puffin-World, the open-source multimodal world model developed by ACE Robotics, NTU S-Lab, Beijing Jiaotong University, and the Univ. Article summary: Puffin-World is an open-source, camera-centric multimodal world model that treats a world not merely as RGB video, but as three jointly modeled native states: gravity-aware physics, dense 3D geometry, and visual appearan. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Puffin-World هو نموذج عالم مفتوح المصدر ومتعدد الوسائط، طوّره باحثون تابعون لـ ACE Robotics وS-Lab في جامعة نانيانغ التقنية، وجامعة بكين جياوتونغ، وجامعة ميشيغان. فكرته الأساسية هي تمثيل العالم ثلاثي الأبعاد عبر ثلاث حالات مترابطة: الفيزياء والهندسة والمظهر. وبذلك يستطيع النظام الاستدلال على وضعية الكاميرا، وتوليد زوايا رؤية جديدة مضبوطة، وإعادة بناء مشاهد RGB-D ضمن إطار واحد. 1
5
قد تنتج أنظمة التوليد صوراً مقنعة، لكن إقناع الصورة وحده لا يعني الحفاظ على أفق ثابت، أو وضعية كاميرا سليمة، أو بنية ثلاثية الأبعاد متسقة عند تغيير زاوية النظر. لذلك يمثّل Puffin-World صراحةً ما يلي:
هذا يجعله نموذج عالم متمحوراً حول الكاميرا: فهو لا يسأل فقط عن شكل المشهد، بل عن اتجاه الكاميرا نسبةً إلى الجاذبية وكيف يمكن أن تتحرك خلاله.
يعتمد Puffin-World تمثيل تكييف يسمى Omni-Camera، وهو شرط كاميرا كثيف من تسع قنوات يجمع بين حقل منظور مطلق واعٍ بالجاذبية وهندسة نسبية قائمة على الأشعة. ولكل جزء وظيفة مختلفة: 5
وينقل النموذج تقدير الجاذبية المستنتج من لقطة مرجعية على امتداد المسار المطلوب للكاميرا. والهدف المعلن هو إبقاء المشاهد المولدة ضمن إطار فيزيائي متسق وتقليل انجراف الجاذبية أو خط الأفق الذي قد يظهر عند توليد اللقطات بشكل متتابع. 5
6
يطرح المشروع إطاراً واحداً لمهام كانت تُنفذ عادةً في أنظمة منفصلة.
انطلاقاً من صورة واحدة، يتنبأ فرع الفهم بزوايا اللّف (roll) والميل (pitch) المطلقتين، وبـ مجال الرؤية العمودي (FoV). ويمكن تحويل هذه التقديرات إلى حقول الجاذبية والمنظور التي يستخدمها تمثيل الكاميرا في النموذج. 5
يستطيع Puffin-World توليد مشاهد انطلاقاً من نص مع تعليمات للكاميرا، أو من صورة إدخال مع مسار كاميرا محدد. وتشمل عناصر التحكم تغييرات الاتجاه والانتقال والمعلمات الداخلية والحركات المركبة، بما فيها اللف والميل والانحراف (yaw). 5
بدلاً من توليد اللون وحده، يولد النموذج RGB والعمق معاً على طول المسار. ويمكن دمج هذه المخرجات لاحقاً في سحابة نقاط ثلاثية الأبعاد ملوّنة، من دون إسناد إعادة البناء إلى خط معالجة هندسي خارجي منفصل. 5
يتضمن الإصدار العلني عروضاً لمحاكاة الاستكشاف والمعايرة الذاتية. وتصف الوثائق الإطار الواعي بالجاذبية باعتباره وسيلة لإعادة إرساء المسارات المولدة والحد من تراكم عدم اتساق وضعية الكاميرا. لكن المواد العامة المتاحة لا تشرح خوارزمية تصحيح الانجراف بالكامل، لذا ينبغي النظر إلى ذلك كقدرة معروضة لا كوصف كامل لحلقة التحكم. 5
6
يجمع Puffin-World بين مشفّر رؤية C-RADIO المتوافق مع الهندسة، ونموذج اللغة Qwen، ومولّد الانتشار SD3.5، وموصل خفيف. ويفصل التصميم بين الفهم التتابعي للكاميرا والحالة الفيزيائية، وبين توليد RGB-D متعدد الزوايا بالانتشار، مع إبقاء الجزأين ضمن نظام موحد. 5
ويعرض الإصدار ثلاث نقاط تحقق:
وتتضمن الإتاحة العامة الشيفرة وإرشادات التدريب والتقييم وتوثيق بناء البيانات والنماذج ومجموعات البيانات. 5
توصف مجموعة Puffin-16M بأنها تضم قرابة 16.5 مليون عينة موزعة على مكونين متكاملين. 14
يحتوي Puffin-Cam-15M على نحو 15 مليون ثلاثية من الرؤية واللغة والكاميرا، جرى تصييرها من قرابة 900 ألف بانوراما. وتمتد تغطية الكاميرا المعلنة من −45° إلى +45° في اللف والميل، ومن 20° إلى 105° في مجال الرؤية العمودي. 5
ويضيف Puffin-Traj-1M مليون مسار كاميرا صعب. وتذكر مواد المشروع مسارات طويلة ودورانات حادة وحركات مركبة تشمل الميل والانحراف واللف، لكنها لا تقدم تفصيلاً رقمياً موثوقاً حسب فئة الحركة. 5
11
وتدعم المواد المتاحة وجود مشاهد داخلية وخارجية، حقيقية واصطناعية، لكنها لا تثبت توزيعاً دقيقاً لفئات المشاهد. 7
استخدم الفريق أيضاً Puffin-World لإضافة تقديرات مطلقة للّف والميل ومجال الرؤية العمودي إلى 28 مجموعة بيانات عامة: 22 مجموعة لصور مفردة وست مجموعات متسلسلة أو ثلاثية الأبعاد. ونتج عن ذلك نحو 44.5 مليون وسم للكاميرا. وتشير الورقة إلى انحياز شائع نحو كاميرات أفقية المستوى، وميل يتجه عموماً إلى الأسفل، وتباين كبير في مجال الرؤية بين مجموعات البيانات. 1
وتكتسب هذه الوسوم أهمية لأن نماذج العالم لا تحتاج فقط إلى محتوى المشهد، بل إلى سياق الكاميرا أيضاً. فالحركة النسبية وحدها لا تكفي لتحديد اتجاه الكاميرا بالنسبة إلى الجاذبية أو إطار عالمي مشترك.
يقول المشروع إنه حقق أفضل خطأ وسيط في المقارنات الاثنتي عشرة عبر Stanford2D3D وMegaDepth وTartanAir وLaMAR، وأفضل مساحة تحت المنحنى (AUC) في 33 من أصل 36 مقياساً مُبلغاً عنه عند احتساب التعادلات. وهذه نتائج أعلنها المؤلفون ولم تُعَد إنتاجها بصورة مستقلة في المصادر المتاحة. 5
ومن الأرقام المختارة التي أعلنها الفريق:
ويورد الإصدار كذلك نتائج قوية للتحكم بالكاميرا على معيار Puffin-Cam-Bench، تشمل أخطاء منخفضة لمتجه الأعلى وخط العرض والجاذبية. ويذكر ملخص مستقل رقماً قدره 1.32° لخطأ الجاذبية، بينما يسجل ملف README مقياساً مختلفاً للجاذبية؛ ولا توضح المصادر المتاحة تعريفات التقييم بما يكفي لاعتبار الرقمين قابلين للمقارنة المباشرة. 4
5
تمثيل «الفيزياء» في Puffin-World يقتصر أساساً على الجاذبية وخط العرض، وليس محاكياً فيزيائياً كاملاً. ويركز الإصدار أساساً على المشاهد الساكنة، ولا يدعي نمذجة شاملة لتفاعلات الأجسام أو البيئات المتحركة أو الديناميكيات طويلة الأمد. 5
لذلك، من الأدق فهم Puffin-World بوصفه خطوة مهمة نحو نمذجة بصرية مكانية ومؤسسة فيزيائياً، لا محاكياً عاماً لكل العمليات الفيزيائية المتغيرة.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
Puffin World نموذج عالم متعدد الوسائط ومتمحور حول الكاميرا، يعالج الجاذبية والعمق الكثيف ومظهر RGB معاً بدلاً من الاكتفاء بتوقع بكسلات الفيديو.
Puffin World نموذج عالم متعدد الوسائط ومتمحور حول الكاميرا، يعالج الجاذبية والعمق الكثيف ومظهر RGB معاً بدلاً من الاكتفاء بتوقع بكسلات الفيديو. يتضمن الإصدار الشيفرة وثلاث نقاط تحقق وبيانات Puffin 16M، التي تضم نحو 15 مليون ثلاثية رؤية لغة كاميرا ومليون مسار كاميرا صعب.
النتائج المعيارية المعلنة من الفريق تشير إلى أخطاء وسيطة على Stanford2D3D تبلغ 0.29° للّف، و0.53° للميل، و1.62° لمجال الرؤية العمودي.