Puffin World הוא מודל עולם ממוקד־מצלמה שמייצג יחד פיזיקה מודעת־כבידה, עומק צפוף ומראה RGB — ולא רק רצף פיקסלים משכנע. הפרויקט פרסם קוד, שלושה מודלים מאומנים מראש ואת Puffin 16M: כ־15 מיליון שלישיות של ראייה, שפה ומצלמה ועוד מיליון מסלולי מצלמה מאתגרים.
פורסם על ידינערך באמצעות GPT-5.6 Terraהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Puffin-World, the open-source multimodal world model developed by ACE Robotics, NTU S-Lab, Beijing Jiaotong University, and the Univ. Article summary: Puffin-World is an open-source, camera-centric multimodal world model that treats a world not merely as RGB video, but as three jointly modeled native states: gravity-aware physics, dense 3D geometry, and visual appearan. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
מודלי יצירת תמונה יודעים כיום להפיק פריים שנראה אמין. אבל מראה אמין אינו מבטיח שהאופק יישאר יציב, שהמצלמה תשמור על תנוחה עקבית, או שהסצנה תתנהג כמבנה תלת־ממדי כשמשנים את נקודת המבט. Puffin-World נועד לטפל בדיוק בפער הזה.
זהו מודל עולם מולטימודלי ובקוד פתוח, שפותח בידי חוקרים המזוהים עם ACE Robotics, מעבדת S-Lab של אוניברסיטת נניאנג הטכנולוגית, אוניברסיטת התחבורה של בייג׳ינג ואוניברסיטת מישיגן. במקום לייצג עולם כתמונות RGB בלבד, הוא מחבר שלושה מצבי עולם: פיזיקה — כיוון הכבידה וקו רוחב; גאומטריה — עומק צפוף; ומראה — תמונת RGB. 1
5
כאשר מערכת מייצרת תצפיות חדשות של אותה סצנה, היא צריכה להבחין בין תנועה יחסית של מצלמה לבין הכיוון המוחלט שלה בעולם. בלי עוגן כזה, האופק עלול "לזלוג" בין פריימים או שהמצלמה תצבור שגיאת תנוחה לאורך מסלול.
Puffin-World מגדיר את עצמו כמודל עולם ממוקד־מצלמה: הוא מנסה להבין לא רק מה נמצא בסצנה, אלא גם את יחסה של המצלמה לכוח הכבידה ואת האופן שבו היא יכולה לנוע דרכה. 1
5
בלב המערכת נמצאת תצוגת תנאי מצלמה צפופה בת תשעה ערוצים, בשם Omni-Camera. היא משלבת שני רכיבים משלימים: 5
המודל מפיץ לאורך המסלול המבוקש את כיוון הכבידה שהסיק מתצפית הייחוס. לפי התיעוד, המטרה היא להשאיר את התצפיות המיוצרות באותה מסגרת פיזיקלית ולהפחית סחיפה של הכבידה או קו האופק בעת יצירה רציפה של נקודות מבט. 5
6
מענף ההבנה של המודל ניתן להעריך מתמונה בודדת את זווית הגלגול (roll), זווית ההטיה (pitch) ושדה הראייה האנכי (vertical FoV). לאחר מכן אפשר להמיר הערכות אלה לשדות הכבידה והפרספקטיבה שבהם משתמשת תצוגת המצלמה של המודל. 5
המערכת יכולה ליצור תצפיות מטקסט בצירוף בקרות מצלמה, או מתמונה קיימת ומסלול מצלמה נתון. הבקרות כוללות שינויי כיוון, תרגום, פרמטרים פנימיים ותנועה מורכבת — כולל roll, pitch ו־yaw. 5
Puffin-World אינו מסתפק בצבע: הוא מפיק יחד RGB ועומק לאורך מסלול. לאחר מכן אפשר לאחד את פלטי ה־RGB-D לענן נקודות תלת־ממדי צבעוני, בלי להעביר את שלב השחזור לצינור גאומטרי לא מקוון ונפרד. 5
ההפצה הציבורית כוללת הדגמות של חקירת חיקוי וכיול עצמי. התיעוד מציג את המסגרת המודעת־כבידה כאמצעי לעיגון מחדש של מסלולים ולצמצום אי־עקביות מצטברת בתנוחה. עם זאת, החומרים הציבוריים שסופקו אינם מפרטים במלואם את אלגוריתם תיקון הסחיפה; לכן יש לראות בכך יכולת שהודגמה, ולא תיאור מלא של לולאת הבקרה. 5
6
Puffin-World משלב מקודד ראייה מיושר־גאומטריה מסוג C-RADIO, מודל שפה ממשפחת Qwen, מחולל דיפוזיה SD3.5 ומחבר קל משקל. התכנון מפריד בין הבנה אוטורגרסיבית של המצלמה והמצב הפיזיקלי לבין יצירת RGB-D מרובת־מבט באמצעות דיפוזיה, אך משאיר את שני החלקים תחת מערכת אחת. 5
הפרויקט מפרט שלושה checkpoints:
ההפצה כוללת קוד, הנחיות לאימון ולהערכה, תיעוד לבניית מערכי נתונים, מודלים ומערכי נתונים. 5
מערך הנתונים Puffin-16M מתואר ככולל כ־16.5 מיליון דוגמאות בשני חלקים משלימים. 14
Puffin-Cam-15M כולל כ־15 מיליון שלישיות של ראייה, שפה ומצלמה, שרונדרו מכ־900 אלף פנורמות. טווחי המצלמה המדווחים כוללים roll ו־pitch בין −45° ל־+45°, ושדה ראייה אנכי בין 20° ל־105°. 5
Puffin-Traj-1M מוסיף מיליון מסלולי מצלמה מאתגרים. חומרי הפרויקט מזכירים מסלולים ארוכים, סיבובים קיצוניים ופעולות מורכבות הכוללות pitch, yaw ו־roll, אך אינם מספקים פילוח מספרי מהימן לפי סוג תנועה. 5
11
המקורות שסופקו תומכים בכך שהנתונים מכסים סצנות פנים וחוץ, אמיתיות וסינתטיות, אך אינם מבססים התפלגות מדויקת של קטגוריות סצנה. 7
הצוות השתמש ב־Puffin-World גם כדי להוסיף הערכות מוחלטות של roll, pitch ושדה ראייה אנכי ל־28 מערכי נתונים ציבוריים: 22 מערכי תמונה בודדת ושישה מערכים סדרתיים או תלת־ממדיים. התוצאה היא כ־44.5 מיליון הערות מצלמה. לפי המאמר, ההערות חושפות הטיה נפוצה לצילומים במצלמה מאוזנת, נטייה כללית להטיה כלפי מטה ושונות ניכרת בשדה הראייה בין מערכי נתונים. 1
העבודה הזו מדגישה נקודה מרכזית: מידע על תנועות יחסיות בין פריימים אינו מספיק לבדו כדי לקבוע כיצד המצלמה מיושרת ביחס לכבידה או למסגרת עולם משותפת.
הפרויקט מדווח על שגיאת חציון הטובה ביותר בכל 12 ההשוואות מול Stanford2D3D, MegaDepth, TartanAir ו־LaMAR, וכן על AUC הטוב ביותר ב־33 מתוך 36 מדדים מדווחים, כולל תוצאות תיקו. אלה תוצאות של המחברים, ולא שוחזרו באופן בלתי תלוי במקורות שסופקו. 5
נתונים נבחרים שדווחו:
ההפצה מדווחת גם על תוצאות חזקות בשליטת מצלמה במדד Puffin-Cam-Bench, כולל שגיאות נמוכות בכיוון "למעלה", בקו רוחב ובכבידה. תקציר פרויקט נפרד מציין שגיאת כבידה של 1.32°, בעוד קובץ ה־README מדווח מדד כבידה אחר; המקורות הזמינים אינם מבהירים די הצורך את הגדרות ההערכה, ולכן אין להתייחס לערכים כאל מדדים בני־השוואה ישירה. 4
5
ב־Puffin-World, רכיב ה״פיזיקה״ מתייחס בעיקר לכבידה ולקו רוחב — לא למנוע פיזיקלי שלם. ההפצה מתמקדת בעיקר בסצנות סטטיות ואינה טוענת למידול מלא של אינטראקציות בין עצמים, סביבות דינמיות או דינמיקה ארוכת־טווח. 5
לכן נכון לראות ב־Puffin-World צעד משמעותי לעבר מודל חזותי תלת־ממדי שמעוגן במרחב ובפיזיקה, אך לא סימולטור כללי של כל תהליך פיזיקלי משתנה.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Puffin World הוא מודל עולם ממוקד־מצלמה שמייצג יחד פיזיקה מודעת־כבידה, עומק צפוף ומראה RGB — ולא רק רצף פיקסלים משכנע.
Puffin World הוא מודל עולם ממוקד־מצלמה שמייצג יחד פיזיקה מודעת־כבידה, עומק צפוף ומראה RGB — ולא רק רצף פיקסלים משכנע. הפרויקט פרסם קוד, שלושה מודלים מאומנים מראש ואת Puffin 16M: כ־15 מיליון שלישיות של ראייה, שפה ומצלמה ועוד מיליון מסלולי מצלמה מאתגרים.
לפי תוצאות שדווחו בידי המחברים, ב־Stanford2D3D התקבלו שגיאות חציוניות של 0.29° בגלגול, 0.53° בהטיה ו־1.62° בשדה הראייה האנכי.