Atlas คือโมเดลโลกแบบ multimodal ของ World Labs ที่ประมวลผลข้อความ ภาพ วิดีโอ และข้อมูล 3D เพื่อสร้างภาพและวิดีโอ คาดการณ์ฉาก และสร้างโลก 3D ที่มีความต่อเนื่องเชิงพื้นที่ [9] ผู้ใช้สามารถกำหนดมุมมองหรือเส้นทางการเคลื่อนกล้องได้ โดย Atlas พยายามสร้างเฟรมใหม่ให้สอดคล้องกับตำแหน่งของวัตถุและโครงสร้างของฉาก [9] World Lab...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Atlas, the multimodal AI world model launched by Fei-Fei Li’s World Labs, and how does it work, what 3D generation and reconstructio. Article summary: Atlas is World Labs’ next-generation “omni” world model: a single pretrained system that natively accepts text, images, video, and 3D/camera information to generate, reconstruct, and simulate spatially consistent environ. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
World Labs อธิบาย Atlas ว่าเป็น “โมเดลโลกแบบ omni สำหรับปัญญาเชิงพื้นที่” หรือระบบ AI ที่ออกแบบมาให้เข้าใจพื้นที่ วัตถุ มุมมอง และการเปลี่ยนแปลงของฉากในลักษณะใกล้เคียงกับการสร้างแบบจำลองโลกหนึ่งชุด
Atlas ไม่ได้มุ่งสร้างเพียงวิดีโอที่ดูสมจริงทีละเฟรม แต่รวมความสามารถด้านข้อความ ภาพ วิดีโอ และข้อมูล 3D ไว้ในโมเดลเดียว เพื่อสร้างภาพและวิดีโอจากมุมกล้องที่ควบคุมได้ สร้างฉากจริงขึ้นใหม่ในรูปแบบ 3D และคาดการณ์ว่าพื้นที่จะดูเป็นอย่างไรเมื่อกล้องหรือองค์ประกอบในฉากเปลี่ยนไป 9
ความแตกต่างสำคัญอยู่ที่ “ความสอดคล้องเชิงพื้นที่” ขณะที่เครื่องมือสร้างภาพและวิดีโอทั่วไปมักเน้นให้แต่ละเฟรมดูดี Atlas ถูกวางตำแหน่งให้รักษาความสัมพันธ์ระหว่างวัตถุ มุมกล้อง และสภาพแวดล้อมเอาไว้ตลอดการเคลื่อนกล้อง
World Labs ระบุว่า Atlas เป็น multimodal autoregressive diffusion transformer ที่พรีเทรนใหม่ตั้งแต่ต้น หมายความว่าโมเดลสามารถรับข้อมูลหลายรูปแบบและค่อย ๆ คาดการณ์เฟรม มุมมอง หรือผลลัพธ์ 3D ใหม่ให้เข้ากับบริบทของฉาก 9
ผู้ใช้สามารถป้อนภาพอ้างอิงหนึ่งภาพหรือหลายภาพ พร้อมข้อมูลกล้องหรือเส้นทางกล้องที่ออกแบบไว้ จากนั้น Atlas จะเรนเดอร์มุมมองที่ต้องการ รวมถึงส่วนของฉากที่ภาพต้นทางไม่ได้บันทึกไว้โดยตรง
อย่างไรก็ตาม พื้นที่ที่ไม่เคยถูกมองเห็นไม่ได้ถูก “กู้คืน” จากการวัดทางกายภาพที่ยืนยันแล้ว แต่เป็นการอนุมานจากข้อมูลที่มีอยู่และความรู้เดิมด้านภาพที่โมเดลเรียนรู้มา ดังนั้นภาพที่ดูสมจริงจึงไม่เท่ากับการสำรวจพื้นที่จริงในระดับงานรังวัด
ความสามารถหลักของ Atlas มีสองด้านที่เชื่อมโยงกัน ได้แก่
World Labs ยังวางระบบแทนพื้นที่นี้ไว้เพื่อรองรับงานจำลอง เช่น การเปลี่ยนแสง การเคลื่อนไหว ฉากหลัง หรือการจัดวางวัตถุสำหรับงานหุ่นยนต์ในอนาคต 9
ตามข้อมูลของ World Labs Atlas รองรับโหมดการสร้างหลายรูปแบบ ได้แก่
บริษัทใช้คำว่า “pixel-perfect” เพื่ออธิบายการควบคุมกล้อง โดยเส้นทางกล้องที่ผู้ใช้กำหนดถือเป็นส่วนหนึ่งของกระบวนการสร้าง ไม่ใช่การนำวิดีโอที่สร้างเสร็จแล้วมาใส่การเคลื่อนกล้องเพิ่มเติมภายหลัง 9
ในทางปฏิบัติ นี่อาจช่วยให้ผู้สร้างสามารถจัดเฟรมฟุตเทจใหม่ สังเคราะห์การเคลื่อนกล้องเสมือน หรือสร้างช็อตใหม่จากภาพอ้างอิงเพียงไม่กี่ภาพได้ จุดขายจึงอยู่ที่ “การควบคุมฉาก” มากกว่าการสร้างภาพเดี่ยวที่ดูดีเพียงภาพเดียว
World Labs ระบุว่า Atlas สามารถสร้างฉากในโลกจริงขึ้นใหม่จากภาพตั้งแต่ 1 ภาพไปจนถึงหลายสิบภาพ บริษัทกล่าวว่าภาพถ่ายเพียง 2–3 ภาพมักเพียงพอสำหรับผลลัพธ์ที่มีความสมจริง ขณะที่การใช้ภาพมากกว่า 100 มุมมองอาจเหมาะกับงานที่ให้ความสำคัญกับความละเอียดและความเที่ยงตรงมากกว่าการให้โมเดลคาดเดา 9
ผลลัพธ์ไม่ได้จำกัดอยู่ที่ภาพจากมุมใหม่เท่านั้น แต่มีเป้าหมายให้รวมถึงตัวแทนฉากแบบ 3D ที่ชัดเจนด้วย นั่นทำให้ Atlas แตกต่างจากระบบที่สร้างวิดีโอให้ดูเหมือนถูกต้องจากมุมใดมุมหนึ่งโดยไม่จำเป็นต้องรักษาโครงสร้างของฉากทั้งพื้นที่
แต่ข้อจำกัดยังคงมีอยู่ หากฉากถูกบันทึกมาแบบกระจัดกระจาย พื้นผิวหรือวัตถุที่ถูกบังจะต้องถูกอนุมานขึ้นมาใหม่ ผลลัพธ์อาจดูน่าเชื่อถือ แต่ยังมีโอกาสผิดเกี่ยวกับด้านหลังของวัตถุ ขนาดจริง ห้องที่มองไม่เห็น หรือรูปทรงของพื้นผิว การสร้างภาพที่สมจริงจึงไม่ควรถูกตีความว่าเป็นการสร้างแบบจำลองที่แม่นยำในระดับวิศวกรรมโดยอัตโนมัติ
World Labs ระบุว่า Atlas ทำผลงานเหนือกว่าโมเดลเฉพาะทางด้านการสร้างฉาก 3D ที่ล้ำสมัยในการประเมินของบริษัทเอง เอกสารเปิดตัวเน้นผลเชิงปริมาณในสองงานหลัก คือการสร้างภาพตามเงื่อนไขของกล้องและการสร้างฉาก 3D พร้อมย้ำว่าไม่มีเบนช์มาร์กเดียวที่สะท้อนความสามารถทั้งหมดของโมเดลได้ 9
ผลดังกล่าวถือเป็นข้อมูลที่น่าสนใจ แต่ยังเป็นผลที่บริษัทรายงานเอง ไม่ใช่การยืนยันโดยหน่วยงานอิสระ เนื้อหาที่มีอยู่ไม่ได้เปิดเผยชุดประเมินแบบทำซ้ำได้อย่างครบถ้วน เช่น ขั้นตอนการใช้ข้อมูลทั้งหมด คะแนนแยกรายโมเดล ค่าความไม่แน่นอน น้ำหนักโมเดล หรือผลการทดสอบจากบุคคลที่สาม ดังนั้นข้ออ้างเรื่องประสิทธิภาพที่เหนือกว่าจึงควรอ่านในฐานะผลการทดสอบจาก World Labs ไม่ใช่ข้อสรุปที่วงการยอมรับแล้ว
การทดสอบเพิ่มเติมมีความสำคัญเป็นพิเศษในประเด็นต่อไปนี้
Marble คือผลิตภัณฑ์สำหรับผู้ใช้ของ World Labs ที่ช่วยสร้างโลก 3D แบบถาวรและเดินสำรวจได้ โดยรับอินพุตจากข้อความ ภาพเดี่ยว ภาพหลายภาพ วิดีโอ ภาพพาโนรามา และโครงสร้าง 3D แบบหยาบ 6
ส่วน Atlas คือโมเดลรุ่นถัดไปที่อยู่เบื้องหลังทิศทางผลิตภัณฑ์ดังกล่าว ไม่ใช่เพียงชื่อใหม่ของฟีเจอร์ใน Marble โดย World Labs ระบุว่า Atlas จะเป็นขุมพลังให้ Marble รุ่นต่อไปและผลิตภัณฑ์อื่นของบริษัท 9
พูดให้เข้าใจง่าย Marble คือพื้นที่ใช้งานที่เข้าถึงได้ง่ายกว่า ขณะที่ Atlas คือแกนโมเดลเชิงพื้นที่ที่ World Labs ต้องการนำไปต่อยอดให้กว้างขึ้น เอกสารของ Marble ระบุว่าสามารถสร้างโลกจากข้อความ ภาพ และวิดีโอ ก่อนเปิดให้ผู้ใช้สำรวจและนำไปใช้ในเวิร์กโฟลว์อื่นต่อ 6
World Labs เปิดตัว World API เพื่อให้แอปพลิเคชันภายนอกสร้างโลก 3D ที่เดินสำรวจได้จากข้อความ ภาพ ภาพพาโนรามา อินพุตหลายมุมมอง และวิดีโอ เอกสาร API อธิบายขั้นตอนที่แอปส่งคำขอสร้างโลก จากนั้นเรียกดูผลลัพธ์เมื่อการประมวลผลเสร็จสิ้น 8
3
สิ่งนี้แตกต่างจากการเปิดให้ดาวน์โหลด Atlas ไปใช้งานบนเครื่อง หรือเปิดจุดเชื่อมต่อ Atlas สำหรับการประมวลผลแบบเรียลไทม์ เอกสารที่เผยแพร่ระบุชัดเจนถึงเวิร์กโฟลว์การสร้างโลกแบบไม่พร้อมใช้งานทันทีและการดึงผลลัพธ์ภายหลัง แต่ยังไม่ได้ยืนยันว่ามี API สาธารณะสำหรับ Atlas โดยตรง น้ำหนักโมเดลสำหรับใช้งานภายในเครื่อง หรือการอนุมานแบบเรียลไทม์ 3
8
9
สำหรับนักพัฒนา ช่องทางสาธารณะที่มีเอกสารรองรับในตอนนี้จึงยังเป็น Marble และ World API ไม่ใช่การเข้าถึงความสามารถของ Atlas ทุกส่วนตามที่ประกาศในงานวิจัย
การสร้างภาพตามเส้นทางกล้องอาจช่วยให้ศิลปินจัดเฟรมฟุตเทจใหม่ สร้างการเคลื่อนกล้องเสมือน และผลิตช็อตจากภาพอ้างอิงจำนวนจำกัด จุดเด่นคือการสร้างความเปลี่ยนแปลงในพื้นที่ที่ควบคุมได้ มากกว่าการสร้างเฟรมที่แยกขาดจากกัน 9
Marble มุ่งเน้นโลก 3D ที่คงอยู่และสามารถเดินสำรวจได้ Atlas อาจต่อยอดแนวทางนี้ด้วยการช่วยนักออกแบบสร้างหรือสร้างฉากจริงขึ้นใหม่ โดยยังรักษาความสัมพันธ์ระหว่างมุมมอง วัตถุ และพื้นที่ 6
9
ทีมสถาปัตยกรรม อุตสาหกรรม และงานสร้างสรรค์อาจใช้ข้อความ ภาพ และข้อมูลอ้างอิงอื่น ๆ เพื่อสำรวจแนวคิดเชิงพื้นที่ที่เดินดูได้ การควบคุมมุมมองอาจช่วยให้ตรวจสอบและปรับแก้แนวคิดได้สะดวกกว่าการสร้างภาพเรนเดอร์ที่ไม่เกี่ยวข้องกันหลายภาพ 6
9
World Labs เสนอกรณีใช้งานแบบ “real-to-sim” หรือการเปลี่ยนพื้นที่จริงให้เป็นสภาพแวดล้อมจำลอง โดยอาจเริ่มจากวิดีโอที่ถ่ายทั่วไป แล้วสร้างข้อมูลภาพ RGB และความลึกจากมุมมองของหุ่นยนต์ พร้อมปรับเปลี่ยนวัตถุ แสง การเคลื่อนไหว และฉากหลังเพื่อฝึกระบบนำทางหรือการหยิบจับ 9
นี่เป็นเป้าหมายที่ทะเยอทะยาน แต่ความสมจริงของภาพเพียงอย่างเดียวไม่ได้พิสูจน์ว่าฉากนั้นมีฟิสิกส์ ขนาด หรือการชนที่ถูกต้องเพียงพอสำหรับหุ่นยนต์จริง ประเด็นเหล่านี้ต้องผ่านการประเมินเฉพาะงานและการทดสอบการถ่ายโอนจากโลกจำลองสู่โลกจริง
World Labs ก่อตั้งโดยทีมที่มี Fei-Fei Li เป็นหนึ่งในผู้ร่วมก่อตั้ง และมีรายงานว่าบริษัทระดมทุนรวม 1.23 พันล้านดอลลาร์สหรัฐจากสองรอบนับตั้งแต่เปิดตัวจากโหมดสเตลธ์ในปี 2024 เงินทุนดังกล่าวสะท้อนขนาดการลงทุนที่บริษัทได้รับ แต่ไม่ใช่หลักฐานว่า Atlas มีความแม่นยำด้านฟิสิกส์ในระดับพร้อมใช้งานจริง
บริษัทซื้อกิจการ SceniX ซึ่งเป็นบริษัทด้านหุ่นยนต์และการจำลอง เมื่อวันที่ 21 กรกฎาคม 2026 โดยทิศทางดังกล่าวสอดคล้องกับเป้าหมายการนำ world model ไปสร้างสภาพแวดล้อมสำหรับการฝึกหุ่นยนต์ อย่างไรก็ตาม ความเชื่อมโยงเชิงกลยุทธ์นี้ไม่ได้ยืนยันผลลัพธ์ด้านการใช้งานจริงของ Atlas
สำหรับการเข้าถึง Atlas โดยตรง เอกสารเปิดตัวยังไม่ได้ระบุว่าเปิดให้ใช้งานในวงกว้าง World Labs กำลังรับคำขอเข้าถึงล่วงหน้า ขณะที่ Marble และ World API เป็นผลิตภัณฑ์สาธารณะที่มีเอกสารรองรับอยู่ในขณะนี้ 8
9
ข้อมูลที่ตรวจสอบในที่นี้ยังไม่เปิดเผยราคามาตรฐานของ Atlas ขนาดโมเดล ชุดข้อมูลฝึก ฮาร์ดแวร์ที่ใช้ ความหน่วงในการประมวลผล ปริมาณงาน หรือค่าใช้จ่ายคอมพิวต์ต่อการสร้างโลกหรือวิดีโอ 9
รายละเอียดเหล่านี้สำคัญสำหรับผู้ที่กำลังพิจารณาใช้ Atlas ในงานจริง เพราะเดโมที่ดูน่าประทับใจยังไม่ตอบว่าเวิร์กโฟลว์ดังกล่าวมีต้นทุนที่รับได้เมื่อใช้งานในปริมาณมากหรือไม่ เร็วพอสำหรับงานโต้ตอบหรือเปล่า และให้ผลลัพธ์ที่ทำซ้ำได้กับฉากจำนวนมากเพียงใด
Atlas คือความพยายามของ World Labs ที่จะรวมการสร้างวิดีโอ การสร้างฉาก 3D ขึ้นใหม่ และการจำลองพื้นที่ไว้ในโมเดล multimodal เดียว แนวคิดที่แตกต่างคือการทำให้ตำแหน่งกล้องและบริบท 3D เป็นอินพุตหลัก แทนที่จะมองแต่ละเฟรมเป็นภาพที่แยกจากกัน
ความสามารถที่บริษัทระบุไว้นั้นครอบคลุมตั้งแต่การสร้างภาพและวิดีโอที่ควบคุมกล้องได้ การสร้างฉากจากภาพไม่กี่มุม ไปจนถึงตัวแทน 3D และการประยุกต์ใช้กับการจำลองหุ่นยนต์ แต่จากข้อมูลที่มี Atlas ยังเป็นระบบช่วง early access
จนกว่าจะมีผลทดสอบจากหน่วยงานอิสระ รายละเอียดราคา ความเร็ว และข้อมูลด้านความแม่นยำทางกายภาพ การกล่าวอ้างที่โดดเด่นที่สุดของ Atlas ควรถูกมองว่าเป็นทิศทางการวิจัยและผลิตภัณฑ์ที่น่าจับตา มากกว่าจะเป็นประสิทธิภาพระดับการผลิตที่ได้รับการพิสูจน์แล้ว
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Atlas คือโมเดลโลกแบบ multimodal ของ World Labs ที่ประมวลผลข้อความ ภาพ วิดีโอ และข้อมูล 3D เพื่อสร้างภาพและวิดีโอ คาดการณ์ฉาก และสร้างโลก 3D ที่มีความต่อเนื่องเชิงพื้นที่ [9]
Atlas คือโมเดลโลกแบบ multimodal ของ World Labs ที่ประมวลผลข้อความ ภาพ วิดีโอ และข้อมูล 3D เพื่อสร้างภาพและวิดีโอ คาดการณ์ฉาก และสร้างโลก 3D ที่มีความต่อเนื่องเชิงพื้นที่ [9] ผู้ใช้สามารถกำหนดมุมมองหรือเส้นทางการเคลื่อนกล้องได้ โดย Atlas พยายามสร้างเฟรมใหม่ให้สอดคล้องกับตำแหน่งของวัตถุและโครงสร้างของฉาก [9]
World Labs ระบุว่า Atlas สร้างวิดีโอได้ยาวสูงสุด 1 นาทีที่ความละเอียด 1440p และสร้างฉาก 3D จากภาพตั้งแต่ 1 ภาพไปจนถึงหลายสิบภาพ [9]