Transformer world models. โมเดลไดนามิกส์แบบ Transformer เช่น TransDreamer แทนที่การวนซ้ำด้วย self-attention ทำให้เทรนแบบขนานได้และเข้าถึงประวัติที่ยาวนานได้โดยตรง แต่ต้นทุนการคำนวณแบบ quadratic ในความยาว sequence ทำให้การจำลองแบบยาว (long imagined rollouts) และการสร้างโมเดลภาพในบริบทที่ยาวนานมีต้นทุนสูง
Structured state-space models. S4 เป็นโมเดล sequence แบบ state-space ที่มีโครงสร้าง ถูกออกแบบมาเพื่อจัดการ dependencies ระยะไกล รวมการตีความแบบ recurrent state-space เข้ากับรูปแบบ convolutional ที่ช่วยให้เทรน sequence แบบขนานได้ งานวิจัยนี้อ้างว่า S4 เป็นจุดกึ่งกลางที่ดี: inference แบบ recurrent ที่มีประสิทธิภาพเชิงเส้นและการเทรนแบบขนาน
ความแตกต่างของ S4WM. แทนที่จะใช้ S4 กับงาน sequence ทั่วไป S4WM นำ S4 ไปใช้ใน world model แบบเห็นภาพ โดยมีการเข้ารหัส/ถอดรหัสภาพและ stochastic latent dynamics จากนั้นประเมินผลเทียบกับ RNN และ Transformer ภายใต้กรอบการสร้าง world model ร่วมกัน ผลงานที่ระบุคือการเป็น world model แรกที่ใช้ S4 เพื่อสร้างลำดับภาพความละเอียดสูงผ่านการจินตนาการแบบ latent
ข้อความสรุปที่กระชับสำหรับการทบทวนวรรณกรรม:
ก่อนหน้านี้ world model ส่วนใหญ่ใช้ latent dynamics แบบ recurrent หรือ Transformer โมเดลที่ใช้ RNN มีประสิทธิภาพในการ inference แต่เทรนแบบ sequential ในขณะที่ world model แบบ Transformer เทรนแบบขนานได้แต่มีต้นทุนชั่วคราวแบบ quadratic S4WM สำรวจการใช้ structured state-space layers เป็นทางเลือก backbone ที่ออกแบบมาเพื่อรักษาความสามารถในการเทรนแบบขนานในขณะที่รองรับการจำลองไดนามิกส์ระยะยาวที่มีประสิทธิภาพ