“Facing Off World Model Backbones: RNNs, Transformers, and S4” (Deng, Park, and Ahn, 2023) ศึกษาเปรียบเทียบว่าโครงสร้าง sequence model แบบใดมีประสิทธิภาพสูงสุดสำหรับ latent world model ใน model-based reinforcement learning งานวิจัยนี้เสนอ S4WM ซึ่งเป็น world model แรกที่ประยุกต์ใช้ Structured State Space Sequence (S4) layers ในการจินตนาการภาพความละเอียดสูง ![]()
งานวิจัยที่เกี่ยวข้อง
-
Latent world models / model-based RL. รากฐานที่ใกล้เคียงที่สุดคือโมเดล latent-dynamics อย่าง PlaNet, Dreamer, DreamerV2 และ DreamerV3 ซึ่งเรียนรู้การแทนสถานะแบบ stochastic ที่กะทัดรัด และทำนายวิถีในอนาคตเพื่อปรับนโยบาย งานวิจัยนี้วางตำแหน่งโมเดล RSSM (Recurrent State-Space Model) โดยเฉพาะ Dreamer เป็นกลุ่ม baseline หลัก ![]()
-
Recurrent neural networks. โมเดลไดนามิกส์แบบ RNN, LSTM และ GRU ให้การอัปเดตสถานะแบบออนไลน์แบบ recurrent และเป็นหัวใจสำคัญของการสร้าง world model แบบเห็นภาพ ข้อจำกัดหลักคือการเทรนแบบ sequential ที่ลดความสามารถในการทำ parallel และทำให้การจำลองบริบทที่ยาวนานทำได้ยากขึ้น ![]()
-
Transformer world models. โมเดลไดนามิกส์แบบ Transformer เช่น TransDreamer แทนที่การวนซ้ำด้วย self-attention ทำให้เทรนแบบขนานได้และเข้าถึงประวัติที่ยาวนานได้โดยตรง แต่ต้นทุนการคำนวณแบบ quadratic ในความยาว sequence ทำให้การจำลองแบบยาว (long imagined rollouts) และการสร้างโมเดลภาพในบริบทที่ยาวนานมีต้นทุนสูง ![]()
-
Structured state-space models. S4 เป็นโมเดล sequence แบบ state-space ที่มีโครงสร้าง ถูกออกแบบมาเพื่อจัดการ dependencies ระยะไกล รวมการตีความแบบ recurrent state-space เข้ากับรูปแบบ convolutional ที่ช่วยให้เทรน sequence แบบขนานได้ งานวิจัยนี้อ้างว่า S4 เป็นจุดกึ่งกลางที่ดี: inference แบบ recurrent ที่มีประสิทธิภาพเชิงเส้นและการเทรนแบบขนาน