Rangkaian neural berulang. Model dinamik RNN, LSTM, dan GRU menyediakan kemas kini keadaan berulang dalam talian dan menjadi teras kepada pemodelan dunia visual. Had utama mereka ialah latihan jujukan dari semasa ke semasa, yang mengurangkan keselarian temporal dan boleh menyukarkan pemodelan konteks yang sangat panjang.
Model dunia Transformer. Model dinamik berasaskan Transformer, termasuk TransDreamer, menggantikan pengulangan dengan perhatian kendiri, membolehkan latihan selari dan akses terus kepada sejarah panjang. Kos perhatian kuadratik standard dalam panjang jujukan menjadikan rollout khayalan panjang dan pemodelan visual konteks panjang mahal dari segi pengiraan.
Model ruang keadaan berstruktur. S4 ialah model jujukan ruang keadaan berstruktur yang direka untuk pergantungan jarak jauh, menggabungkan tafsiran ruang keadaan berulang dengan bentuk konvolusi yang membenarkan latihan jujukan selari. Kertas kerja ini berpendapat bahawa ini menjadikan S4 sebagai jalan tengah yang menjanjikan: inferens berulang masa linear dan latihan selari.
Perbezaan S4WM. Daripada menggunakan S4 untuk penanda aras jujukan konvensional, S4WM menggabungkannya ke dalam model dunia visual pendam, dengan pengekodan/penyahkodan imej dan dinamik pendam stokastik, kemudian menilainya terhadap tulang belakang RNN dan Transformer di bawah rangka kerja pemodelan dunia yang sama. Sumbangan yang dinyatakan ialah model dunia berasaskan S4 pertama yang menjana jujukan imej berdimensi tinggi melalui imaginasi pendam.
Pernyataan kedudukan ringkas untuk tinjauan literatur:
Model dunia sebelum ini terutamanya menggunakan dinamik pendam berulang atau Transformer. Model berasaskan RNN cekap semasa inferens tetapi dilatih secara berjujukan, manakala model dunia Transformer menyelaraskan latihan tetapi mempunyai kos temporal kuadratik. S4WM meneroka lapisan ruang keadaan berstruktur sebagai tulang belakang alternatif yang bertujuan untuk mengekalkan latihan selari sambil menyokong pemodelan dinamik ufuk panjang yang cekap.