Recurrente neurale netwerken. RNN’s, LSTM’s en GRU’s worden al lang gebruikt voor wereldmodellen vanwege hun online recurrente toestandsupdates, maar hun grootste nadeel is de sequentiële training over de tijd, wat parallellisme beperkt en het modelleren van lange contexten bemoeilijkt.
Transformer-gebaseerde wereldmodellen. Modellen zoals TransDreamer vervangen recurrentie door self-attention, waardoor parallelle training mogelijk wordt en direct toegang tot lange geschiedenissen. De standaard kwadratische aandachtkost in sequentielengte maakt langdurige verbeeldingsrollouts en visuele modellering duur.
Gestructureerde toestandsruimtemodellen. S4 is een gestructureerd toestandsruimte-sequentiemodel dat is ontworpen voor langdurige afhankelijkheden. Het combineert een recurrente toestandsruimte-interpretatie met een convolutionele vorm die parallelle sequentietraining mogelijk maakt. Het artikel stelt dat S4 een veelbelovend middenweg biedt: lineaire inferentie en paralleliseerbare training.
S4WM’s onderscheiding. In plaats van S4 te gebruiken voor conventionele sequentietaken, integreert S4WM het in een latent visueel wereldmodel, met beeldcodering/-decodering en stochastische latente dynamica, en evalueert het tegen RNN- en Transformer-backbones in een gemeenschappelijk raamwerk. De bijdrage is het eerste op S4 gebaseerde wereldmodel dat hoogdimensionale beeldreeksen kan genereren via latentieverbeelding.
Beknopte positionering voor een literatuuroverzicht:
Eerdere wereldmodellen gebruikten voornamelijk recurrente latente dynamica of Transformers. RNN-gebaseerde modellen zijn efficiënt tijdens inferentie, maar trainen sequentieel, terwijl Transformer-wereldmodellen parallel trainen maar kwadratische tijdscomplexiteit hebben. S4WM onderzoekt gestructureerde toestandsruimte-lagen als alternatief dat parallelle training behoudt en tegelijk efficiënte langdurige dynamica mogelijk maakt.