S4WM’s særpræg. I stedet for at bruge S4 til konventionelle sekvensbenchmarks inkorporerer S4WM det i en latent visuel verdensmodel med billedkodning/-afkodning og stokastisk latent dynamik og evaluerer det derefter mod RNN- og Transformer-rygrad i en fælles verdensmodelleringsramme. Det angivne bidrag er den første S4-baserede verdensmodel til at generere højdimensionelle billedsekvenser via latent forestilling.
En præcis positioneringserklæring til en litteraturgennemgang:
Tidligere verdensmodeller har primært brugt tilbagevendende latent dynamik eller Transformere. RNN-baserede modeller er effektive under inferens, men træner sekventielt, mens Transformer-verdensmodeller paralleliserer træning, men har kvadratiske tidsomkostninger. S4WM udforsker strukturerede tilstandsrum-lag som en alternativ rygrad, der er beregnet til at bevare parallel træning, samtidig med at den understøtter effektiv langtidshorisont dynamikmodellering.