S4WMs særtrekk. I stedet for å bruke S4 for konvensjonelle sekvensbenchmarks, inkorporerer S4WM det i en latent visuell verdensmodell, med bildekoding/-avkoding og stokastisk latent dynamikk, og evaluerer det deretter mot RNN- og Transformer-ryggrader under et felles verdensmodelleringsrammeverk. Det oppgitte bidraget er den første S4-baserte verdensmodellen for å generere høy-dimensjonale bildesekvenser via latent forestillingsevne.
En kort posisjoneringserklæring for en litteraturgjennomgang:
Tidligere verdensmodeller har primært brukt tilbakevendende latent dynamikk eller Transformers. RNN-baserte modeller er effektive ved inferens, men trenes sekvensielt, mens Transformer-baserte verdensmodeller parallelliserer trening, men har kvadratisk tidskostnad. S4WM utforsker strukturerte tilstandsromlag som et alternativt ryggrad designet for å beholde parallell trening samtidig som det støtter effektiv langtidshorisontdynamikkmodellering.