Tilbakevendende nevrale nettverk. RNN-, LSTM- og GRU-dynamikkmodeller gir online tilbakevendende tilstandsoppdateringer og har vært sentrale for visuell verdensmodellering. Deres hovedbegrensning er sekvensiell trening over tid, noe som reduserer temporal parallellisme og kan gjøre modellering av svært lange kontekster vanskeligere.
Transformer-baserte verdensmodeller. Transformer-baserte dynamikkmodeller, inkludert TransDreamer, erstatter tilbakevendende mekanismer med selvattensjon, noe som muliggjør parallell trening og direkte tilgang til lange historier. Deres standard kvadratiske attensjonskostnad i sekvenslengde gjør lange forestilte utrullinger og langkontekst visuell modellering kostbart.
Strukturerte tilstandsrommodeller. S4 er en strukturert tilstandsromsekvensmodell designet for langdistanseavhengigheter, som kombinerer en tilbakevendende tilstandsromtolkning med en konvolusjonell form som tillater parallell sekvenstrening. Artikkelen argumenterer for at dette gjør S4 til et lovende mellomground: lineær-tid tilbakevendende inferens og paralleliserbar trening.
S4WMs særtrekk. I stedet for å bruke S4 for konvensjonelle sekvensbenchmarks, inkorporerer S4WM det i en latent visuell verdensmodell, med bildekoding/-avkoding og stokastisk latent dynamikk, og evaluerer det deretter mot RNN- og Transformer-ryggrader under et felles verdensmodelleringsrammeverk. Det oppgitte bidraget er den første S4-baserte verdensmodellen for å generere høy-dimensjonale bildesekvenser via latent forestillingsevne.
En kort posisjoneringserklæring for en litteraturgjennomgang:
Tidligere verdensmodeller har primært brukt tilbakevendende latent dynamikk eller Transformers. RNN-baserte modeller er effektive ved inferens, men trenes sekvensielt, mens Transformer-baserte verdensmodeller parallelliserer trening, men har kvadratisk tidskostnad. S4WM utforsker strukturerte tilstandsromlag som et alternativt ryggrad designet for å beholde parallell trening samtidig som det støtter effektiv langtidshorisontdynamikkmodellering.