Tilbagevendende neurale netværk. RNN-, LSTM- og GRU-dynamikmodeller leverer online tilbagevendende tilstandsopdateringer og har været centrale for visuel verdensmodellering. Deres største begrænsning er sekventiel træning over tid, hvilket reducerer temporal parallelitet og kan gøre modellering af meget lange kontekster vanskelig.
Transformer-baserede verdensmodeller. Transformer-baserede dynamikmodeller, herunder TransDreamer, erstatter tilbagevendelse med self-attention, hvilket muliggør parallel træning og direkte adgang til lange historikker. Deres standard kvadratiske opmærksomhedsomkostning i sekvenslængde gør lange forestillede rulninger og langkontekstuel visuel modellering beregningstung.
Strukturerede tilstandsrum-modeller. S4 er en struktureret tilstandsrum-sekvensmodel designet til langtrækkende afhængigheder, der kombinerer en tilbagevendende tilstandsrum-fortolkning med en konvolutionel form, der tillader parallel sekvenstræning. Artiklen argumenterer for, at dette gør S4 til en lovende mellemting: lineær inferens under kørsel og paralleliserbar træning.
S4WM’s særpræg. I stedet for at bruge S4 til konventionelle sekvensbenchmarks inkorporerer S4WM det i en latent visuel verdensmodel med billedkodning/-afkodning og stokastisk latent dynamik og evaluerer det derefter mod RNN- og Transformer-rygrad i en fælles verdensmodelleringsramme. Det angivne bidrag er den første S4-baserede verdensmodel til at generere højdimensionelle billedsekvenser via latent forestilling.
En præcis positioneringserklæring til en litteraturgennemgang:
Tidligere verdensmodeller har primært brugt tilbagevendende latent dynamik eller Transformere. RNN-baserede modeller er effektive under inferens, men træner sekventielt, mens Transformer-verdensmodeller paralleliserer træning, men har kvadratiske tidsomkostninger. S4WM udforsker strukturerede tilstandsrum-lag som en alternativ rygrad, der er beregnet til at bevare parallel træning, samtidig med at den understøtter effektiv langtidshorisont dynamikmodellering.