Rekursiva neurala nätverk (RNN). RNN-, LSTM- och GRU-baserade dynamikmodeller har länge varit centrala inom visuell världsmodellering. Deras stora begränsning är att de måste tränas sekventiellt över tid, vilket minskar möjligheten till parallellisering och gör det svårare att modellera mycket långa kontexter.
Transformer-baserade världsmodeller. Modeller som TransDreamer ersätter rekursion med självuppmärksamhet (self-attention), vilket möjliggör parallell träning och direkt åtkomst till långa historiker. Nackdelen är den kvadratiska kostnaden för uppmärksamhet i sekvenslängd, vilket gör långa föreställda rullningar och visuell modellering av långa kontexter dyrt.
Strukturerade state-space-modeller (S4). S4 är en strukturerad state-space-sekvensmodell som är designad för långa beroenden. Den kombinerar en rekursiv state-space-tolkning med en faltningsform som möjliggör parallell sekvensträning. Studien argumenterar för att detta gör S4 till en lovande mellanväg: linjär-tidsrekursiv inferens och parallelliserbar träning.
S4WM:s unika bidrag. Till skillnad från tidigare arbeten som använt S4 för konventionella sekvensuppgifter, integrerar S4WM modellen i en visuell latensvärldsmodell med bildkodning/avkodning och stokastisk latensdynamik. Modellen utvärderas sedan mot RNN- och Transformer-baserade alternativ inom ett gemensamt ramverk. Detta är enligt författarna den första S4-baserade världsmodellen som kan generera högdimensionella bildsekvenser via latensimagination.
En kort positionering för en litteraturöversikt:
Tidigare världsmodeller har främst använt rekursiv latensdynamik eller Transformers. RNN-baserade modeller är effektiva vid inferens men tränas sekventiellt, medan Transformer-baserade världsmodeller parallelliserar träning men har kvadratisk tidskostnad. S4WM utforskar strukturerade state-space-lager som ett alternativ som är tänkt att behålla parallell träning samtidigt som det ger stöd för effektiv modellering av långa horisonter.