S4WMs Besonderheit. Statt S4 für konventionelle Sequenz-Benchmarks zu verwenden, integriert S4WM es in ein latentes visuelles Weltmodell mit Bildkodierung/-dekodierung und stochastischer latenter Dynamik. Anschließend wird es mit RNN- und Transformer-Rückgraten unter einem gemeinsamen Weltmodell-Rahmenwerk verglichen. Der genannte Beitrag ist das erste S4-basierte Weltmodell zur Generierung hochdimensionaler Bildsequenzen durch latente Imagination.
Eine präzise Positionierung für eine Literaturübersicht:
Frühere Weltmodelle verwendeten hauptsächlich rekurrente latente Dynamiken oder Transformer. RNN-basierte Modelle sind bei der Inferenz effizient, trainieren aber sequenziell, während Transformer-Weltmodelle das Training parallelisieren, dafür aber quadratische zeitliche Kosten haben. S4WM erforscht strukturierte Zustandsraum-Schichten als alternatives Rückgrat, das paralleles Training beibehält und gleichzeitig effiziente Langzeit-Dynamikmodellierung unterstützt.