Réseaux de neurones récurrents. Les modèles de dynamique RNN, LSTM et GRU fournissent des mises à jour d'état récurrentes en ligne et ont été centraux pour la modélisation visuelle du monde. Leur principale limitation est l'apprentissage séquentiel dans le temps, ce qui réduit le parallélisme temporel et peut rendre la modélisation de contextes très longs plus difficile.
Modèles du monde Transformer. Les modèles de dynamique basés sur Transformer, y compris TransDreamer, remplacent la récurrence par l'auto-attention, permettant un apprentissage parallèle et un accès direct à de longs historiques. Leur coût d'attention quadratique standard en longueur de séquence rend les déroulés imaginés longs et la modélisation visuelle de longs contextes coûteuse en calcul.
Modèles à espace d'état structuré. S4 est un modèle de séquence à espace d'état structuré conçu pour les dépendances à longue portée, combinant une interprétation récurrente d'espace d'état avec une forme convolutionnelle qui permet un apprentissage parallèle des séquences. L'article soutient que cela fait de S4 un compromis prometteur : inférence récurrente en temps linéaire et apprentissage parallélisable.
La distinction de S4WM. Plutôt que d'utiliser S4 pour des benchmarks de séquence conventionnels, S4WM l'incorpore dans un modèle du monde visuel latent, avec encodage/décodage d'image et dynamique latente stochastique, puis l'évalue face aux architectures RNN et Transformer dans un cadre commun de modélisation du monde. La contribution annoncée est le premier modèle du monde basé sur S4 capable de générer des séquences d'images haute dimension via imagination latente.
Un énoncé de positionnement concis pour une revue de littérature :
Les modèles du monde antérieurs ont principalement utilisé des dynamiques latentes récurrentes ou des Transformers. Les modèles basés sur RNN sont efficaces en inférence mais s'entraînent séquentiellement, tandis que les modèles du monde Transformer parallélisent l'apprentissage mais ont un coût temporel quadratique. S4WM explore les couches d'espace d'état structuré comme une architecture alternative destinée à conserver l'apprentissage parallèle tout en prenant en charge une modélisation de dynamique à long horizon efficace.