Transformer 世界模型。 基于 Transformer 的动力学模型(如 TransDreamer)用自注意力机制替代循环结构,支持并行训练并能直接访问整个历史信息。但其标准注意力机制的时间复杂度与序列长度成二次方关系,这使得长序列想象滚动和长上下文视觉建模的计算开销很大。
结构化状态空间序列模型(S4)。 S4 是一种专为长程依赖设计的结构化状态空间序列模型。它兼具循环状态空间解释和卷积形式,后者允许序列训练并行化。论文认为 S4 是一个有希望的中间方案:推理时保持线性时间,训练时可并行。
S4WM 的创新点。 与将 S4 用于常规序列基准不同,S4WM 将其整合进一个潜在视觉世界模型,包括图像编码/解码和随机潜在动力学,并在同一世界建模框架下与 RNN 和 Transformer 骨干进行公平比较。研究声称这是首个基于 S4 并能通过潜在想象生成高维图像序列的世界模型。
以下是适合文献综述的精炼定位表述:
此前世界模型主要采用循环潜在动力学或 Transformer。RNN 模型推理高效,但训练是顺序的;Transformer 世界模型可并行训练,但时间代价与序列长度成二次方。S4WM 探索了结构化状态空间层作为替代骨干,旨在保留并行训练能力的同时,支持高效的长时域动力学建模。