**Transformer跨不同激活状态复用的,首先是计算规则,而不一定是相同的内部动态。**在固定的一层中,不同激活会经过同一组 Query、Key、Value 投影矩阵、同一套注意力计算、同一组前馈网络权重和相同的残差路径。但注意力权重和状态变化会随输入激活而改变。
13
关键在于区分“结构相同”和“响应相同”:
- 固定的是这一层的结构与参数。 同一层会重复使用相同的计算部件和已学习参数;但这不代表 Transformer 中不同层之间共享权重。
13
- 不一定固定的是对扰动的响应。 Query 和 Key 由当前激活计算,因此它们之间的关系可能随状态改变;同一个扰动在不同状态下也可能产生不同效果。
13
- 有一个范围更窄的特殊情形。 在前文假设的 Pre-LayerNorm 构造中,如果把某个 token 的所有特征都加上相同的偏移量,归一化会消去这个偏移;偏移则可沿残差路径传递。在所有已述分支条件都满足时,沿这一方向的完整内部扰动响应也会保持一致。
12 这是特定构造下的数学结果,并非所有 Transformer 都具备的通性。
因此,更准确地说:**Transformer会在多个激活状态下复用固定的算子和参数,但这本身不能证明不同状态下的扰动动态相同。**Pre-LayerNorm 的整体平移是这种响应一致性可能出现的一个特例;对其他方向,则需要另外论证。