**Transformer 在不同活化狀態下,重用的首先是運算規則,而不一定是相同的動態。**在同一個指定層中,不同的活化狀態會經過同一組 Query、Key、Value 投影矩陣、同一套注意力計算、同一組前饋網路權重,以及相同的殘差路徑。不過,算出的注意力權重和內部狀態變化,仍取決於當下的活化狀態。
13
關鍵在於分清楚「共用結構」和「反應相同」:
- **會重用的:**特定一層固定的連接方式與學習參數。說「同一層的結構相同」,不代表不同層也共用同一組權重。
13
- **不一定相同的:**同一個擾動在不同狀態下造成的局部變化。Query 和 Key 會由當下的活化值計算,因此兩者的互動可能隨狀態改變;同一個擾動的影響也可能不同。
13
- **較特殊的情況:**若採用先前假設的 Pre-LayerNorm(前置層正規化)設定,某個 token 的所有特徵若一同平移,正規化可能消去這項平移,再由殘差路徑將其帶往後續。若所有經過的分支都符合先前列出的條件,沿著這個平移方向,完整的內部擾動反應便可能保持一致。
12
因此,精確來說,**Transformer 會在多種活化狀態下重用固定運算子,但這本身不足以證明不同狀態具有相同的擾動動態。**Pre-LayerNorm 的平移例子說明,在特定條件下確實可能出現這種一致性;換成其他狀態方向,仍需要另外論證。