簡單講,Transformer 跨唔同啟動狀態重用嘅,首先係計算規則,而唔一定係動態本身。 喺固定一層入面,模型會用同一套 Query、Key、Value 投影矩陣、注意力計算、前饋網絡權重同殘差路徑處理唔同輸入狀態。呢啲係該層固定嘅結構同參數;唔代表唔同層之間一定共用同一組權重。
13
但計算規則一樣,唔等於每次計出嚟嘅結果一樣:
- 固定不變嘅部分: 同一層嘅運算方式同已學參數。呢度講嘅「同一層結構」,唔係指唔同層共用權重。
13
- 會隨狀態改變嘅部分: 注意力權重同內部狀態變化。因為 Query 同 Key 係由當前啟動狀態計出嚟,佢哋之間嘅互動亦可能因狀態而異;所以同一個擾動,喺唔同狀態下可以產生唔同反應。
13
- 一個有條件嘅特殊情況: 如果採用前置 LayerNorm(Pre-LayerNorm)構造,對單一 token 嘅所有特徵維度加上相同偏移,正規化步驟可以消除呢個偏移,再由殘差路徑傳遞。若所有經過嘅分支亦符合相關假設,沿住呢個偏移方向嘅完整內部擾動反應就可以保持一致。
12 呢個結果來自特定構造同條件,唔係所有 Transformer 嘅一般性質。
所以,最準確嘅答案係:Transformer 會跨唔同啟動狀態重用固定運算子,但單憑呢點,未能證明擾動動態亦一樣。 Pre-LayerNorm 嘅偏移例子,展示咗特定方向嘅反應點樣可以一致;其他方向就要另外論證。