Transformerが異なる活性化状態に対して再利用するのは、まず計算の規則です。動力学そのものが同じとは限りません。 ある特定の層では、Query・Key・Valueを作る射影行列、Attentionの計算、フィードフォワード層の重み、残差経路が固定されています。異なる活性化状態は、その同じ計算を通ります。一方、そこで生じるAttentionの重みや内部状態の変化は、入力の状態によって異なります。
13
ここでは「構造が同じ」ことと「変化の仕方まで同じ」ことを区別するのがポイントです。
- 再利用されるもの: 特定の層における計算経路と学習済みパラメーターです。「同じ層の構造」とは、別々の層も同じ重みを共有するという意味ではありません。
13
- 必ずしも再利用されないもの: 摂動に対する具体的な応答です。QueryやKeyは現在の活性化状態から計算されるため、それらの相互作用、ひいては同じ摂動が及ぼす影響も状態ごとに変わり得ます。
13
- 条件付きで応答も一致する例: ここで想定しているPre-LayerNormの構成では、あるトークンの特徴量すべてに同じ値を加える変化が正規化によって取り除かれ、残差経路を通って伝わることがあります。さらに、通過するすべての経路について所定の条件が満たされるなら、そのシフト方向に沿った内部の摂動応答も一致します。ただしこれは、その構成と条件に限った数学的な帰結であり、Transformer一般の性質ではありません。
12
したがって、正確にはこう言えます。Transformerは、多くの活性化状態に対して同じ演算子を適用します。しかし、それだけでは異なる状態で摂動への応答まで同一だとは言えません。 Pre-LayerNormでのシフトは、そのような一致が起こり得る具体例です。ほかの方向の変化については、別途根拠を示す必要があります。