트랜스포머에서 여러 활성화 상태에 걸쳐 재사용되는 것은 우선 계산 규칙이지, 상태 변화의 양상 자체는 아닙니다. 특정 층은 입력 상태가 달라져도 같은 쿼리(Query)·키(Key)·밸류(Value) 투영 행렬과 어텐션 계산, 피드포워드 가중치, 잔차 경로를 사용합니다. 하지만 계산 결과인 어텐션 가중치와 내부 상태의 변화는 입력 활성화에 따라 달라집니다.
13
둘을 구분하면 답이 더 분명해집니다.
- 고정돼 있는 것: 특정 층의 계산 경로와 학습된 매개변수입니다. 같은 층의 구조를 여러 상태에 적용한다는 말이지, 서로 다른 층끼리 가중치를 공유한다는 뜻은 아닙니다.
13
- 상태에 따라 달라질 수 있는 것: 어떤 토큰이 다른 토큰에 얼마나 주의를 기울이는지, 그리고 특정 교란이 내부 표현을 어떻게 바꾸는지입니다. 쿼리와 키가 현재 활성화에서 계산되므로, 상태가 달라지면 어텐션의 상호작용과 동일한 교란의 효과도 달라질 수 있습니다.
13
- 특정 조건에서 가능한 예외: Pre-LayerNorm 구조에서는 한 토큰의 모든 특성에 같은 값을 더하는 이동이 정규화에서 제거되고 잔차 경로를 통해 이어질 수 있습니다. 통과하는 모든 경로가 앞서 가정한 조건을 만족한다면, 이 이동 방향에서는 계산 규칙뿐 아니라 전체 내부 교란 반응도 동일하게 유지됩니다.
12 이는 특정 구조와 방향에서 성립하는 결과이지, 모든 트랜스포머에 일반적으로 적용되는 성질은 아닙니다.
요컨대 트랜스포머는 여러 활성화 상태에 동일한 연산자를 적용하지만, 그 상태들이 똑같이 변한다고 보장되지는 않습니다. Pre-LayerNorm의 균일 이동 사례는 특정 방향에서 반응의 동일성이 어떻게 성립할 수 있는지를 보여줍니다. 다른 방향의 교란에도 같은 결론을 내리려면 별도의 근거가 필요합니다.