본문으로 건너뛰기
임커밋조회 2

최신 LLM들이 Transformer의 정규화 위치를 앞으로 옮긴 이유

Transformer 블록 내 LayerNorm의 위치를 연산 이전(Pre-LN)으로 배치하여 깊은 모델에서도 그래디언트 폭주 없이 안정적인 학습을 구현하는 원리를 다룬다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Transformer 아키텍처에서 정규화(Normalization)의 위치가 모델의 학습 안정성에 미치는 영향을 분석한다. 초기 모델의 Post-LN 방식과 달리 최근 Gemma, DeepSeek 등 최신 LLM들이 Pre-LN을 채택하는 이유는 그래디언트 전파의 안정성 때문이다. Post-LN은 레이어가 깊어질수록 출력층 근처에서 그래디언트가 폭주하여 Warm-up 단계가 필수적이지만, Pre-LN은 레이어 수에 비례하여 그래디언트 크기를 적절히 제어함으로써 안정적인 업데이트를 가능하게 한다. 수식적 분석과 실험 결과를 통해 Pre-LN이 깊은 신경망 구조에서 더 효율적인 최적화 경로를 제공함을 입증한다.

챕터별 상세

00:00

LayerNorm의 동작과 역할

LayerNorm은 시퀀스 모델링에서 학습을 안정화하기 위해 레이어 축을 기준으로 데이터를 정규화하는 모듈이다. 평균과 표준편차를 이용해 데이터를 표준화한 직후, 학습 가능한 파라미터인 감마(γ)와 베타(β)를 적용하여 최종 출력을 산출한다. 초기 Transformer 논문에서는 이 과정이 Attention과 FFN 연산 이후에 위치하는 Post-LN 방식이었으나, 최근 Gemma나 DeepSeek 같은 모델들은 이를 연산 이전으로 옮긴 Pre-LN 또는 RMSNorm 구조를 채택했다. 이러한 변화는 모델이 깊어질수록 발생하는 학습 불안정성 문제를 해결하기 위한 핵심적인 아키텍처 수정이다.

LayerNorm은 배치 정규화(Batch Normalization)와 달리 각 샘플 내의 피처들을 정규화하므로 시퀀스 길이에 유연하게 대응할 수 있다.

python
x = x + attention(layernorm(x))
x = x + ffn(layernorm(x))

최신 LLM에서 표준적으로 사용되는 Pre-LN 구조의 연산 순서

01:38

Pre-LN과 Post-LN의 학습 안정성 차이

2020년 발표된 연구에 따르면 레이어 수가 많은 깊은 모델일수록 Pre-LN이 Post-LN보다 훨씬 안정적인 학습 특성을 보인다. Post-LN 구조는 출력층에 가까운 레이어일수록 그래디언트의 기댓값이 급격히 커지는 경향이 있어, 학습 초기 단계에서 모델이 발산할 위험이 크다. 반면 Pre-LN은 모델 전체에 걸쳐 파라미터 업데이트가 비교적 균일하게 일어나며, 이는 모델이 깊어져도 학습 안정성을 유지할 수 있게 해준다. 이러한 차이 때문에 Post-LN을 사용할 때는 학습률을 아주 천천히 올리는 Warm-up 단계가 필수적이지만, Pre-LN은 상대적으로 자유로운 설정이 가능하다.

Warm-up은 학습 초기에 매우 작은 학습률을 사용하다가 점진적으로 높이는 기법으로, Post-LN의 불안정성을 보완하기 위해 고안됐다.

03:40

수식으로 분석한 Pre-LN의 학습 효율성

체인 룰(Chain Rule)을 통해 그래디언트 전파 과정을 분석하면 Pre-LN의 우수성이 수식적으로 증명된다. Post-LN의 경우 레이어 정규화의 입력값이 레이어 개수와 무관하게 일정하여 분모의 크기가 작게 유지되므로 결과적으로 큰 그래디언트가 발생한다. 반면 Pre-LN은 레이어 정규화의 입력 크기가 레이어 개수의 제곱근에 비례하여 커지기 때문에, 분모가 커지면서 그래디언트 업데이트가 세밀하고 안정적으로 이루어진다. 실험 결과에서도 Pre-LN은 Warm-up 없이도 Post-LN보다 낮은 검증 손실(Validation Loss)을 기록하며 더 우수한 성능을 보였다. 결과적으로 최신 LLM들이 Pre-LN을 선택하는 이유는 깊은 레이어 구조에서도 안정적인 최적화가 가능하기 때문이다.

그래디언트 계산 시 레이어 정규화의 입력 노름(Norm)이 분모에 위치하게 되어, 입력이 클수록 그래디언트 크기가 제어되는 원리이다.

용어 해설

레이어 정규화(LayerNorm)
신경망의 각 층에서 활성화 값을 정규화하여 학습을 안정화하는 기법이다. 평균과 표준편차를 이용해 데이터를 표준화한 후 학습 가능한 파라미터를 적용하여 데이터의 분포를 조정함으로써 내부 공변량 변화를 억제한다.
프리 레이어 정규화(Pre-LN)
Transformer 블록 내에서 어텐션이나 피드포워드 연산 이전에 레이어 정규화를 수행하는 구조이다. 최근 대규모 언어 모델(LLM)에서 학습 안정성을 높이고 Warm-up 단계에 대한 의존도를 낮추기 위해 표준적으로 채택된다.
포스트 레이어 정규화(Post-LN)
연산이 끝난 후 잔차 연결(Residual Connection) 뒤에 레이어 정규화를 수행하는 방식이다. 초기 Transformer 모델에서 사용되었으나, 모델이 깊어질수록 출력층 근처의 그래디언트가 불안정해지는 단점이 있어 대규모 모델 학습에는 불리하다.
기울기 소실 및 폭주(Gradient Vanishing/Exploding)
역전파 과정에서 그래디언트가 너무 작아지거나 커져서 학습이 제대로 이루어지지 않는 현상이다. 모델의 층이 깊어질수록 이 문제가 심화되며, 정규화 위치와 잔차 연결 구조에 따라 발생 양상이 크게 달라진다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 05.수집 2026. 09. 05.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.