Foundations · arXiv 2016
Layer Normalization
특징 축으로 정규화해 배치에 독립 — Transformer·RNN의 표준 정규화.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
BatchNorm은 “같은 시험을 본 반 전체”를 기준으로 점수를 맞춥니다 — 반 인원이 들쭉날쭉하거나 한 명씩 채점해야 하면 곤란하죠. LayerNorm은 “한 학생의 여러 과목 점수”를 그 학생 안에서 맞춥니다. 그래서 배치 크기와 완전히 무관합니다.
무엇을 제안했나
- 특징 축 정규화 — 하나의 샘플 안에서, 그 벡터의 모든 차원에 대해 평균·분산을 계산해 정규화.
- 배치 통계도, 추론용 running stats도 필요 없음.
그래서 무엇이 달라졌나
- 배치 크기·가변 길이 시퀀스·추론 불일치 문제를 전부 회피.
- GPT·BERT·LLaMA 등 모든 Transformer LLM의 표준 정규화가 됨.
더 공부할 가치가 있을까?
- Transformer를 뜯어본다면 필수급 — Pre-LN vs Post-LN, RMSNorm 같은 변형이 학습 안정성에 직접 영향을 줍니다.
- 묶어 볼 것 — BatchNorm과 대비하면 핵심이 30초에 잡힙니다.
3. 배치 정규화의 한계
BatchNorm의 한계 → LN의 동기
LN은 BN의 세 가지 약점을 정면으로 겨냥합니다.
작은 배치 → μ,σ 추정이 시끄러움. 멀티 GPU 분산 시에도 문제.
샘플 안 특징으로만 계산 → 배치 크기와 무관.
그래서 Transformer·RNN에서는 LN(또는 RMSNorm)이 표준이 되었습니다.
4. 레이어 정규화
BN vs LN 정규화 축
행=배치(N), 열=특징(C). 초록칸이 같은 μ·σ²를 공유합니다.
트랜스포머는 토큰 단위 처리라 LN이 자연스럽습니다.
LN Forward 파이프라인
토큰 하나(H=8). γ, β는 벡터(ℝᴴ) — dim마다 스케일·이동이 다릅니다.
2.401.10-0.300.803.00-1.200.501.701.0001.6600.000한 샘플의 H개 특징으로 평균·분산을 구합니다. 배치와 무관.
배치 독립성
공정 비교: 같은 배치에서 앞 B/2만 씁니다. LN 샘플0 μ는 그대로, BN 채널 μ는 흔들립니다.
-1.250.62-0.370.80-0.810.21-0.801.58-1.249-1.2490.000참고: 배치 전체 샘플 μ̄≈-0.00. 추론도 같은 식(running stats 없음).
5. Batch Norm vs Layer Norm
| Aspect | BatchNorm | LayerNorm |
|---|---|---|
| Axis | Across batch (per feature) | Across features (per sample) |
| Batch size | Dependent | Independent |
| RNN / seq | Awkward | Natural |
| Inference | Running stats | Same formula |
| Typical use | CNN | Transformer, RNN |
6. 트랜스포머에서의 위치
Pre-LN vs Post-LN
초록 곡선 = 잔차 skip (x → +). Pre-LN은 skip에 LN이 없어 기울기 하이웨이.
x + Sub(LN(x))GPT-2+ LLMsGPT-2 이후 대부분의 LLM이 Pre-LN(또는 변형)을 씁니다.
LN vs RMSNorm
RMSNorm은 평균 제거를 생략하고 RMS만으로 스케일. ~30% 계산 절감, LLaMA 표준.
0.91-0.780.49-1.51-0.041.75-0.990.170.3370.0000.3331.009성능 손실은 미미한 편. Mistral, Gemma 등도 RMSNorm 계열을 씁니다.
7. 실험 결과
| Model | EN→DE BLEU | EN→FR BLEU |
|---|---|---|
| RNN + BN | 16.46 | 30.87 |
| RNN + LN | 18.66 | 35.79 |
| Model | Perplexity |
|---|---|
| RNN baseline | 121.0 |
| LSTM | 82.0 |
| LSTM + LN | 75.8 |
8. 직관 · 핵심 개념
트랜스포머는 토큰 단위로 처리합니다. “이 토큰 안 특징이 얼마나 편향됐는가”를 맞추는 LN이 자연스럽고, “이 특징이 배치 전체에서 어떤가”를 보는 BN은 덜 맞습니다.
| Concept | Idea |
|---|---|
| Norm axis | Features in one sample (batch-free) |
| γ, β | Learnable per-feature scale/shift |
| Pre-LN | LN before sublayer (modern default) |
| RMSNorm | RMS only, no mean — LLaMA |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. Layer Norm이 정규화하는 축은?
2. LN이 BN과 달리 배치 크기에 무관한 이유는?
3. Transformer가 LN을 채택한 주된 이유는?
4. Pre-LN과 Post-LN의 차이로 옳은 것은?
5. RMSNorm이 LayerNorm에서 생략한 것은?