Foundations · ICLR 2015
Adam: A Method for Stochastic Optimization
모멘텀 + RMSProp을 합친 적응형 옵티마이저. LLM 학습의 사실상 표준.
1. 핵심 요약
구현이 단순하고 메모리도 비교적 가볍습니다. 지금은 LLM에서 AdamW(가중치 감쇠를 분리)가 더 흔하지만, 뼈대는 그대로 Adam입니다.
2. 배경: 옵티마이저의 진화
옵티마이저 계보
SGD → Momentum → AdaGrad → RMSProp → Adam. 단계를 눌러 보세요.
Momentum의 m + RMSProp의 v + 편향 보정. 적응형 + 관성.
확률적 경사하강법 (SGD)
모든 파라미터에 동일한 학습률 α → 스케일이 다른 좌표에는 비효율적.
모멘텀 (Momentum)
이전 기울기 방향을 관성으로 기억 → 진동↓·수렴↑. 단, 여전히 전역 α.
AdaGrad
자주 업데이트된 파라미터는 학습률 감소. 단점: G가 단조 증가 → 학습이 너무 일찍 멈출 수 있음.
RMSProp
AdaGrad의 단조 감소 문제를 지수 이동 평균으로 해결.
3. Adam 알고리즘
Adam은 모멘텀(1차)과 RMSProp(2차)을 통합하고, 초반 편향을 보정합니다.
Adam 한 스텝 (시뮬)
데모: 스칼라 θ, 고정 기울기 g로 t스텝까지 굴려 봅니다.
1.2000.120 / 0.00141.200 / 1.4400-0.001 / -0.0010미니배치로 ∇L을 계산합니다.
α=0.001, β₁=0.9, β₂=0.999m0, v0 = 0, 0
for t = 1, 2, ...:
g = grad(θ)
m = β1*m + (1-β1)*g
v = β2*v + (1-β2)*g²
m̂ = m / (1 - β1^t)
v̂ = v / (1 - β2^t)
θ = θ - α * m̂ / (√v̂ + ε)4. 핵심 개념
편향 보정: m vs m̂
초반 m은 작고, m̂=m/(1−β₁ᵗ)로 끌어올립니다. t가 커지면 둘은 거의 같아집니다.
m=0.878 · m̂=1.000 · target g=1.00
편향 보정이 필요한 이유
m₀=v₀=0으로 시작하므로 초반 추정은 0 쪽으로 치우칩니다.
예: β₁=0.9, t=1 → m₁=0.1 g₁. 보정하면 m̂₁=g₁.
적응형 학습률의 의미
v̂가 크면(기울기 변동↑) 보폭↓ → 안정. v̂가 작으면 보폭↑ → 빠른 학습.
유효 학습률 (파라미터별)
같은 α라도 |g|가 큰 좌표는 √v̂가 커져 보폭이 줄어듭니다.
변동이 큰 파라미터는 천천히, 잔잔한 파라미터는 상대적으로 빠르게 움직입니다.
5. 변형들
AdamW (Decoupled Weight Decay)
L2를 기울기에 더하는 대신, 파라미터에 직접 감쇠를 적용합니다. BERT·GPT 등 LLM 학습의 표준이며 Adam보다 일반화가 좋은 경우가 많습니다.
- AdaFactor: 2차 모멘트를 저랭크 근사 → 메모리↓ (T5)
- Adan: Nesterov 모멘텀 통합 → 수렴 속도↑
- Lion: sign 기반, 메모리 약 절반 (Google 자동 탐색)
| Optimizer | Adaptive LR | Momentum | Memory |
|---|---|---|---|
| SGD | no | optional | none |
| AdaGrad | monotonic ↓ | no | ×1 |
| RMSProp | EMA | no | ×1 |
| Adam | EMA | yes | ×2 (m,v) |
| AdamW | EMA | yes | ×2 (m,v) |
6. 실무 지침
스케줄과 같이 쓰기
- Warmup: 초반 학습률을 낮게 시작해 점진 증가
- Cosine Annealing: 코사인으로 점진 감소
- Linear Decay: 선형 감소
대형 모델
- 파라미터마다 m,v 저장 → 옵티마이저 상태 ≈ 파라미터의 2배 → 전체 ~3배 메모리
- 예: 175B GPT-3급 — 파라미터 수백 GB + 옵티마이저 상태 약 2배 → ZeRO 등 샤딩 필요
7. 의의
- SGD+Momentum을 대체한 사실상 표준
- 기본 하이퍼파라미터로도 잘 작동 → 연구 생산성↑
- 발표 후 10년간 인용 20만 회 이상 — AI 논문 최다 인용군에 속하는 최적화 고전