LLM Evolution · arXiv 2020

Scaling Laws for Neural Language Models

손실이 N·D·C의 멱함수로 예측 가능 — 대형 LM 설계의 지도 원리.

Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, et al. · OpenAI

scaling-lawspower-lawcomputechinchilla

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

작은 화분 몇 개로 식물의 성장 곡선을 재 보면, 큰 밭에서 얼마나 자랄지 꽤 정확히 예측할 수 있습니다. LM의 성능(손실)도 모델 크기·데이터·연산에 대해 매끈한 곡선(멱함수)을 그립니다.

무엇을 제안했나

  • 멱함수 법칙 — 테스트 손실이 파라미터 N, 데이터 D, 연산 C 각각에 대해 예측 가능하게 감소.
  • 연산 예산 배분 — 정해진 연산이 있을 때 모델을 얼마나 키우고 얼마나 학습할지 계산.

그래서 무엇이 달라졌나

  • 큰 모델을 돌려 보기 전에 성능을 추정할 수 있게 됨 → GPT-3·GPT-4 규모 결정에 사용.
  • “더 키우면 더 좋아진다”를 정량화.

더 공부할 가치가 있을까?

  • LLM을 설계·계획한다면 필수 — 다만 배분 공식은 Chinchilla에서 수정됩니다. 둘을 반드시 함께 보세요.

3. 멱함수 관계

L(N)≈(NcN)αN,  αN≈0.076L(N)\approx\left(\frac{N_c}{N}\right)^{\alpha_N},\;\alpha_N\approx 0.076
N = non-embed · 10× → L ≈ 0.84× (다른 축이 충분할 때)
파라미터 스케일링수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

멱함수 손실

축을 고르고 스케일(10^k)을 키우면 테스트 손실 L이 부드럽게 떨어집니다.

L(N) ≈ (N_c / N)^α · α≈0.076

α_N ≈ 0.076 · non-embedding N · 10× → L ≈ 0.84×

도식(상대 스케일). N은 non-embed. 실제 적합은 WebText2 실험 곡선.

N / D / C 축을 바꿔 손실 곡선을 보세요.

N · D · C 지도

세 스케일 축과 스케일링의 성격을 클릭해 보세요.

N — 파라미터

non-embedding 가중치 수. 구조보다 ‘얼마나 많은가’가 지배적.

작은 실험으로 큰 모델 손실을 외삽.

세 축 · 예측 가능성 · 구조보다 스케일.

4. 연산 예산 배분

C≈6NDC \approx 6ND
대략 forward+backward 기울기 연산 상수
연산량 근사수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명
N∝Cmin⁡0.73,D∝Cmin⁡0.27N \propto C_{\min}^{0.73},\quad D \propto C_{\min}^{0.27}
Kaplan: C_min↑ 때 N을 D보다 빠르게 (지수 비중)
Kaplan 최적 배분수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

연산 예산 배분

C↑ 때 Kaplan: N∝C^0.73, D∝C^0.27. (별도로 C≈6ND — non-embed N·토큰 D)

N ∝ C^0.73×154.9상대 N
D ∝ C^0.27×6.5상대 D
N·D∝ C×1000.0 ≈ C_rel
Δlog N · 73%
Δlog D · 27%

컴퓨트 ‘지출 비율’이 아님 — C가 커질 때 log 스케일에서 N·D가 자라는 비중(지수).

막대: 상대 N(진한)·D(연한, 과장). 절대 FLOPs는 C≈6ND + 적합 상수. Chinchilla가 비율을 수정.

고정 C에서 N↔D 트레이드오프.

5. 아키텍처 독립성

아키텍처 독립성

파라미터 N을 고정하면 깊이·헤드를 바꿔도 손실이 거의 같습니다.

N = const · 도식 상대 손실

균형

같은 N에서 구조 변형 → 손실 차이 미미. ‘어떻게 배치’보다 ‘얼마나’.

같은 N이면 깊이·헤드를 바꿔도 손실이 거의 같음.

6. 샘플 효율

샘플 효율

고정 연산 C에서 전략을 비교합니다 (도식).

모델큰 N
스텝짧은 학습
C= const
유효 학습(도식)
92

같은 C에서 스텝당 정보↑ → Kaplan: 대체로 이쪽이 유리.

추론 비용·과소학습을 보면 Chinchilla가 반론 — 다음 시각화.

같은 C에서 큰 모델+적은 스텝 vs 작은 모델+많은 스텝.

7. 한계 · Chinchilla

Kaplan → Chinchilla

Kaplan은 ‘모델↑ 우선’. Chinchilla는 ~20 tok/param로 데이터도 같이.

D (tokens)1400B
D / N~20
해석균형
N
D

Hoffmann et al. 2022: 최적 ≈ 파라미터당 토큰 20. Gopher·GPT-3 등은 데이터가 부족했다는 수정.

도식 비율입니다. LLaMA 등은 Chinchilla-optimal에 가깝게 설계.

Kaplan vs Chinchilla(~20 tok/param) 비교.

유산

  • “크면 좋다” → 예측 가능한 스케일링
  • 소형 실험으로 대형 성능·클러스터 투자 계획
  • GPT-3 이후 PaLM·LLaMA·Claude 설계 언어
  • 배분은 Chinchilla가 수정: N∝D∝C^0.5, ~20 tok/param
IdeaRole
Power lawL falls as scale^α
N / D / CParams, tokens, FLOPs
C ≈ 6NDCompute–size–data link
Arch independenceN dominates depth/heads
Chinchilla~20 tokens per parameter

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. Kaplan 등의 핵심 발견은?

  2. 2. 폭·깊이 비율 같은 아키텍처 세부의 영향은?

  3. 3. 고정 연산 예산에 대한 Kaplan의 권고는?

  4. 4. 모델 크기와 샘플 효율의 관계는?

  5. 5. Chinchilla가 이 논문에서 수정한 지점은?