LLM Evolution · NeurIPS 2022 2022

Training Compute-Optimal Large Language Models — Chinchilla

N과 D를 동등 스케일 — 70B가 280B Gopher를 이김. ~20 tok/param.

Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, Elena Buchatskaya, et al. · DeepMind

chinchillacompute-optimalscalingisoflopllama

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

요리에 재료(모델 크기)만 잔뜩 넣고 끓이는 시간(데이터)은 부족했던 게 그때까지의 거대 모델이었습니다. 같은 예산이면 재료와 시간을 균형 있게 — 그러면 더 작은데 더 맛있습니다. 실제로 70B가 280B를 이깁니다.

무엇을 제안했나

  • 고정 연산(FLOPs)에서 모델 크기 N 과 데이터 D 를 함께(둘 다 약 C^0.5 로) 키우는 게 최적.
  • 경험칙: 파라미터당 약 20 토큰.

그래서 무엇이 달라졌나

  • Kaplan 스케일링 이후 모델들이 데이터 부족(undertrained) 이었다는 재발견.
  • 70B Chinchilla 가 280B Gopher 를 능가 → 이후 LLaMA 등 “작게, 오래 학습” 흐름.

더 공부할 가치가 있을까?

  • LLM 학습 레시피에 관심이 있다면 필수 — 예산 대비 성능을 정하는 가장 실용적인 규칙.
  • 먼저 볼 것 — Scaling Laws(이 논문이 그걸 수정합니다).

3. 문제 · Kaplan 재해석

Kaplan은 고정 예산에서 N↑을 강조 → Gopher(280B/300B tok), GPT-3(175B/300B tok). 하지만 많은 비교가 같은 토큰(≈300B)에 묶여 큰 모델만 과소학습된 채로 비교됐습니다.

과소학습 문제

Kaplan 시대 거대 모델은 토큰≈300B에 묶인 경우가 많음. 모델을 고르세요.

N280B
D300B
D / N~1.1
20×
Gopher · D/N ≈ 1.1

목표 20× 대비 데이터가 ~19× 부족(개념). 같은 300B 토큰으로 큰 N만 키우면 비교가 왜곡됩니다.

≈300B 토큰에 묶인 거대 모델 vs Chinchilla(~20×).

세 가지 독립 추정

  • 고정 연산량에서 N 스윕 → 최적 N
  • IsoFLOP 곡선
  • 손실의 멱함수 피팅

세 방법 모두 N∝D∝C^0.5로 수렴.

4. Chinchilla 법칙

Nopt∝C0.50,Dopt∝C0.50N_{\mathrm{opt}}\propto C^{0.50},\quad D_{\mathrm{opt}}\propto C^{0.50}
파라미터와 데이터를 동등하게 (vs Kaplan 0.73 / 0.27)
Chinchilla 동등 스케일수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명
Dopt≈20 ND_{\mathrm{opt}} \approx 20\, N
실용 규칙: ~20 토큰 / 파라미터
Chinchilla 규칙 (~20 tok/param)수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

동등 스케일 · 20× 규칙

법칙과 모델 크기를 고르면 권장 토큰이 바뀝니다.

N70B
D_opt ≈ 20N1.4T
D / N~20
N · 50%
D · 50%

C↑ 때 log N / log D 성장 지수 비중 (지출 비율 아님).

세 IsoFLOP·피팅 방법이 같은 결론: N과 D를 같이. GPT-3(300B tok)는 175B에 대해 ~3.5T가 이상적.

크기→최적 토큰 · Kaplan vs Chinchilla 배분.

IsoFLOP 곡선

같은 FLOPs(C≈6ND)에서 N↑면 D↓. 손실은 균형 근처에서 최소(도식).

작은 N · 많은 D큰 N · 적은 D
L_rel ≈ 1.00 · 최적 근처

논문: 고정 C에서 N을 스윕·IsoFLOP·멱함수 피팅 — 세 방법 모두 N∝D∝C^0.5.

IsoFLOP: 같은 C에서 N↔D 트레이드오프.

5. Chinchilla 70B

Chinchilla 70B 결과

MMLU와 스펙을 전환해 보세요.

MMLU ↑ (5-shot)

GPT-3 175B
43.9%
Gopher 280B
60%
Chinchilla 70B
67.5%

노트 표의 Massive multi-task·MMLU 수치는 같은 MMLU 계열. 크기는 ~1/4인데 점수↑ (1.4T vs Gopher 300B tok).

70B · 1.4T vs Gopher · GPT-3.

6. MassiveText

MassiveText 믹스

토큰 양만이 아니라 품질·다양성. 소스를 클릭하세요.

영어 웹

가장 큰 비중 — 필터링된 웹 문서.

한계: 법칙은 토큰 수 중심 — 필터된 고품질 데이터가 같은 ‘양’의 웹보다 효율적일 수 있음.

양만이 아니라 품질·다양성.

7. Overtraining · 유산

Overtraining · 추론 비용

학습 최적 ≠ 서빙 최적. 모드와 크기를 바꿔 보세요.

D / N~20
D140B
서빙보통
Kaplan→
Chinchilla→
Overtrain→
LLaMA+

Chinchilla: D≈20N. 학습 FLOPs당 손실 최소.

예: LLaMA-7B ≈1T (~140×), 13B ≈1T, 65B ≈1.4T. Overtrain 모드는 ~140× 도식.

추론 비용 → 소형+과학습 · LLaMA 경로.

LLaMA · 이후

  • LLaMA-7B ≈1T tok (최적~140B보다 많음), 13B ≈1T, 65B ≈1.4T
  • LLaMA-13B가 GPT-3(175B)를 많은 벤치에서 능가 (노트)
  • Mistral · Phi도 overtraining 계열

한계

  • 법칙은 학습 FLOPs만 최적화 — 서비스에서는 추론 비용이 더 클 수 있음
  • 토큰 품질은 세지 않음 (필터된 고품질 데이터가 같은 ‘양’의 웹보다 효율적일 수 있음)

유산

  • “더 큰 모델” → 더 많은(좋은) 데이터
  • 학습 최적 ≠ 서빙 최적
IdeaRole
Equal scalingN∝C^0.5 · D∝C^0.5
~20 tok/paramPractical Chinchilla rule
IsoFLOPN–D mixes at fixed FLOPs
OvertrainingExtra tokens · cheaper serving

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. Chinchilla의 핵심 주장은?

  2. 2. Chinchilla가 제시한 대략적 경험칙은?

  3. 3. Chinchilla(70B)와 Gopher(280B) 비교 결과는?

  4. 4. Chinchilla의 결과가 GPT-3에 주는 함의는?

  5. 5. 추론 비용을 고려한 'overtraining' 관점은?