LLM Evolution · NeurIPS 2022 2022
Training Compute-Optimal Large Language Models — Chinchilla
N과 D를 동등 스케일 — 70B가 280B Gopher를 이김. ~20 tok/param.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
요리에 재료(모델 크기)만 잔뜩 넣고 끓이는 시간(데이터)은 부족했던 게 그때까지의 거대 모델이었습니다. 같은 예산이면 재료와 시간을 균형 있게 — 그러면 더 작은데 더 맛있습니다. 실제로 70B가 280B를 이깁니다.
무엇을 제안했나
- 고정 연산(FLOPs)에서 모델 크기
N과 데이터D를 함께(둘 다 약C^0.5로) 키우는 게 최적. - 경험칙: 파라미터당 약 20 토큰.
그래서 무엇이 달라졌나
- Kaplan 스케일링 이후 모델들이 데이터 부족(undertrained) 이었다는 재발견.
- 70B Chinchilla 가 280B Gopher 를 능가 → 이후 LLaMA 등 “작게, 오래 학습” 흐름.
더 공부할 가치가 있을까?
- LLM 학습 레시피에 관심이 있다면 필수 — 예산 대비 성능을 정하는 가장 실용적인 규칙.
- 먼저 볼 것 — Scaling Laws(이 논문이 그걸 수정합니다).
3. 문제 · Kaplan 재해석
Kaplan은 고정 예산에서 N↑을 강조 → Gopher(280B/300B tok), GPT-3(175B/300B tok). 하지만 많은 비교가 같은 토큰(≈300B)에 묶여 큰 모델만 과소학습된 채로 비교됐습니다.
과소학습 문제
Kaplan 시대 거대 모델은 토큰≈300B에 묶인 경우가 많음. 모델을 고르세요.
목표 20× 대비 데이터가 ~19× 부족(개념). 같은 300B 토큰으로 큰 N만 키우면 비교가 왜곡됩니다.
세 가지 독립 추정
- 고정 연산량에서 N 스윕 → 최적 N
- IsoFLOP 곡선
- 손실의 멱함수 피팅
세 방법 모두 N∝D∝C^0.5로 수렴.
4. Chinchilla 법칙
동등 스케일 · 20× 규칙
법칙과 모델 크기를 고르면 권장 토큰이 바뀝니다.
C↑ 때 log N / log D 성장 지수 비중 (지출 비율 아님).
세 IsoFLOP·피팅 방법이 같은 결론: N과 D를 같이. GPT-3(300B tok)는 175B에 대해 ~3.5T가 이상적.
IsoFLOP 곡선
같은 FLOPs(C≈6ND)에서 N↑면 D↓. 손실은 균형 근처에서 최소(도식).
논문: 고정 C에서 N을 스윕·IsoFLOP·멱함수 피팅 — 세 방법 모두 N∝D∝C^0.5.
5. Chinchilla 70B
Chinchilla 70B 결과
MMLU와 스펙을 전환해 보세요.
MMLU ↑ (5-shot)
노트 표의 Massive multi-task·MMLU 수치는 같은 MMLU 계열. 크기는 ~1/4인데 점수↑ (1.4T vs Gopher 300B tok).
6. MassiveText
MassiveText 믹스
토큰 양만이 아니라 품질·다양성. 소스를 클릭하세요.
가장 큰 비중 — 필터링된 웹 문서.
한계: 법칙은 토큰 수 중심 — 필터된 고품질 데이터가 같은 ‘양’의 웹보다 효율적일 수 있음.
7. Overtraining · 유산
Overtraining · 추론 비용
학습 최적 ≠ 서빙 최적. 모드와 크기를 바꿔 보세요.
Chinchilla: D≈20N. 학습 FLOPs당 손실 최소.
예: LLaMA-7B ≈1T (~140×), 13B ≈1T, 65B ≈1.4T. Overtrain 모드는 ~140× 도식.
LLaMA · 이후
- LLaMA-7B ≈1T tok (최적~140B보다 많음), 13B ≈1T, 65B ≈1.4T
- LLaMA-13B가 GPT-3(175B)를 많은 벤치에서 능가 (노트)
- Mistral · Phi도 overtraining 계열
한계
- 법칙은 학습 FLOPs만 최적화 — 서비스에서는 추론 비용이 더 클 수 있음
- 토큰 품질은 세지 않음 (필터된 고품질 데이터가 같은 ‘양’의 웹보다 효율적일 수 있음)
유산
- “더 큰 모델” → 더 많은(좋은) 데이터
- 학습 최적 ≠ 서빙 최적
| Idea | Role |
|---|---|
| Equal scaling | N∝C^0.5 · D∝C^0.5 |
| ~20 tok/param | Practical Chinchilla rule |
| IsoFLOP | N–D mixes at fixed FLOPs |
| Overtraining | Extra tokens · cheaper serving |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. Chinchilla의 핵심 주장은?
2. Chinchilla가 제시한 대략적 경험칙은?
3. Chinchilla(70B)와 Gopher(280B) 비교 결과는?
4. Chinchilla의 결과가 GPT-3에 주는 함의는?
5. 추론 비용을 고려한 'overtraining' 관점은?