LLM Evolution · arXiv 2020
Scaling Laws for Neural Language Models
손실이 N·D·C의 멱함수로 예측 가능 — 대형 LM 설계의 지도 원리.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
작은 화분 몇 개로 식물의 성장 곡선을 재 보면, 큰 밭에서 얼마나 자랄지 꽤 정확히 예측할 수 있습니다. LM의 성능(손실)도 모델 크기·데이터·연산에 대해 매끈한 곡선(멱함수)을 그립니다.
무엇을 제안했나
- 멱함수 법칙 — 테스트 손실이 파라미터
N, 데이터D, 연산C각각에 대해 예측 가능하게 감소. - 연산 예산 배분 — 정해진 연산이 있을 때 모델을 얼마나 키우고 얼마나 학습할지 계산.
그래서 무엇이 달라졌나
- 큰 모델을 돌려 보기 전에 성능을 추정할 수 있게 됨 → GPT-3·GPT-4 규모 결정에 사용.
- “더 키우면 더 좋아진다”를 정량화.
더 공부할 가치가 있을까?
- LLM을 설계·계획한다면 필수 — 다만 배분 공식은 Chinchilla에서 수정됩니다. 둘을 반드시 함께 보세요.
3. 멱함수 관계
멱함수 손실
축을 고르고 스케일(10^k)을 키우면 테스트 손실 L이 부드럽게 떨어집니다.
α_N ≈ 0.076 · non-embedding N · 10× → L ≈ 0.84×
도식(상대 스케일). N은 non-embed. 실제 적합은 WebText2 실험 곡선.
N · D · C 지도
세 스케일 축과 스케일링의 성격을 클릭해 보세요.
non-embedding 가중치 수. 구조보다 ‘얼마나 많은가’가 지배적.
작은 실험으로 큰 모델 손실을 외삽.
4. 연산 예산 배분
연산 예산 배분
C↑ 때 Kaplan: N∝C^0.73, D∝C^0.27. (별도로 C≈6ND — non-embed N·토큰 D)
컴퓨트 ‘지출 비율’이 아님 — C가 커질 때 log 스케일에서 N·D가 자라는 비중(지수).
막대: 상대 N(진한)·D(연한, 과장). 절대 FLOPs는 C≈6ND + 적합 상수. Chinchilla가 비율을 수정.
5. 아키텍처 독립성
아키텍처 독립성
파라미터 N을 고정하면 깊이·헤드를 바꿔도 손실이 거의 같습니다.
N = const · 도식 상대 손실
같은 N에서 구조 변형 → 손실 차이 미미. ‘어떻게 배치’보다 ‘얼마나’.
6. 샘플 효율
샘플 효율
고정 연산 C에서 전략을 비교합니다 (도식).
같은 C에서 스텝당 정보↑ → Kaplan: 대체로 이쪽이 유리.
추론 비용·과소학습을 보면 Chinchilla가 반론 — 다음 시각화.
7. 한계 · Chinchilla
Kaplan → Chinchilla
Kaplan은 ‘모델↑ 우선’. Chinchilla는 ~20 tok/param로 데이터도 같이.
Hoffmann et al. 2022: 최적 ≈ 파라미터당 토큰 20. Gopher·GPT-3 등은 데이터가 부족했다는 수정.
도식 비율입니다. LLaMA 등은 Chinchilla-optimal에 가깝게 설계.
유산
- “크면 좋다” → 예측 가능한 스케일링
- 소형 실험으로 대형 성능·클러스터 투자 계획
- GPT-3 이후 PaLM·LLaMA·Claude 설계 언어
- 배분은 Chinchilla가 수정: N∝D∝C^0.5, ~20 tok/param
| Idea | Role |
|---|---|
| Power law | L falls as scale^α |
| N / D / C | Params, tokens, FLOPs |
| C ≈ 6ND | Compute–size–data link |
| Arch independence | N dominates depth/heads |
| Chinchilla | ~20 tokens per parameter |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. Kaplan 등의 핵심 발견은?
2. 폭·깊이 비율 같은 아키텍처 세부의 영향은?
3. 고정 연산 예산에 대한 Kaplan의 권고는?
4. 모델 크기와 샘플 효율의 관계는?
5. Chinchilla가 이 논문에서 수정한 지점은?