LLM Evolution · NeurIPS 2020 2020
Language Models are Few-Shot Learners — GPT-3
175B · 인컨텍스트 러닝 — 가중치 업데이트 없이 few-shot으로 NLP 태스크.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
문제를 풀기 전에 프롬프트에 예시 두세 개를 보여주면, 모델을 다시 훈련하지 않고도 그 패턴을 따라 답합니다. 마치 시험지 맨 위 예제를 보고 나머지를 푸는 것처럼요.
무엇을 제안했나
- 1750억 파라미터 자기회귀 LM.
- In-Context Learning — 가중치를 건드리지 않고, 프롬프트 안 예시만으로 태스크 수행(zero/one/few-shot).
그래서 무엇이 달라졌나
- 파인튜닝 없이 프롬프트만으로 번역·QA·산수 등 다수 태스크 → “프롬프트 엔지니어링” 시대의 시작.
- 오늘날 LLM API의 사용 방식을 정의. ChatGPT의 직접 기반.
더 공부할 가치가 있을까?
- LLM을 쓰거나 만들면 필수 — few-shot 프롬프트 설계, 능력의 한계(추론·최신성)를 아는 데 직접 도움.
- 이어서 볼 것 — 정렬로 “쓸만하게” 만든 InstructGPT.
3. 스케일
GPT-2 1.5B → GPT-3 175B (~100×). Kaplan et al. 스케일링 법칙: 성능이 파라미터 수의 멱함수로 좋아지므로 극단까지 밀어붙임.
스케일 점프
대략 100×씩. 막대는 log 스케일 — 클릭하세요.
Few-shot 인컨텍스트 러닝.
Kaplan et al. (2020): 성능 ∝ 파라미터 멱함수 → 예측 가능한 스케일업.
4. 인컨텍스트 러닝
Zero-shot (설명만) · One-shot (예 1개) · Few-shot (예 여러 개). 어떤 경우에도 가중치는 변하지 않음 — 프롬프트가 태스크를 지정합니다.
인컨텍스트 러닝
프롬프트만 바꿉니다. 어떤 샷에서도 가중치는 업데이트되지 않습니다.
Translate English to French: sea otter => loutre de mer peppercorn => poivre cheese →
예제 여러 개 (여기 데모 K=2; SuperGLUE 등은 K≤32).
사전학습이 패턴 인식·형식 복사·태스크 추론을 암묵 학습 → 프롬프트만으로 전이.
5. 학습 데이터
필터링된 텍스트 ~570GB, 학습 토큰 300B. Common Crawl을 GPT-2식 품질 필터로 정제 + WebText2·Books·Wikipedia.
학습 데이터 믹스
토큰 수 ≠ 샘플링 비중. 막대 = 학습 시 가중치. 클릭하세요.
필터링된 웹 크롤 — 토큰은 많지만 샘플링 비중 60%.
표기 토큰 합 ≈ 499B. 비중 합 101%는 논문 Table 2.2 반올림. 고품질 소스를 더 자주 샘플.
6. 아키텍처 · 크기
기본은 Transformer 디코더 (GPT-2 Pre-LN 계열). Sparse attention(로컬 밀집 + 전역 교대). 컨텍스트 2048. 125M부터 175B까지 크기 패밀리.
모델 크기 패밀리
같은 디코더 뼈대, 깊이·폭만 키움. 막대는 log 스케일.
Sparse attention: 로컬 밀집 + 전역 교대. 컨텍스트 2048. 175B = 96층 · d=12288 · 96헤드.
7. 실험 결과
Few-shot 결과 · 스케일
벤치를 고르세요. 아래 막대는 실측이 아닌 스케일 경향 도식입니다.
SuperGLUE (few-shot, K=32) ↑
태스크당 K=32 예제·미세조정 없음. BERT-Large FT(69) 능가, 지도 SOTA 89.0과는 갭.
거의 모든 태스크에서 모델 크기와 성능이 로그-선형에 가깝게 증가.
8. 한계 · 유산
한계 · InstructGPT로
한계 카드를 고르고, 아래 RLHF 경로를 보세요.
확신 있게 틀린 정보를 생성할 수 있음.
“도움이 되지 않거나 해로운 출력” → RLHF → InstructGPT → ChatGPT.
유산
- API 서비스화 → 스타트업 생태계
- 프롬프트 엔지니어링 분야
- ChatGPT = GPT-3 계열 + RLHF
- PaLM · LLaMA 등 경쟁 대형 LM 촉발
| Idea | Role |
|---|---|
| In-context learning | Task via prompt examples, no weight update |
| Few-shot | K examples in the prompt (K ≤ tens) |
| Zero-shot | Instruction only |
| Scaling law | Predictable gains with scale |
| Hallucination | Confident but wrong generations |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. GPT-3의 주된 기여는?
2. GPT-3의 규모는?
3. few-shot과 fine-tuning의 차이는?
4. GPT-3의 학습 규모 배분(당시 관점)은?
5. GPT-3의 알려진 한계는?