LLM Evolution · NeurIPS 2020 2020

Language Models are Few-Shot Learners — GPT-3

175B · 인컨텍스트 러닝 — 가중치 업데이트 없이 few-shot으로 NLP 태스크.

Tom B. Brown, et al. (31 authors) · OpenAI

gpt3few-shoticlscaling175b

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

문제를 풀기 전에 프롬프트에 예시 두세 개를 보여주면, 모델을 다시 훈련하지 않고도 그 패턴을 따라 답합니다. 마치 시험지 맨 위 예제를 보고 나머지를 푸는 것처럼요.

무엇을 제안했나

  • 1750억 파라미터 자기회귀 LM.
  • In-Context Learning — 가중치를 건드리지 않고, 프롬프트 안 예시만으로 태스크 수행(zero/one/few-shot).

그래서 무엇이 달라졌나

  • 파인튜닝 없이 프롬프트만으로 번역·QA·산수 등 다수 태스크 → “프롬프트 엔지니어링” 시대의 시작.
  • 오늘날 LLM API의 사용 방식을 정의. ChatGPT의 직접 기반.

더 공부할 가치가 있을까?

  • LLM을 쓰거나 만들면 필수 — few-shot 프롬프트 설계, 능력의 한계(추론·최신성)를 아는 데 직접 도움.
  • 이어서 볼 것 — 정렬로 “쓸만하게” 만든 InstructGPT.

3. 스케일

GPT-2 1.5B → GPT-3 175B (~100×). Kaplan et al. 스케일링 법칙: 성능이 파라미터 수의 멱함수로 좋아지므로 극단까지 밀어붙임.

performance∝log⁡(#params)\text{performance} \propto \log(\text{\#params})
많은 태스크에서 관측된 로그-선형 경향 (개념 요약)
스케일 로그-선형 경향수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

스케일 점프

대략 100×씩. 막대는 log 스케일 — 클릭하세요.

GPT-3 · 2020 · ~570GB · 300B tok

Few-shot 인컨텍스트 러닝.

Kaplan et al. (2020): 성능 ∝ 파라미터 멱함수 → 예측 가능한 스케일업.

GPT-1 → 2 → 3 파라미터·데이터 점프.

4. 인컨텍스트 러닝

Zero-shot (설명만) · One-shot (예 1개) · Few-shot (예 여러 개). 어떤 경우에도 가중치는 변하지 않음 — 프롬프트가 태스크를 지정합니다.

인컨텍스트 러닝

프롬프트만 바꿉니다. 어떤 샷에서도 가중치는 업데이트되지 않습니다.

K = 2θ 고정 (no grad)
prompt
Translate English to French:
sea otter => loutre de mer
peppercorn => poivre
cheese →
Few-shot

예제 여러 개 (여기 데모 K=2; SuperGLUE 등은 K≤32).

사전학습이 패턴 인식·형식 복사·태스크 추론을 암묵 학습 → 프롬프트만으로 전이.

샷 수를 바꿔 프롬프트 형식을 보세요.

5. 학습 데이터

필터링된 텍스트 ~570GB, 학습 토큰 300B. Common Crawl을 GPT-2식 품질 필터로 정제 + WebText2·Books·Wikipedia.

학습 데이터 믹스

토큰 수 ≠ 샘플링 비중. 막대 = 학습 시 가중치. 클릭하세요.

토큰410B
비중60%
학습 토큰300B
Common Crawl

필터링된 웹 크롤 — 토큰은 많지만 샘플링 비중 60%.

표기 토큰 합 ≈ 499B. 비중 합 101%는 논문 Table 2.2 반올림. 고품질 소스를 더 자주 샘플.

데이터셋 비중을 클릭해 보세요.

6. 아키텍처 · 크기

기본은 Transformer 디코더 (GPT-2 Pre-LN 계열). Sparse attention(로컬 밀집 + 전역 교대). 컨텍스트 2048. 125M부터 175B까지 크기 패밀리.

모델 크기 패밀리

같은 디코더 뼈대, 깊이·폭만 키움. 막대는 log 스케일.

Layers96
d_model12288
Heads96
d_head128
GPT-3 175B · 175B

Sparse attention: 로컬 밀집 + 전역 교대. 컨텍스트 2048. 175B = 96층 · d=12288 · 96헤드.

Small → 175B. 막대를 클릭하세요.

7. 실험 결과

Few-shot 결과 · 스케일

벤치를 고르세요. 아래 막대는 실측이 아닌 스케일 경향 도식입니다.

SuperGLUE (few-shot, K=32) ↑

BERT-Large (FT)
69
GPT-3 few-shot
71.8
지도 SOTA (FT)
89
스케일 ↑ → 성능 ↑ (도식 · 실측 아님)
125M
1.3B
13B
175B

태스크당 K=32 예제·미세조정 없음. BERT-Large FT(69) 능가, 지도 SOTA 89.0과는 갭.

거의 모든 태스크에서 모델 크기와 성능이 로그-선형에 가깝게 증가.

SuperGLUE · 번역 · 산술 + 스케일 곡선.

8. 한계 · 유산

한계 · InstructGPT로

한계 카드를 고르고, 아래 RLHF 경로를 보세요.

환각

확신 있게 틀린 정보를 생성할 수 있음.

GPT-3→
RLHF→
InstructGPT→
ChatGPT

“도움이 되지 않거나 해로운 출력” → RLHF → InstructGPT → ChatGPT.

한계 카드와 InstructGPT(RLHF)로의 길.

유산

  • API 서비스화 → 스타트업 생태계
  • 프롬프트 엔지니어링 분야
  • ChatGPT = GPT-3 계열 + RLHF
  • PaLM · LLaMA 등 경쟁 대형 LM 촉발
IdeaRole
In-context learningTask via prompt examples, no weight update
Few-shotK examples in the prompt (K ≤ tens)
Zero-shotInstruction only
Scaling lawPredictable gains with scale
HallucinationConfident but wrong generations

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. GPT-3의 주된 기여는?

  2. 2. GPT-3의 규모는?

  3. 3. few-shot과 fine-tuning의 차이는?

  4. 4. GPT-3의 학습 규모 배분(당시 관점)은?

  5. 5. GPT-3의 알려진 한계는?