LLM Evolution · OpenAI Technical Report 2019

Language Models are Unsupervised Multitask Learners — GPT-2

1.5B 자기회귀 LM — 미세조정 없이 제로샷 다중 태스크, 스케일의 힘을 보여준 전신.

Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever · OpenAI

gpt2lmzero-shotscalingwebtext

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

다음 단어 맞히기만 아주 크게 연습시켰더니, 시키지도 않은 번역·요약·질문답변을 그냥 하기 시작했습니다. “예시를 프롬프트에 몇 개 보여주면 따라 한다”는 걸 처음으로 크게 보여준 모델입니다.

무엇을 제안했나

  • 15억 파라미터 자기회귀 LM을 WebText(~40GB) 로 학습.
  • 태스크별 학습 없이 제로샷 으로 여러 태스크를 시도.

그래서 무엇이 달라졌나

  • “스케일이 곧 범용성”이라는 가설에 강한 증거 — 크기를 키우자 능력이 창발.
  • GPT-3·ChatGPT의 직접 전신. 공개 방식 논쟁(단계적 공개)도 화제가 됨.

더 공부할 가치가 있을까?

  • LLM 계보를 이해한다면 — Scaling Laws·GPT-3와 한 세트로 보면 좋습니다.
  • 바쁘면 GPT-3로 바로 넘어가도 됩니다 — 아이디어의 완성형이 거기 있습니다.

3. 배경 · 제로샷 가설

GPT-1(2018): ~1.17억, 다운스트림 미세조정이 기본.

GPT-2 가설: 언어 모델이 충분히 크면, 웹 텍스트에 섞인 번역·요약·QA 패턴을 암묵 학습해 자연어 프롬프트만으로 과제를 수행한다.

제로샷 다중 태스크

태스크 헤드·미세조정 없이, 자연어 프롬프트만으로 과제를 유도합니다.

prompt
영어: Hello, how are you?
불어:
번역

웹에 “English: … French: …” 패턴이 있어 암묵 학습.

GPT-1은 다운스트림 미세조정이 기본. GPT-2는 스케일로 제로샷을 밀었습니다 → GPT-3 ICL.

번역·QA·요약·이어쓰기 프롬프트를 전환해 보세요.

4. 아키텍처 · Causal LM

기본은 Transformer 디코더 (단방향 자기회귀). GPT-1 대비 변경: Pre-LN, 최종 블록 추가 LN, 잔차 1/√N 초기화, 컨텍스트 1024, BPE 어휘 50,257.

P(x)=∏t=1TP(xt∣x<t)P(x) = \prod_{t=1}^{T} P(x_t \mid x_{<t})
왼쪽 문맥으로 다음 토큰
자기회귀 언어 모델수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

자기회귀 · Causal Mask

왼쪽 문맥만 보고 다음 토큰을 예측합니다. 슬라이더로 문맥을 늘려 보세요.

Thecatsatonthemat
key (열)query (행)하삼각만 허용 · 강조 = 현재 query 행
P(· | “The”)
cat
42%
dog
28%
quick
18%
…
12%

BERT(양방향 MLM)와 달리 GPT는 디코더 LM — 생성·제로샷 프롬프트에 자연스럽습니다.

Causal mask + 토이 다음 토큰 분포.
Wres←Wres/NW_{\mathrm{res}} \leftarrow W_{\mathrm{res}} / \sqrt{N}
N = 레이어 수
잔차 스케일 초기화수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

GPT-2 Pre-LN 블록

서브레이어 입력 전에 LN. 잔차 경로가 깨끗해 깊은 디코더 학습이 안정적입니다.

xLNSublayer+깨끗한 스킵서브레이어 전 LN · 스택 끝엔 최종 LN 추가

GPT-2: Pre-LN + 최종 블록 추가 LN + 잔차 1/√N 초기화. 자세한 LN 비교는 LayerNorm 페이지.

Post-LN vs Pre-LN. 자세한 LN은 LayerNorm.

5. 모델 크기

모델 크기 · 스케일

같은 디코더 뼈대, 깊이·폭만 키움. XL=1.5B. 막대를 클릭하세요.

Layers48
Hidden1600
Heads25
Ctx1024
GPT-2 XL · 1.5B params

잔차 가중치 초기화는 1/√N 스케일 (N=레이어). 컨텍스트 1024, BPE 어휘 50,257.

Small → XL (117M → 1.5B).
VersionLayersHiddenHeadsParams
Small1276812117M
Medium24102416345M
Large36128020762M
XL481600251.5B

6. WebText

Reddit 아웃링크 중 karma ≥ 3인 페이지만 수집 → ~800만 문서, ~40GB. 위키·책 중심 큐레이션보다 도메인이 넓고 “읽을 가치” 필터가 있습니다.

WebText · Karma 필터

Reddit 아웃링크 중 karma ≥ 임계값만 수집 — “읽을 가치” 있는 웹 텍스트.

포함 (5)
  • 딥러닝 튜토리얼★420 · blog.example
  • 기후 보고서 요약★88 · news.site
  • 수학 해설 위키★15 · edu.wiki
  • 오픈소스 릴리즈 노트★56 · github.io
  • 빈 광고 랜딩★3 · ads.land
제외 (3)
  • 고양이 밈 모음★2 · junk.forum
  • 스팸 상품 페이지★0 · buy.now
  • 랜덤 클릭베이트★1 · buzz.click
결과 ~800만 페이지 · ~40GB (논문)

위키·책 중심 큐레이션 대신, 다양한 도메인의 고품질 웹 텍스트로 스케일.

karma 임계값을 움직여 포함/제외를 보세요.

7. 결과 · 공개 논쟁 · 유산

제로샷 결과 · 단계 공개

벤치마다 비교 대상이 다릅니다 (이전 SOTA / 비지도 MT / 지도 QA). 아래는 단계 공개.

WikiText-103 PPL ↓

이전 SOTA
18.3
GPT-2 XL
17.48
117M2019-02→
345M2019-05→
762M2019-08→
1.5B2019-11

제로샷 LM — 미세조정 없이 SOTA (논문 Table 3).

악용 우려로 단계 공개 → 오히려 유명세↑. 스케일 트렌드는 Scaling Law·GPT-3로 이어집니다.

WikiText·PTB·Fr→En·CoQA (논문 수치) + 단계 공개 타임라인.

유산

  • 스케일 → Scaling Law (Kaplan et al.) · GPT-3
  • 프롬프트 → In-Context Learning · 현대 프롬프트 엔지니어링
  • NLP 제로샷 → CLIP이 비전에도 같은 아이디어 적용
  • 악용 우려로 단계 공개 → AI 안전·거버넌스 논의의 출발점 중 하나
IdeaRole
Autoregressive LMNext-token from left context
Zero-shotTasks via natural-language prompts
WebTextKarma-filtered web crawl
Pre-LNStable deep decoder training
BPE50,257-token subword vocab

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. GPT-2의 핵심 가설은?

  2. 2. GPT-2의 아키텍처는?

  3. 3. GPT-2가 GPT-1에서 바꾼 정규화 관련 변경은?

  4. 4. GPT-2의 모델 크기 범위는?

  5. 5. GPT-2의 공개를 둘러싼 논쟁은?