LLM Evolution · OpenAI Technical Report 2019
Language Models are Unsupervised Multitask Learners — GPT-2
1.5B 자기회귀 LM — 미세조정 없이 제로샷 다중 태스크, 스케일의 힘을 보여준 전신.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
다음 단어 맞히기만 아주 크게 연습시켰더니, 시키지도 않은 번역·요약·질문답변을 그냥 하기 시작했습니다. “예시를 프롬프트에 몇 개 보여주면 따라 한다”는 걸 처음으로 크게 보여준 모델입니다.
무엇을 제안했나
- 15억 파라미터 자기회귀 LM을 WebText(~40GB) 로 학습.
- 태스크별 학습 없이 제로샷 으로 여러 태스크를 시도.
그래서 무엇이 달라졌나
- “스케일이 곧 범용성”이라는 가설에 강한 증거 — 크기를 키우자 능력이 창발.
- GPT-3·ChatGPT의 직접 전신. 공개 방식 논쟁(단계적 공개)도 화제가 됨.
더 공부할 가치가 있을까?
- LLM 계보를 이해한다면 — Scaling Laws·GPT-3와 한 세트로 보면 좋습니다.
- 바쁘면 GPT-3로 바로 넘어가도 됩니다 — 아이디어의 완성형이 거기 있습니다.
3. 배경 · 제로샷 가설
GPT-1(2018): ~1.17억, 다운스트림 미세조정이 기본.
GPT-2 가설: 언어 모델이 충분히 크면, 웹 텍스트에 섞인 번역·요약·QA 패턴을 암묵 학습해 자연어 프롬프트만으로 과제를 수행한다.
제로샷 다중 태스크
태스크 헤드·미세조정 없이, 자연어 프롬프트만으로 과제를 유도합니다.
영어: Hello, how are you? 불어:
웹에 “English: … French: …” 패턴이 있어 암묵 학습.
GPT-1은 다운스트림 미세조정이 기본. GPT-2는 스케일로 제로샷을 밀었습니다 → GPT-3 ICL.
4. 아키텍처 · Causal LM
기본은 Transformer 디코더 (단방향 자기회귀). GPT-1 대비 변경: Pre-LN, 최종 블록 추가 LN, 잔차 1/√N 초기화, 컨텍스트 1024, BPE 어휘 50,257.
자기회귀 · Causal Mask
왼쪽 문맥만 보고 다음 토큰을 예측합니다. 슬라이더로 문맥을 늘려 보세요.
catdogquick…BERT(양방향 MLM)와 달리 GPT는 디코더 LM — 생성·제로샷 프롬프트에 자연스럽습니다.
GPT-2 Pre-LN 블록
서브레이어 입력 전에 LN. 잔차 경로가 깨끗해 깊은 디코더 학습이 안정적입니다.
GPT-2: Pre-LN + 최종 블록 추가 LN + 잔차 1/√N 초기화. 자세한 LN 비교는 LayerNorm 페이지.
5. 모델 크기
모델 크기 · 스케일
같은 디코더 뼈대, 깊이·폭만 키움. XL=1.5B. 막대를 클릭하세요.
잔차 가중치 초기화는 1/√N 스케일 (N=레이어). 컨텍스트 1024, BPE 어휘 50,257.
| Version | Layers | Hidden | Heads | Params |
|---|---|---|---|---|
| Small | 12 | 768 | 12 | 117M |
| Medium | 24 | 1024 | 16 | 345M |
| Large | 36 | 1280 | 20 | 762M |
| XL | 48 | 1600 | 25 | 1.5B |
6. WebText
Reddit 아웃링크 중 karma ≥ 3인 페이지만 수집 → ~800만 문서, ~40GB. 위키·책 중심 큐레이션보다 도메인이 넓고 “읽을 가치” 필터가 있습니다.
WebText · Karma 필터
Reddit 아웃링크 중 karma ≥ 임계값만 수집 — “읽을 가치” 있는 웹 텍스트.
- 딥러닝 튜토리얼★420 · blog.example
- 기후 보고서 요약★88 · news.site
- 수학 해설 위키★15 · edu.wiki
- 오픈소스 릴리즈 노트★56 · github.io
- 빈 광고 랜딩★3 · ads.land
- 고양이 밈 모음★2 · junk.forum
- 스팸 상품 페이지★0 · buy.now
- 랜덤 클릭베이트★1 · buzz.click
위키·책 중심 큐레이션 대신, 다양한 도메인의 고품질 웹 텍스트로 스케일.
7. 결과 · 공개 논쟁 · 유산
제로샷 결과 · 단계 공개
벤치마다 비교 대상이 다릅니다 (이전 SOTA / 비지도 MT / 지도 QA). 아래는 단계 공개.
WikiText-103 PPL ↓
제로샷 LM — 미세조정 없이 SOTA (논문 Table 3).
악용 우려로 단계 공개 → 오히려 유명세↑. 스케일 트렌드는 Scaling Law·GPT-3로 이어집니다.
유산
- 스케일 → Scaling Law (Kaplan et al.) · GPT-3
- 프롬프트 → In-Context Learning · 현대 프롬프트 엔지니어링
- NLP 제로샷 → CLIP이 비전에도 같은 아이디어 적용
- 악용 우려로 단계 공개 → AI 안전·거버넌스 논의의 출발점 중 하나
| Idea | Role |
|---|---|
| Autoregressive LM | Next-token from left context |
| Zero-shot | Tasks via natural-language prompts |
| WebText | Karma-filtered web crawl |
| Pre-LN | Stable deep decoder training |
| BPE | 50,257-token subword vocab |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. GPT-2의 핵심 가설은?
2. GPT-2의 아키텍처는?
3. GPT-2가 GPT-1에서 바꾼 정규화 관련 변경은?
4. GPT-2의 모델 크기 범위는?
5. GPT-2의 공개를 둘러싼 논쟁은?