LLM Evolution · NeurIPS 2022 2022
Training Language Models to Follow Instructions with Human Feedback — InstructGPT
RLHF로 GPT-3를 정렬 — 1.3B InstructGPT가 175B GPT-3보다 선호됨.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
똑똑하지만 제멋대로인 신입이 있습니다. 사람이 “이 답이 저 답보다 낫다”를 반복해서 알려 주고, 그 취향을 학습한 채점기를 만들어 신입을 강화학습으로 코칭하면 훨씬 쓸만해집니다. 놀랍게도 작게 코칭한 신입이 덩치만 큰 무코칭 모델보다 낫습니다.
무엇을 제안했나
- RLHF 3단계 — (1) 사람이 쓴 모범 답변으로 지도학습, (2) 사람의 선호 비교로 보상 모델 학습, (3) 그 보상으로 PPO 강화학습.
그래서 무엇이 달라졌나
- 1.3B InstructGPT 가 175B GPT-3 보다 사람 평가에서 선호됨 — 크기보다 정렬이 체감 품질을 좌우.
- ChatGPT의 직접 토대.
더 공부할 가치가 있을까?
- 필수 — LLM을 대화형으로 다루거나 정렬·안전에 관심이 있다면.
- 비교해 볼 것 — 사람 라벨을 크게 줄인 Constitutional AI.
3. 정렬 문제 · 3H
다음 토큰 예측은 웹 텍스트를 모방하도록 학습하지, “도움이 되는 어시스턴트”가 되도록 학습하지 않습니다. 목표: Helpful · Harmless · Honest.
정렬 문제 · 3H
다음 토큰 예측 ≠ 좋은 어시스턴트. 모드와 3H를 전환해 보세요.
사용자: 화성 여행 팁 알려줘
화성 여행 팁 알려줘 화성 여행 팁 알려줘… (웹 텍스트 패턴 완성)
- 지시 무시 · 완성만
- 해로운 내용 가능
- 자신 있게 틀린 말
사용자 의도에 맞게 실제로 도움이 되는 답.
4. RLHF 파이프라인
RLHF 3단계
가중치는 여기서부터 업데이트됩니다 (GPT-3 few-shot과 대비).
라벨러가 쓴 이상적 답으로 GPT-3를 미세조정 → 지시 따르기 기본기.
최종 정책 = InstructGPT. API 실사용 프롬프트 + 라벨러 데모로 학습.
보상 모델 · 순위
↑↓로 순위를 바꾸면 쌍 비교가 갱신됩니다. 논문: 9개 답 → 36 쌍.
프롬프트: 화성 여행 팁 알려줘
화성 여행은 아직 불가합니다. 대신 미션 시뮬레이션 팁…
r≈1.8우주복 입고 로켓 타세요! (세부 없음)
r≈0.6화성 여행 팁 알려줘 화성 여행…
r≈-0.6a≻bΔr = 1.2a≻cΔr = 2.4b≻cΔr = 1.2
손실: −log σ(r(y_w)−r(y_l)). 선호 답이 더 높은 점수를 받도록 학습.
PPO · KL 페널티
β가 작을수록 보상만 쫓아 SFT에서 멀어지고 보상 해킹 위험이 커집니다.
보상과 안정성 사이 타협 — 실무에서 튜닝하는 구간.
objective = E[r] − β KL(πθ ‖ π_SFT). 도식 수치이며 논문 β와 1:1 대응은 아닙니다.
5. 데이터
- SFT: ~13K (프롬프트, 이상 답변)
- RM: ~33K 프롬프트 · 프롬프트당 9개 답변 → 쌍 비교
- PPO: ~31K 프롬프트 (보상 신호만)
6. 실험 결과
인간 평가 · 안전 · 정직
선호도(직접·few-shot)·독성·TruthfulQA. 비교 대상을 구분하세요.
InstructGPT 1.3B ≻ GPT-3 175B
이 head-to-head의 정확한 %는 본문에 없음. 자주 인용되는 71%는 아래 ‘vs few-shot’ 비교입니다.
7. 정렬세 · ChatGPT
정렬세 · PTX · ChatGPT
RLHF 후 일부 NLP 벤치가 떨어질 수 있음 → PTX(사전학습 손실)로 완화.
L_total = L_PPO + γ L_pretrain. ChatGPT = GPT-3.5 + 같은 RLHF · 대화 데이터↑.
도식 수치입니다. 정렬세 원인은 라벨러 선호 편향 등.
유산: ChatGPT의 직접 기반. 같은 해 Anthropic Constitutional AI는 무해성 인간 라벨을 헌법 + RLAIF로 대체. 이후 LLaVA가 같은 지시-튜닝 아이디어를 비전으로 확장합니다.
| Idea | Role |
|---|---|
| RLHF | Align LM with human preference via RL |
| SFT | Supervised fine-tune on ideal demos |
| Reward model | Scalar score from preference pairs |
| KL penalty | Stay near SFT — curb reward hacking |
| Alignment tax | Some bench drops after RLHF |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. InstructGPT가 지적하는 '정렬(alignment) 문제'란?
2. RLHF 파이프라인의 3단계는?
3. 보상 모델(reward model)이 학습하는 것은?
4. InstructGPT의 대표적 결과는?
5. '정렬세(alignment tax)'란?