LLM Evolution · NeurIPS 2022 2022

Training Language Models to Follow Instructions with Human Feedback — InstructGPT

RLHF로 GPT-3를 정렬 — 1.3B InstructGPT가 175B GPT-3보다 선호됨.

Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, et al. · OpenAI

instructgptrlhfalignmentsftppo

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

똑똑하지만 제멋대로인 신입이 있습니다. 사람이 “이 답이 저 답보다 낫다”를 반복해서 알려 주고, 그 취향을 학습한 채점기를 만들어 신입을 강화학습으로 코칭하면 훨씬 쓸만해집니다. 놀랍게도 작게 코칭한 신입이 덩치만 큰 무코칭 모델보다 낫습니다.

무엇을 제안했나

  • RLHF 3단계 — (1) 사람이 쓴 모범 답변으로 지도학습, (2) 사람의 선호 비교로 보상 모델 학습, (3) 그 보상으로 PPO 강화학습.

그래서 무엇이 달라졌나

  • 1.3B InstructGPT 가 175B GPT-3 보다 사람 평가에서 선호됨 — 크기보다 정렬이 체감 품질을 좌우.
  • ChatGPT의 직접 토대.

더 공부할 가치가 있을까?

  • 필수 — LLM을 대화형으로 다루거나 정렬·안전에 관심이 있다면.
  • 비교해 볼 것 — 사람 라벨을 크게 줄인 Constitutional AI.

3. 정렬 문제 · 3H

다음 토큰 예측은 웹 텍스트를 모방하도록 학습하지, “도움이 되는 어시스턴트”가 되도록 학습하지 않습니다. 목표: Helpful · Harmless · Honest.

정렬 문제 · 3H

다음 토큰 예측 ≠ 좋은 어시스턴트. 모드와 3H를 전환해 보세요.

사용자: 화성 여행 팁 알려줘

화성 여행 팁 알려줘 화성 여행 팁 알려줘… (웹 텍스트 패턴 완성)

  • 지시 무시 · 완성만
  • 해로운 내용 가능
  • 자신 있게 틀린 말
Helpful

사용자 의도에 맞게 실제로 도움이 되는 답.

모방 LM vs 정렬된 어시스턴트 · 3H.

4. RLHF 파이프라인

RLHF 3단계

가중치는 여기서부터 업데이트됩니다 (GPT-3 few-shot과 대비).

~13K 이상 답변1. 지도 미세조정

라벨러가 쓴 이상적 답으로 GPT-3를 미세조정 → 지시 따르기 기본기.

최종 정책 = InstructGPT. API 실사용 프롬프트 + 라벨러 데모로 학습.

SFT → Reward Model → PPO. 단계를 클릭하세요.
L(ϕ)=−E[log⁡σ(rϕ(x,yw)−rϕ(x,yl))]L(\phi) = -\mathbb{E}[\log \sigma(r_\phi(x, y_w) - r_\phi(x, y_l))]
선호(y_w) > 비선호(y_l)이 되도록 RM 학습
보상 모델 손실수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

보상 모델 · 순위

↑↓로 순위를 바꾸면 쌍 비교가 갱신됩니다. 논문: 9개 답 → 36 쌍.

프롬프트: 화성 여행 팁 알려줘

#1

화성 여행은 아직 불가합니다. 대신 미션 시뮬레이션 팁…

r≈1.8
#2

우주복 입고 로켓 타세요! (세부 없음)

r≈0.6
#3

화성 여행 팁 알려줘 화성 여행…

r≈-0.6
쌍 비교 (3)
  • a ≻ b Δr = 1.2
  • a ≻ c Δr = 2.4
  • b ≻ c Δr = 1.2

손실: −log σ(r(y_w)−r(y_l)). 선호 답이 더 높은 점수를 받도록 학습.

같은 프롬프트에 대한 답변 순위 → 쌍 비교.
E[rϕ(x,y)]−β DKL[πθ ∥ πSFT]\mathbb{E}[r_\phi(x,y)] - \beta\, D_{KL}[\pi_\theta \,\|\, \pi_{SFT}]
보상 최대화 − KL 페널티 (보상 해킹 완화)
PPO 목적 (KL 페널티)수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

PPO · KL 페널티

β가 작을수록 보상만 쫓아 SFT에서 멀어지고 보상 해킹 위험이 커집니다.

보상 추구
95
SFT 이탈(KL)
81
보상 해킹 위험: 중간

보상과 안정성 사이 타협 — 실무에서 튜닝하는 구간.

objective = E[r] − β KL(πθ ‖ π_SFT). 도식 수치이며 논문 β와 1:1 대응은 아닙니다.

β(KL)를 조절해 보상 해킹 위험을 보세요.

5. 데이터

  • SFT: ~13K (프롬프트, 이상 답변)
  • RM: ~33K 프롬프트 · 프롬프트당 9개 답변 → (92)=36\binom{9}{2}=36 쌍 비교
  • PPO: ~31K 프롬프트 (보상 신호만)

6. 실험 결과

인간 평가 · 안전 · 정직

선호도(직접·few-shot)·독성·TruthfulQA. 비교 대상을 구분하세요.

InstructGPT 1.3B ≻ GPT-3 175B

100× 더 작은 정렬 모델이 미정렬 175B보다 선호됨 (논문 정성 결과).
InstructGPT 1.3B≻GPT-3 175B

이 head-to-head의 정확한 %는 본문에 없음. 자주 인용되는 71%는 아래 ‘vs few-shot’ 비교입니다.

선호도(1.3B 정성 · 85% · few-shot 71%) · 독성(respectful) · TruthfulQA.

7. 정렬세 · ChatGPT

Ltotal=LPPO+γ LpretrainL_{\mathrm{total}} = L_{\mathrm{PPO}} + \gamma\, L_{\mathrm{pretrain}}
PTX: 사전학습 손실을 섞어 정렬세 완화
PTX 혼합 손실수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

정렬세 · PTX · ChatGPT

RLHF 후 일부 NLP 벤치가 떨어질 수 있음 → PTX(사전학습 손실)로 완화.

정렬 이득
83
벤치 유지
75
GPT-3→
SFT→
RLHF→
InstructGPT→
ChatGPT

L_total = L_PPO + γ L_pretrain. ChatGPT = GPT-3.5 + 같은 RLHF · 대화 데이터↑.

도식 수치입니다. 정렬세 원인은 라벨러 선호 편향 등.

정렬세와 ChatGPT로의 경로.

유산: ChatGPT의 직접 기반. 같은 해 Anthropic Constitutional AI는 무해성 인간 라벨을 헌법 + RLAIF로 대체. 이후 LLaVA가 같은 지시-튜닝 아이디어를 비전으로 확장합니다.

IdeaRole
RLHFAlign LM with human preference via RL
SFTSupervised fine-tune on ideal demos
Reward modelScalar score from preference pairs
KL penaltyStay near SFT — curb reward hacking
Alignment taxSome bench drops after RLHF

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. InstructGPT가 지적하는 '정렬(alignment) 문제'란?

  2. 2. RLHF 파이프라인의 3단계는?

  3. 3. 보상 모델(reward model)이 학습하는 것은?

  4. 4. InstructGPT의 대표적 결과는?

  5. 5. '정렬세(alignment tax)'란?