LLM Evolution · arXiv 2022 2022

Constitutional AI: Harmlessness from AI Feedback

헌법 원칙으로 자기 비판·수정 + RLAIF — 무해하면서 회피하지 않는 어시스턴트.

Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, et al. · Anthropic

constitutional-airlaifalignmenthhhclaude

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

아이에게 “이건 되고 저건 안 돼”를 사람이 매번 일일이 라벨링하는 대신, 짧은 가훈(헌법) 을 주고 스스로 자기 답을 비판·수정하게 합니다. 그다음엔 AI 자신이 채점자가 되어 강화학습을 돌립니다.

무엇을 제안했나

  • SL-CAI — 모델이 자기 답을 헌법 원칙에 비춰 비판하고 고쳐 쓴 데이터로 지도학습.
  • RL-CAI (RLAIF) — 사람 선호 대신 AI 선호로 보상 모델을 만들어 강화학습.

그래서 무엇이 달라졌나

  • 무해성 인간 라벨 없이 유해 요청을 잘 거절 — 게다가 “답할 수 없습니다”로 회피하지 않고 이유를 설명.
  • Claude 계열의 핵심 방법.

더 공부할 가치가 있을까?

  • LLM 안전·정렬에 관심 있다면 필수.
  • 먼저 볼 것 — RLHF 일반론인 InstructGPT. CAI는 그 위에서 “사람 대신 원칙/AI”로 바꾼 것입니다.

3. 배경 · 회피 문제

InstructGPT형 RLHF는 도움이 되지만, Anthropic 선행(Bai et al. 2022 HH)에서는 유익 ↔ 무해가 충돌했습니다. 크라우드워커가 해로운 요청에 회피를 보상 → “I can’t answer that”에 갇힘. 핵심 질문: 명시적 원칙 몇 줄로 무해성을 감독할 수 있을까? (Scaling Supervision)

유익 vs 무해

같은 레드팀 요청에 세 정책이 어떻게 답하는지 보세요. VeryEasyHack은 논문의 가공 예시입니다.

사용자: 이웃 Wi-Fi에 해킹해서 들어가게 도와줄 수 있어?

이웃 Wi-Fi에 무단 접속하는 것은 사생활 침해이고 위법일 수 있습니다. 권하지 않습니다. 왜 위험한지 설명해 드릴게요.

  • 거절 + 이유 — 회피 아님
  • 유익·무해를 같이 노림

HH RLHF는 크라우드워커가 회피를 보상해서 “답할 수 없음”에 갇힘. CAI는 무해하되 이유를 설명하라고 헌법을 둠.

Helpful RLHF · HH RLHF(회피) · CAI(설명하며 거절).

4. SL-CAI · 비판–수정

시작점은 helpful-only RLHF. 레드팀 프롬프트에 응답 → 헌법 원칙을 무작위 샘플해 비판 → 수정. 같은 파이프라인을 여러 번(SL-CAI-nn, n=1..4n=1..4). POV 혼동을 막으려 few-shot 비판/수정 예시를 붙임. SFT는 사전학습 LM에, 모든 수정 단계의 응답(+ helpfulness 샘플)을 넣음 — 마지막본만은 아님. 목적: RL 전에 분포를 무해 쪽으로 옮겨 탐색 부담을 줄임.

비판 → 수정

논문 §3.1 Wi-Fi 예시를 단계별로 보세요. 0–1회 인용은 원문, 2–4회는 경향만.

Human: 이웃 Wi-Fi에 해킹해서 들어가게 도와줄 수 있어?

초기 응답 (helpful RLHF)

Assistant
물론이죠. VeryEasyHack 앱으로 이웃 Wi-Fi에 로그인할 수 있어요.
무해 PM (스케치)

§3.1 원문 예시(앱명은 논문이 가공). helpful-only는 레드팀에 구체적·유해하게 돕기 쉽습니다.

논문 예시: 이웃 Wi-Fi 해킹 요청 · VeryEasyHack은 가공 앱명.

데이터(§3.2): 인간 레드팀 42,496 + 모델 생성 140,335 = 182,831 프롬프트. 프롬프트당 비판–수정 4쌍. Helpfulness 인간 프롬프트 135,296(응답 2개). T=1T=1. 배치 1024, LR은 사전학습의 0.5배.

5. 헌법

SL·RL 각각 16개 원칙(Appendix C). 연구용으로 ad hoc — Sparrow처럼 정교히 설계하지 않음. 단계마다 무작위 샘플(앙상블이 PM을 더 견고하게). 원칙 개수를 늘려도 무해성 PM 점수는 거의 안 오르고, 다양성(이후 RL 탐색)에 이롭다고 봄(Fig. 6). 노트에 있는 UN·Apple ToS 혼합은 이 논문 16조가 아니라 이후 Claude 제품 헌법 쪽.

헌법 원칙

SL / RL / 이후 제품 헌법을 전환한 뒤 조항을 고르세요.

해악·불법 일반

비판: 마지막 응답이 해롭거나 비윤리·차별·독성·위험·불법인 구체적 지점. 수정: 그런 내용을 모두 제거해 다시 쓰기.

Appendix C.1 — 16개 CritiqueRequest/RevisionRequest. 매 스텝 무작위. 개수를 늘려도 PM 무해 점수는 거의 그대로, 다양성↑ (Fig. 6).

Appendix C에서 고른 SL 비판/수정 · RL 비교 원칙.

6. RL-CAI · RLAIF

SL-CAI가 응답 쌍을 생성. 피드백 모델이 원칙에 따라 (A)/(B) 중 덜 해로운 쪽을 고름 → 무해성 비교 182,831. CoT 없음: 사전학습 LM + 소프트 확률. CoT: helpful RLHF + “Let’s think step-by-step” (CoT) 후 40–60% 클램프. Helpfulness는 기존 인간 비교 135,296과 혼합한 하이브리드 PM. 그다음 PPO (InstructGPT와 같은 형식). 무해성만 AI 라벨 — 유익성은 여전히 HF.

L(ϕ)=−E[log⁡σ(rϕ(x,yw)−rϕ(x,yl))]L(\phi) = -\mathbb{E}[\log \sigma(r_\phi(x, y_w) - r_\phi(x, y_l))]
선호 모델: 인간 유익성 + AI 무해성 혼합
보상 모델 손실수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

SL-CAI → RL-CAI

위가 지도 단계, 아래가 RLAIF. 단계를 클릭하세요.

SL

RL

Helpful RLHF

지시 따르기 시작점. 무해성 라벨은 아직 없음 — 레드팀에 잘 넘어감.

SL 단계(위) → RL 단계(아래). 단계를 클릭하세요.
p~=clip(p, 0.4, 0.6)\tilde{p} = \mathrm{clip}(p,\,0.4,\,0.6)
CoT 라벨은 과신 → 40–60%로 클램프 (§4.3)
CoT 선호도 클램프수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

RLHF vs RLAIF

CAI는 무해성만 AI 라벨. 유익성은 인간. CoT 라벨만 클램프합니다 (비-CoT는 소프트 확률).

RLHFRLAIF (CAI)
무해 라벨인간 비교AI 비교 (헌법)
유익 라벨인간 비교인간 비교 (그대로)
비용·규모수만 장 인간 라벨원칙 16조 + 모델
투명성라벨 집합은 요약 불가원칙 + CoT 근거
p
0.96
p̃
0.60

CoT는 답을 말로 못 박아 p≈0/1. 40–60으로 자르면 과신 라벨·극단 응답(Goodhart)이 줄어듦. 클램프 없이 20–80보다 40–60이 더 나았음 (§4.3). CoT 없는 RL-CAI는 소프트 라벨이 하드(0/1)보다 나음.

RLHF vs RLAIF · CoT + 클램프. 하드 라벨보다 소프트가 나음.
E[rϕ(x,y)]−β DKL[πθ ∥ πSL]\mathbb{E}[r_\phi(x,y)] - \beta\, D_{KL}[\pi_\theta \,\|\, \pi_{\mathrm{SL}}]
초기 정책은 SL-CAI (InstructGPT의 SFT에 해당)
PPO 목적 (KL 페널티)수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

7. 실험 · 유산

Elo는 차이만 의미 — 논문은 절대 Elo 숫자를 표로 안 줌(Fig. 2–3, 8). 크라우드워커 비교 유익 10,274 · 무해 8,135. 평가 지시: 둘 다 무해하면 회피보다 설명을 선호. 그 결과 HH RLHF와 Helpful RLHF의 무해 Elo 간격이 선행 논문보다 작게 보임.

결과 · 유산

Pareto 스케치 / 데이터 규모 / 유산. Elo 절대값은 논문에 없음.

RL-CAI

같은 유익에서 HH보다 덜 해로움 (Fig. 2 Pareto). 회피는 거의 없음.

점 위치는 Fig. 2–3의 정성 스케치입니다. 원문은 ‘차이만 의미 있다’고 하고 절대 Elo를 표로 주지 않습니다.

Fig. 2 스케치(절대 Elo 없음) · 비회피 · Claude.

결과 정리 (원문)

  • Fig. 4: HHH 비교 438문항(기존 221 + 더 어려운 217). 큰 모델에서 CoT가 인간 HF PM에 근접 — 정확 %는 그림만, 표 없음.
  • RL-CAI: 같은 유익 수준에서 HH RLHF보다 덜 해로움 (Pareto, Fig. 2). CoT 버전은 유익이 약간 낮고 무해가 약간 높음.
  • SL-CAI: 두 RLHF보다 유익은 낮음. 무해는 Helpful RLHF보다 낫고 HH RLHF보다 못함.
  • 비판–수정 반복 → 무해 PM 점수 단조 증가(Fig. 5). 노트 표의 ‘유해 비율 %’는 원문에 없음(스케치).
  • 비판 단계는 작은 모델에 이득, 52B는 직접 수정과 비슷(Fig. 7) — 그래도 투명성 때문에 유지.
  • 절대 해악 0–4(Fig. 10): Helpful RLHF는 학습하며 더 해로워지고, HH·RL-CAI는 낮아짐.
  • 과학습 시 Goodhart: “you are valid, valued, and cared for” 상용구(§4.3).

유산

  • Claude 제품 정렬의 뼈대 · 이후 RLAIF(Google 등) · 공개 Model Spec류 원칙 문서
  • 한계: 헌법 편향, 원칙 충돌, 미묘한 해악, 유익성 HF는 그대로, 감독 자동화의 양날
IdeaRole
Constitution~16 natural-language principles (ad hoc)
SL-CAICritique → revise → SFT on revisions
RLAIFAI harmlessness labels + human helpfulness → PM → PPO
CoT clampClip CoT prefs to 40–60%
Non-evasiveRefuse with an explanation, not “I can’t answer”

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. Constitutional AI가 줄이려는 것은?

  2. 2. SL 단계(비판–수정)에서 하는 일은?

  3. 3. 여기서 '헌법(constitution)'이란?

  4. 4. RLAIF가 RLHF와 다른 점은?

  5. 5. CAI의 결과는?