Paper Understanding
Papers
Concepts
Formulas
KO
EN
rlaif
RLAIF
RL from AI Feedback — 인간 무해성 라벨 대신 AI 비교로 선호 모델을 학습한 뒤 PPO. CAI의 RL 단계.
관련 수식
보상 모델 손실
PPO 목적 (KL 페널티)
CoT 선호도 클램프
관련 논문
constitutional-ai
instructgpt