Paper Understanding
Papers
Concepts
Formulas
KO
EN
rlhf
RLHF
인간 선호도 피드백으로 보상 모델을 만들고, 그 보상을 최대화하도록 정책을 강화학습하는 정렬 파이프라인.
관련 수식
보상 모델 손실
PPO 목적 (KL 페널티)
관련 논문
instructgpt
gpt3
constitutional-ai