Paper Understanding
Papers
Concepts
Formulas
KO
EN
igpt_ppo_obj
PPO 목적 (KL 페널티)
E
[
r
ϕ
(
x
,
y
)
]
−
β
D
K
L
[
π
θ
(
y
∣
x
)
∥
π
S
F
T
(
y
∣
x
)
]
\mathbb{E}[r_\phi(x,y)]-\beta\,D_{KL}\big[\pi_\theta(y|x)\,\|\,\pi_{SFT}(y|x)\big]
E
[
r
ϕ
(
x
,
y
)]
−
β
D
K
L
[
π
θ
(
y
∣
x
)
∥
π
S
F
T
(
y
∣
x
)
]
PPO 목적 (KL 페널티)
수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
π
θ
\pi_\theta
π
θ
β
\beta
β
단계별 설명
1
보상 최대화와 SFT 근접성 균형. β가 너무 작으면 보상 해킹.
관련 논문
instructgpt
constitutional-ai