Paper Understanding
Papers
Concepts
Formulas
KO
EN
igpt_rm_loss
보상 모델 손실
L
(
ϕ
)
=
−
E
(
x
,
y
w
,
y
l
)
∼
D
[
log
σ
(
r
ϕ
(
x
,
y
w
)
−
r
ϕ
(
x
,
y
l
)
)
]
L(\phi)=-\mathbb{E}_{(x,y_w,y_l)\sim D}\big[\log\sigma(r_\phi(x,y_w)-r_\phi(x,y_l))\big]
L
(
ϕ
)
=
−
E
(
x
,
y
w
,
y
l
)
∼
D
[
lo
g
σ
(
r
ϕ
(
x
,
y
w
)
−
r
ϕ
(
x
,
y
l
))
]
보상 모델 손실
수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
y
w
y_w
y
w
y
l
y_l
y
l
r
ϕ
r_\phi
r
ϕ
단계별 설명
1
쌍 선호도에서 winner 점수가 loser보다 높도록 학습.
관련 논문
instructgpt
constitutional-ai