Foundations · Nature 1986

Learning Representations by Back-Propagating Errors

연쇄 법칙으로 다층망 기울기를 O(W)에 — 오늘날 Autograd의 수학적 근간.

David E. Rumelhart, Geoffrey E. Hinton, Ronald J. Williams · UC / Carnegie Mellon

backpropautogradchain-ruleneural-nets

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

시험을 망쳤을 때, 어느 공부 습관이 몇 점씩 깎아먹었는지 뒤에서부터 되짚어 책임을 배분합니다. 신경망도 출력의 오차를 마지막 층에서 첫 층 쪽으로 거꾸로 흘려보내며, 각 가중치가 오차에 얼마나 기여했는지 계산합니다.

무엇을 제안했나

  • 연쇄 법칙의 체계적 적용 — 합성함수의 미분을 층마다 이어 붙여 계산.
  • forward에서 값 저장 → backward에서 재사용 — 그래서 전체 비용이 “가중치 수에 비례(O(W))”로 끝남.

그래서 무엇이 달라졌나

  • 다층 신경망을 실제로 학습시킬 수 있게 됨(1986년).
  • 오늘날 PyTorch·JAX·TensorFlow의 autograd가 바로 이 알고리즘.

더 공부할 가치가 있을까?

  • 근본 필수 — 딥러닝을 한다면 반드시 한 번은 손으로 유도해 봐야 합니다. 기울기 폭발/소실, 그래디언트 체크 등 실전 문제의 뿌리입니다.

3. 배경: 다층망 학습의 난제

Minsky & Papert(1969)는 단층 퍼셉트론이 XOR을 풀 수 없음을 보였습니다. 다층망이 필요하지만, 은닉 가중치를 어떻게 고칠지 방법이 없었습니다.

핵심 질문: 출력 오차가 내부 가중치에 얼마나 기인하는가? (신용 할당)

신용 할당 · 복잡도

“은닉 가중치가 오차에 얼마나 기여했는가?” — 수치미분은 W번, 역전파는 한 번에.

Naive
~1,001 fwd
Backprop
~2 passes
순진한 수치 미분 · 가중치마다 순전파 ≈ W+1회

각 wᵢ에 ε을 더해 손실을 다시 계산. W가 크면 불가능에 가깝습니다.

막대는 log 스케일. 이 W에서 수치미분 ≈ 역전파의 501× (설명용·순전파 횟수 기준).

수치미분 ≈ W+1 순전파 vs 역전파 2패스 (log 스케일).

4. 순전파

표기: zl=Wlal−1+blz_l = W_l a_{l-1} + b_l, al=σ(zl)a_l = \sigma(z_l), 예측 y^=aL\hat{y}=a_L, 손실 L(y^,y)L(\hat{y}, y).

zl=Wlal−1+bl,al=σ(zl),L=ℓ(y^,y)z_l = W_l a_{l-1} + b_l,\quad a_l = \sigma(z_l),\quad L = \ell(\hat{y}, y)
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

순전파 (Forward Pass)

2–2–1 미니넷. 샘플과 단계를 골라 값이 채워지는 흐름을 보세요.

x[0, 1]
→
hiddenz₁=[-0.30, 0.40]a₁=[0.43, 0.60]
→
outz₂=0.05ŷ=0.512y=1 · L=0.1190
1. 입력 a₀=x

입력을 은닉층으로 보냅니다.

2–2–1 미니넷 순전파 단계.

5. 역전파

출력에서 입력 방향으로 오차 신호 δ\delta를 흘립니다. 각 층의 기울기는 δ\delta와 이전 활성의 외적으로 나옵니다.

δL=∇aLL⊙σ′(zL)\delta_L = \nabla_{a_L} L \odot \sigma'(z_L)
출력층 오차 신호
출력층 오차 신호 δ_L수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명
δl=(Wl+1⊤δl+1)⊙σ′(zl)\delta_l = (W_{l+1}^{\top} \delta_{l+1}) \odot \sigma'(z_l)
은닉층으로 재귀
오차 신호 재귀수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명
∂L∂Wl=δlal−1⊤,∂L∂bl=δl\frac{\partial L}{\partial W_l} = \delta_l a_{l-1}^{\top},\quad \frac{\partial L}{\partial b_l} = \delta_l
가중치·편향 기울기수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

역전파 (Backward Pass)

출력 오차 신호 δ를 왼쪽으로 흘리며 각 가중치 기울기를 만듭니다.

δ₁ · ∂W₁δ₁=[-0.021, 0.015]∂W₁[0]=[0.000, -0.021]
←
hiddena₁=[0.43, 0.60]
←
δ₂ · ∂W₂δ₂=-0.122∂W₂=[-0.052, -0.073]ŷ=0.512 y=1 L=0.1190
1. ∂L/∂ŷ

MSE면 ∂L/∂ŷ = ŷ−y = -0.488

δ₂ → ∂W₂ → δ₁ → ∂W₁ 숫자로 확인.

6. 연쇄 법칙

역전파의 수학적 핵심은 합성함수 미분입니다. 중간 결과를 재사용하므로 전체 비용이 순전파와 같은 O(W) 차수가 됩니다.

∂L∂Wl=∂L∂aL∂aL∂aL−1⋯∂al∂Wl\frac{\partial L}{\partial W_l} = \frac{\partial L}{\partial a_L}\frac{\partial a_L}{\partial a_{L-1}}\cdots\frac{\partial a_l}{\partial W_l}
연쇄 법칙 전개수식 상세 →
단계별 설명

연쇄 법칙 곱셈

스칼라 예: L=½(σ(wx)−y)² → ∂L/∂w = (∂L/∂ŷ)·σ′(z)·x

∂L/∂ŷ0.723×
σ′(z)0.200×
∂z/∂w = x1.200=
∂L/∂w0.174
ŷ=0.723 · z=0.96 · L=0.2615 · ∂L/∂w=0.174

막대 높이는 |값| 공통 스케일. 인자 중 ~0이면(포화·작은 x) 기울기가 사라집니다.

스칼라 예: (∂L/∂ŷ)·σ′·x 곱이 ∂L/∂w.

7. 계산 그래프와 Autograd

현대 프레임워크는 연산을 그래프로 기록합니다. 노드=연산, 엣지=텐서. loss.backward()는 그래프를 역순회하며 국소 미분을 누적합니다.

계산 그래프 · Autograd

e = (a·b) + c. 순방향에 값을, 역방향에 국소 기울기를 쌓습니다.

a2.0b3.0c1.0× uu=6.0+ ee=7.0

순전파: u=a·b=6.0, e=u+c=7.0. 프레임워크가 이 그래프를 기록합니다.

e=(a·b)+c — 순방향 값 / 역방향 ∂e.

8. XOR과 표현 학습

논문의 대표 예: 2–2–1 망으로 XOR을 학습. 은닉층이 유의미한 중간 표현을 자동으로 만듭니다 — 표현 학습의 출발점.

InputTarget
(0, 0)0
(0, 1)1
(1, 0)1
(1, 1)0

XOR · 표현 학습

2–2–1 망이 XOR을 학습. 은닉 a₁ 평면에서 클래스가 분리되는지 보세요.

loss
학습 후 은닉 a₁a₁[0]a₁[1](0,0)(0,1)(1,0)(1,1)
y=1y=0
xyŷa₁
(0,0)00.23[0.12, 0.12]
(0,1)10.81[0.00, 0.79]
(1,0)10.81[0.79, 0.00]
(1,1)00.20[0.10, 0.10]
seed=0 · 최종 L=0.0207 · W₂=[4.75, 4.70]

단층은 XOR 불가. 은닉 a₁에서 y=0/1이 갈라지면 표현 학습이 된 것입니다. seed=0은 안정 초기화.

에폭·lr·초기화. 은닉 a₁ 산점도로 표현 학습 확인.

9. 한계와 의의

한계

  • 순전파 중간 활성 메모리 필요 (Gradient Checkpointing으로 완화)
  • 그래프를 역순으로만 처리

대안 연구

Forward-Forward (Hinton 2022), Equilibrium Propagation, PEPITA 등 — 아직 역전파가 표준입니다.

의의

은닉층 학습 가능성을 증명하고, 37년 넘게 딥러닝 학습의 사실상 유일한 표준으로 남았습니다.

IdeaRole
Chain ruleSplit composite derivatives into products
Error δLayer-wise gradient carrier
Computation graphBasis of Autograd
Representation learningHidden features learned automatically

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. 역전파가 근본적으로 푸는 문제는?

  2. 2. 역전파의 수학적 핵심은?

  3. 3. 순진한 수치 미분 대비 역전파의 비용은?

  4. 4. 역전파와 현대 Autograd(PyTorch/JAX)의 관계는?

  5. 5. XOR 예시가 보여주는 것은?