Foundations · Nature 1986
Learning Representations by Back-Propagating Errors
연쇄 법칙으로 다층망 기울기를 O(W)에 — 오늘날 Autograd의 수학적 근간.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
시험을 망쳤을 때, 어느 공부 습관이 몇 점씩 깎아먹었는지 뒤에서부터 되짚어 책임을 배분합니다. 신경망도 출력의 오차를 마지막 층에서 첫 층 쪽으로 거꾸로 흘려보내며, 각 가중치가 오차에 얼마나 기여했는지 계산합니다.
무엇을 제안했나
- 연쇄 법칙의 체계적 적용 — 합성함수의 미분을 층마다 이어 붙여 계산.
- forward에서 값 저장 → backward에서 재사용 — 그래서 전체 비용이 “가중치 수에 비례(O(W))”로 끝남.
그래서 무엇이 달라졌나
- 다층 신경망을 실제로 학습시킬 수 있게 됨(1986년).
- 오늘날 PyTorch·JAX·TensorFlow의 autograd가 바로 이 알고리즘.
더 공부할 가치가 있을까?
- 근본 필수 — 딥러닝을 한다면 반드시 한 번은 손으로 유도해 봐야 합니다. 기울기 폭발/소실, 그래디언트 체크 등 실전 문제의 뿌리입니다.
3. 배경: 다층망 학습의 난제
Minsky & Papert(1969)는 단층 퍼셉트론이 XOR을 풀 수 없음을 보였습니다. 다층망이 필요하지만, 은닉 가중치를 어떻게 고칠지 방법이 없었습니다.
핵심 질문: 출력 오차가 내부 가중치에 얼마나 기인하는가? (신용 할당)
신용 할당 · 복잡도
“은닉 가중치가 오차에 얼마나 기여했는가?” — 수치미분은 W번, 역전파는 한 번에.
각 wᵢ에 ε을 더해 손실을 다시 계산. W가 크면 불가능에 가깝습니다.
막대는 log 스케일. 이 W에서 수치미분 ≈ 역전파의 501× (설명용·순전파 횟수 기준).
4. 순전파
표기: , , 예측 , 손실 .
순전파 (Forward Pass)
2–2–1 미니넷. 샘플과 단계를 골라 값이 채워지는 흐름을 보세요.
[0, 1]z₁=[-0.30, 0.40]a₁=[0.43, 0.60]z₂=0.05ŷ=0.512y=1 · L=0.1190입력을 은닉층으로 보냅니다.
5. 역전파
출력에서 입력 방향으로 오차 신호 를 흘립니다. 각 층의 기울기는 와 이전 활성의 외적으로 나옵니다.
역전파 (Backward Pass)
출력 오차 신호 δ를 왼쪽으로 흘리며 각 가중치 기울기를 만듭니다.
δ₁=[-0.021, 0.015]∂W₁[0]=[0.000, -0.021]a₁=[0.43, 0.60]δ₂=-0.122∂W₂=[-0.052, -0.073]ŷ=0.512 y=1 L=0.1190MSE면 ∂L/∂ŷ = ŷ−y = -0.488
6. 연쇄 법칙
역전파의 수학적 핵심은 합성함수 미분입니다. 중간 결과를 재사용하므로 전체 비용이 순전파와 같은 O(W) 차수가 됩니다.
연쇄 법칙 곱셈
스칼라 예: L=½(σ(wx)−y)² → ∂L/∂w = (∂L/∂ŷ)·σ′(z)·x
0.723×0.200×1.200=0.174막대 높이는 |값| 공통 스케일. 인자 중 ~0이면(포화·작은 x) 기울기가 사라집니다.
7. 계산 그래프와 Autograd
현대 프레임워크는 연산을 그래프로 기록합니다. 노드=연산, 엣지=텐서. loss.backward()는 그래프를 역순회하며 국소 미분을 누적합니다.
계산 그래프 · Autograd
e = (a·b) + c. 순방향에 값을, 역방향에 국소 기울기를 쌓습니다.
순전파: u=a·b=6.0, e=u+c=7.0. 프레임워크가 이 그래프를 기록합니다.
8. XOR과 표현 학습
논문의 대표 예: 2–2–1 망으로 XOR을 학습. 은닉층이 유의미한 중간 표현을 자동으로 만듭니다 — 표현 학습의 출발점.
| Input | Target |
|---|---|
| (0, 0) | 0 |
| (0, 1) | 1 |
| (1, 0) | 1 |
| (1, 1) | 0 |
XOR · 표현 학습
2–2–1 망이 XOR을 학습. 은닉 a₁ 평면에서 클래스가 분리되는지 보세요.
단층은 XOR 불가. 은닉 a₁에서 y=0/1이 갈라지면 표현 학습이 된 것입니다. seed=0은 안정 초기화.
9. 한계와 의의
한계
- 순전파 중간 활성 메모리 필요 (Gradient Checkpointing으로 완화)
- 그래프를 역순으로만 처리
대안 연구
Forward-Forward (Hinton 2022), Equilibrium Propagation, PEPITA 등 — 아직 역전파가 표준입니다.
의의
은닉층 학습 가능성을 증명하고, 37년 넘게 딥러닝 학습의 사실상 유일한 표준으로 남았습니다.
| Idea | Role |
|---|---|
| Chain rule | Split composite derivatives into products |
| Error δ | Layer-wise gradient carrier |
| Computation graph | Basis of Autograd |
| Representation learning | Hidden features learned automatically |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. 역전파가 근본적으로 푸는 문제는?
2. 역전파의 수학적 핵심은?
3. 순진한 수치 미분 대비 역전파의 비용은?
4. 역전파와 현대 Autograd(PyTorch/JAX)의 관계는?
5. XOR 예시가 보여주는 것은?