Foundations · Neural Computation 1997
Long Short-Term Memory
셀 상태와 게이트로 RNN 기울기 소실을 풀어 장거리 의존을 학습.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
긴 이야기를 들으며 메모장(셀 상태) 에 핵심만 적습니다. 필요 없어진 메모는 지우고(망각 게이트), 새 정보는 골라 적고(입력 게이트), 말할 때 필요한 부분만 꺼내 봅니다(출력 게이트).
무엇을 제안했나
- 셀 상태 — 정보가 거의 그대로 흐르는 “컨베이어 벨트”. 곱셈이 아니라 덧셈으로 갱신돼 기억이 오래 감.
- 3개의 게이트 — 무엇을 지우고, 넣고, 내보낼지 학습으로 조절.
그래서 무엇이 달라졌나
- 기본 RNN의 고질병인 기울기 소실이 완화돼 장거리 의존을 학습.
- 2010년대 번역·음성·시계열의 표준. Transformer 이후에도 엣지 기기·짧은 순차 태스크에 남아 있음.
더 공부할 가치가 있을까?
- 역사·맥락용 — 시퀀스 모델이 어떻게 발전했는지 이해하려면. 지금 새 연구의 주류는 Transformer입니다.
- 먼저 볼 것 — backprop의 “기울기가 왜 사라지나”를 알면 LSTM의 설계 의도가 바로 보입니다.
3. 배경: 기본 RNN의 한계
기본 RNN은 매 스텝 이전 은닉과 현재 입력을 합칩니다. 문제는 BPTT 곱셈 체인: 야코비안 |λ|<1이 반복되면 초반 기울기가 사라지고, |λ|>1이면 폭발합니다. 실무적으로 약 10~20 스텝 이상 장거리 의존 학습이 어렵습니다.
RNN 기울기 소실·폭발 vs LSTM
설명용: RNN |λ|^T — |λ|<1 소실, |λ|>1 폭발. LSTM 셀 경로 ≈f̄^T (보통 f̄≤1).
0.0390.3581.05그래프 y는 최대 ~8까지 자동 스케일(폭발 시 상한). 점선은 |∂|=1.
4. LSTM 아키텍처
핵심은 셀 상태 — 시퀀스를 따라 흐르는 컨베이어입니다. 게이트가 정보를 선택적으로 더하거나 제거하며, 기울기가 셀을 통해 비교적 직접 흐를 수 있습니다 (ResNet skip과 유사).
LSTM 게이트 파이프라인
σ 밸브는 0~1. 단계별 숫자와 바를 보고, 아래 로짓으로 열어 보세요.
0.770.450.460.750.690.44f = σ(W_f [h, x] + b_f)이전 셀에서 버릴 정보를 고릅니다. 0=완전 삭제, 1=완전 유지.
셀 상태 컨베이어 (⊙)
C_t = f⊙C_{t-1} + i⊙C̃_t — ⊙는 원소별 곱. 차원마다 다른 기억을 남기거나 덮어씁니다.
0.900.50-0.400.950.900.850.850.45-0.340.02-0.040.050.880.41-0.290.560.27-0.170.90, 0.50, -0.400.88, 0.41, -0.290.56, 0.27, -0.17같은 타임스텝에서도 채널마다 다른 f,i를 쓸 수 있어 ‘선택적 장기 기억’이 됩니다.
5. 기울기 소실 방지 원리
셀 기울기 하이웨이: ∂C_t/∂C_{t-1} = f_t
셀 경로만: ∂C_t/∂C_{t-1}=f_t. (전체 BPTT에는 출력·입력 경로도 있음.) f≈1이면 여러 스텝에도 기울기가 남습니다.
0.36770.3677이게 LSTM이 장거리 의존을 배우는 핵심 메커니즘입니다.
6. LSTM 변형
LSTM 변형
무엇을 보고(게이트 입력), 무엇을 합치는지(상태)가 다릅니다.
[h, x]conveyoro⊙tanh(C)망각·입력·출력 3게이트 + 별도 셀 상태. 장기 기억의 기준선. · 시퀀스 표준 (2010s)
Peephole: 게이트가 도 직접 참조. BiLSTM: 순·역방향을 붙여 양방향 문맥 (BERT 이전 NLP 표준).
7. 실험·활용
- 번역 (Seq2Seq): Sutskever et al. 2014 — LSTM 인코더–디코더, WMT En–Fr 34.8 BLEU; 어텐션과 결합 시 대폭 향상 (Bahdanau 2015)
- 음성: WaveNet 이전 표준; Google 2015 ASR에 CTC + LSTM
8. 트랜스포머와의 비교
LSTM vs Transformer
순차 상태 vs 전역 어텐션. 행을 눌러 트레이드오프를 보세요.
LSTM: 불가 (순차) · Transformer: 가능
| Aspect | LSTM | Transformer |
|---|---|---|
| Parallelism | Sequential | Yes |
| Long-range | Gates (partial) | Attention (direct) |
| Memory | O(n) | O(n²) |
| Train speed | Slower | Faster |
| Inference | Fast (state) | KV cache |
9. 현재 활용
- 엣지 디바이스 경량 시계열
- 음악 생성·필기 인식 등 순차성 강한 태스크
- Mamba 등 선형 어텐션 대안의 영감
| Concept | Idea |
|---|---|
| Cell C_t | Long-term conveyor |
| Forget f_t | What to drop from past (0–1) |
| Input i_t | What new to write (0–1) |
| Output o_t | What to expose as h (0–1) |
| Grad highway | f≈1 → grads flow across time |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. 기본 RNN이 긴 시퀀스에서 겪는 핵심 문제는?
2. LSTM 셀 상태(cell state)의 역할은?
3. 망각 게이트(forget gate)가 하는 일은?
4. LSTM이 기울기 소실을 완화하는 원리는?
5. Transformer 대비 LSTM의 근본적 한계는?