Foundations · Neural Computation 1997

Long Short-Term Memory

셀 상태와 게이트로 RNN 기울기 소실을 풀어 장거리 의존을 학습.

Sepp Hochreiter, Jürgen Schmidhuber · Technische Universität München

lstmrnnsequencegates

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

긴 이야기를 들으며 메모장(셀 상태) 에 핵심만 적습니다. 필요 없어진 메모는 지우고(망각 게이트), 새 정보는 골라 적고(입력 게이트), 말할 때 필요한 부분만 꺼내 봅니다(출력 게이트).

무엇을 제안했나

  • 셀 상태 — 정보가 거의 그대로 흐르는 “컨베이어 벨트”. 곱셈이 아니라 덧셈으로 갱신돼 기억이 오래 감.
  • 3개의 게이트 — 무엇을 지우고, 넣고, 내보낼지 학습으로 조절.

그래서 무엇이 달라졌나

  • 기본 RNN의 고질병인 기울기 소실이 완화돼 장거리 의존을 학습.
  • 2010년대 번역·음성·시계열의 표준. Transformer 이후에도 엣지 기기·짧은 순차 태스크에 남아 있음.

더 공부할 가치가 있을까?

  • 역사·맥락용 — 시퀀스 모델이 어떻게 발전했는지 이해하려면. 지금 새 연구의 주류는 Transformer입니다.
  • 먼저 볼 것 — backprop의 “기울기가 왜 사라지나”를 알면 LSTM의 설계 의도가 바로 보입니다.

3. 배경: 기본 RNN의 한계

기본 RNN은 매 스텝 이전 은닉과 현재 입력을 합칩니다. 문제는 BPTT 곱셈 체인: 야코비안 |λ|<1이 반복되면 초반 기울기가 사라지고, |λ|>1이면 폭발합니다. 실무적으로 약 10~20 스텝 이상 장거리 의존 학습이 어렵습니다.

ht=tanh⁡(Whht−1+Wxxt+b)h_t = \tanh(W_h h_{t-1} + W_x x_t + b)
기본 RNN 재귀
기본 RNN 재귀수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명
∂L∂h0=∂L∂hT∏t=1T∂ht∂ht−1\frac{\partial L}{\partial h_0} = \frac{\partial L}{\partial h_T} \prod_{t=1}^{T} \frac{\partial h_t}{\partial h_{t-1}}
기울기 소실/폭발의 근원 — 곱셈 체인
RNN 기울기 곱셈 체인수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

RNN 기울기 소실·폭발 vs LSTM

설명용: RNN |λ|^T — |λ|<1 소실, |λ|>1 폭발. LSTM 셀 경로 ≈f̄^T (보통 f̄≤1).

1|∂|0t →
RNN |λ|^tLSTM f̄^t
RNN @T0.039
LSTM @T0.358
y max1.05
RNN 소실: |λ|<1 → 기울기 ≈0 → 장거리 학습 불가

그래프 y는 최대 ~8까지 자동 스케일(폭발 시 상한). 점선은 |∂|=1.

설명용: |λ|<1 소실, |λ|>1 폭발. 점선은 |∂|=1. f̄≈1이면 LSTM 쪽이 남습니다.

4. LSTM 아키텍처

핵심은 셀 상태 CtC_t — 시퀀스를 따라 흐르는 컨베이어입니다. 게이트가 정보를 선택적으로 더하거나 제거하며, 기울기가 셀을 통해 비교적 직접 흐를 수 있습니다 (ResNet skip과 유사).

LSTM 게이트 파이프라인

σ 밸브는 0~1. 단계별 숫자와 바를 보고, 아래 로짓으로 열어 보세요.

f = σ0.77
i = σ0.45
C̃ = tanh0.46
C_t0.75
o = σ0.69
h_t0.44
f→
i→
C̃→
C→
o→
h
1. 망각 게이트 ff = σ(W_f [h, x] + b_f)

이전 셀에서 버릴 정보를 고릅니다. 0=완전 삭제, 1=완전 유지.

단계마다 σ/tanh 숫자 밸브 — 로짓 슬라이더로 열어 보세요.
ft=σ(Wf⋅[ht−1,xt]+bf)f_t = \sigma(W_f \cdot [h_{t-1}, x_t] + b_f)
망각 게이트 — 과거를 얼마나 남길지
망각 게이트수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명
it=σ(Wi⋅[ht−1,xt]+bi),C~t=tanh⁡(WC⋅[ht−1,xt]+bC)i_t = \sigma(W_i \cdot [h_{t-1}, x_t] + b_i),\quad \tilde{C}_t = \tanh(W_C \cdot [h_{t-1}, x_t] + b_C)
입력 게이트 · 후보 셀
입력 게이트 · 후보 셀수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명
Ct=ft⊙Ct−1+it⊙C~tC_t = f_t \odot C_{t-1} + i_t \odot \tilde{C}_t
셀 업데이트 — 남기기 + 쓰기
셀 상태 업데이트수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명
ot=σ(Wo⋅[ht−1,xt]+bo),ht=ot⊙tanh⁡(Ct)o_t = \sigma(W_o \cdot [h_{t-1}, x_t] + b_o),\quad h_t = o_t \odot \tanh(C_t)
출력 게이트 — 셀에서 h로 노출
출력 게이트수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

셀 상태 컨베이어 (⊙)

C_t = f⊙C_{t-1} + i⊙C̃_t — ⊙는 원소별 곱. 차원마다 다른 기억을 남기거나 덮어씁니다.

C(t-1)
0.90
0.50
-0.40
f
0.95
0.90
0.85
f⊙C
0.85
0.45
-0.34
i⊙C̃
0.02
-0.04
0.05
C_t
0.88
0.41
-0.29
h_t
0.56
0.27
-0.17
C(t-1)0.90, 0.50, -0.40
C_t0.88, 0.41, -0.29
h_t0.56, 0.27, -0.17
기억 유지: f≈1, i≈0 → C_t ≈ C(t-1)

같은 타임스텝에서도 채널마다 다른 f,i를 쓸 수 있어 ‘선택적 장기 기억’이 됩니다.

3차원 ⊙ 데모. 기억 유지 / 리셋 / 덮어쓰기 프리셋 → dim별 게이트.

5. 기울기 소실 방지 원리

∂Ct∂Ct−1=ft\frac{\partial C_t}{\partial C_{t-1}} = f_t
셀 경로의 국소 기울기 = 망각 게이트
셀 기울기 하이웨이수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

셀 기울기 하이웨이: ∂C_t/∂C_{t-1} = f_t

셀 경로만: ∂C_t/∂C_{t-1}=f_t. (전체 BPTT에는 출력·입력 경로도 있음.) f≈1이면 여러 스텝에도 기울기가 남습니다.

∏ f = f^k0.3677
∂L/∂C(T-k)0.3677
f가 작거나 스텝이 많으면 하이웨이도 약해집니다

이게 LSTM이 장거리 의존을 배우는 핵심 메커니즘입니다.

셀 고속도로만 (∂C/∂C_prev=f). f≈1이면 ∏f가 크게 남습니다.

6. LSTM 변형

LSTM 변형

무엇을 보고(게이트 입력), 무엇을 합치는지(상태)가 다릅니다.

gates[h, x]
C cellconveyor
h outo⊙tanh(C)
LSTM · f, i, o · C & h

망각·입력·출력 3게이트 + 별도 셀 상태. 장기 기억의 기준선. · 시퀀스 표준 (2010s)

Peephole / GRU / BiLSTM — 게이트 입력과 상태 구조가 다릅니다.
ht=(1−zt)⊙ht−1+zt⊙tanh⁡(W[rt⊙ht−1,xt])h_t = (1-z_t)\odot h_{t-1} + z_t\odot\tanh(W[r_t\odot h_{t-1}, x_t])
GRU — 업데이트·리셋으로 간소화
GRU 은닉 업데이트수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

Peephole: 게이트가 Ct−1C_{t-1}도 직접 참조. BiLSTM: 순·역방향을 붙여 양방향 문맥 (BERT 이전 NLP 표준).

7. 실험·활용

  • 번역 (Seq2Seq): Sutskever et al. 2014 — LSTM 인코더–디코더, WMT En–Fr 34.8 BLEU; 어텐션과 결합 시 대폭 향상 (Bahdanau 2015)
  • 음성: WaveNet 이전 표준; Google 2015 ASR에 CTC + LSTM

8. 트랜스포머와의 비교

LSTM vs Transformer

순차 상태 vs 전역 어텐션. 행을 눌러 트레이드오프를 보세요.

병렬 처리

LSTM: 불가 (순차) · Transformer: 가능

병렬성·장거리·메모리·학습/추론 트레이드오프.
AspectLSTMTransformer
ParallelismSequentialYes
Long-rangeGates (partial)Attention (direct)
MemoryO(n)O(n²)
Train speedSlowerFaster
InferenceFast (state)KV cache

9. 현재 활용

  • 엣지 디바이스 경량 시계열
  • 음악 생성·필기 인식 등 순차성 강한 태스크
  • Mamba 등 선형 어텐션 대안의 영감
ConceptIdea
Cell C_tLong-term conveyor
Forget f_tWhat to drop from past (0–1)
Input i_tWhat new to write (0–1)
Output o_tWhat to expose as h (0–1)
Grad highwayf≈1 → grads flow across time
핵심 개념 한눈에.

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. 기본 RNN이 긴 시퀀스에서 겪는 핵심 문제는?

  2. 2. LSTM 셀 상태(cell state)의 역할은?

  3. 3. 망각 게이트(forget gate)가 하는 일은?

  4. 4. LSTM이 기울기 소실을 완화하는 원리는?

  5. 5. Transformer 대비 LSTM의 근본적 한계는?