Concepts

셀프 어텐션
같은 시퀀스 안의 모든 위치가 서로를 참조해 표현을 갱신하는 연산.
멀티헤드
여러 어텐션 헤드를 병렬로 수행한 뒤 결합해 다양한 관계를 포착한다.
잔차 연결
서브레이어 입력을 출력에 더해 기울기 흐름과 항등 경로를 보장한다.
포지셔널 인코딩
순서 정보를 임베딩에 주입하는 방법. Transformer는 사인/코사인을 사용한다.
크로스 어텐션
디코더가 인코더 출력을 Key/Value로 참조하는 어텐션.
저하 문제
네트워크가 깊어질수록 훈련 오류까지 커지는 역설적 현상. 단순 과적합과 다르다.
스킵 연결
입력을 몇 레이어 건너뛰어 출력에 직접 더하는 경로.
병목 블록
1×1로 채널을 줄였다가 3×3 후 다시 복원해 연산량을 줄이는 ResNet 블록.
프로젝션 숏컷
입·출력 차원이 다를 때 Skip에 두는 1×1 Conv.
적응형 학습률
파라미터(좌표)마다 서로 다른 유효 학습률을 쓰는 방식. Adam은 √v̂로 조절한다.
편향 보정
m,v를 0으로 시작해 생기는 초반 편향을 1−βᵗ로 나누어 보정하는 절차.
1차 모멘트 m
기울기의 지수 이동 평균. 모멘텀처럼 ‘어느 방향으로 가고 있었는지’를 기억한다.
2차 모멘트 v
기울기 제곱의 EMA. 해당 좌표 기울기가 얼마나 요동치는지(스케일)를 본다.
AdamW
가중치 감쇠를 적응형 스텝과 분리해 θ에 직접 적용하는 Adam 변형. LLM 학습 표준.
내부 공변량 변화
학습 중 앞 층이 바뀌면서 뒤 층 입력 분포가 계속 변하는 현상.
배치 정규화
미니배치 평균·분산으로 활성화를 정규화한 뒤 γ·β로 스케일·이동하는 층.
γ, β 파라미터
BN 정규화 후 표현력을 복원하는 학습 가능 스케일(γ)·이동(β).
Running Statistics
훈련 중 배치 통계를 EMA로 누적한 값. 추론 시 배치 독립적으로 사용.
레이어 정규화
샘플(토큰) 단위로 특징 차원을 정규화. 배치 크기에 덜 의존 → Transformer 표준.