Concepts
셀프 어텐션
같은 시퀀스 안의 모든 위치가 서로를 참조해 표현을 갱신하는 연산.
멀티헤드여러 어텐션 헤드를 병렬로 수행한 뒤 결합해 다양한 관계를 포착한다.
잔차 연결서브레이어 입력을 출력에 더해 기울기 흐름과 항등 경로를 보장한다.
포지셔널 인코딩순서 정보를 임베딩에 주입하는 방법. Transformer는 사인/코사인을 사용한다.
크로스 어텐션디코더가 인코더 출력을 Key/Value로 참조하는 어텐션.
저하 문제네트워크가 깊어질수록 훈련 오류까지 커지는 역설적 현상. 단순 과적합과 다르다.
스킵 연결입력을 몇 레이어 건너뛰어 출력에 직접 더하는 경로.
병목 블록1×1로 채널을 줄였다가 3×3 후 다시 복원해 연산량을 줄이는 ResNet 블록.
프로젝션 숏컷입·출력 차원이 다를 때 Skip에 두는 1×1 Conv.
적응형 학습률파라미터(좌표)마다 서로 다른 유효 학습률을 쓰는 방식. Adam은 √v̂로 조절한다.
편향 보정m,v를 0으로 시작해 생기는 초반 편향을 1−βᵗ로 나누어 보정하는 절차.
1차 모멘트 m기울기의 지수 이동 평균. 모멘텀처럼 ‘어느 방향으로 가고 있었는지’를 기억한다.
2차 모멘트 v기울기 제곱의 EMA. 해당 좌표 기울기가 얼마나 요동치는지(스케일)를 본다.
AdamW가중치 감쇠를 적응형 스텝과 분리해 θ에 직접 적용하는 Adam 변형. LLM 학습 표준.
내부 공변량 변화학습 중 앞 층이 바뀌면서 뒤 층 입력 분포가 계속 변하는 현상.
배치 정규화미니배치 평균·분산으로 활성화를 정규화한 뒤 γ·β로 스케일·이동하는 층.
γ, β 파라미터BN 정규화 후 표현력을 복원하는 학습 가능 스케일(γ)·이동(β).
Running Statistics훈련 중 배치 통계를 EMA로 누적한 값. 추론 시 배치 독립적으로 사용.
레이어 정규화샘플(토큰) 단위로 특징 차원을 정규화. 배치 크기에 덜 의존 → Transformer 표준.