Concepts

셀프 어텐션
같은 시퀀스 안의 모든 위치가 서로를 참조해 표현을 갱신하는 연산.
멀티헤드
여러 어텐션 헤드를 병렬로 수행한 뒤 결합해 다양한 관계를 포착한다.
잔차 연결
서브레이어 입력을 출력에 더해 기울기 흐름과 항등 경로를 보장한다.
포지셔널 인코딩
순서 정보를 임베딩에 주입하는 방법. 원 Transformer는 사인/코사인, ViT는 학습 1D 임베딩.
크로스 어텐션
디코더가 인코더 출력을 Key/Value로 참조하는 어텐션.
저하 문제
네트워크가 깊어질수록 훈련 오류까지 커지는 역설적 현상. 단순 과적합과 다르다.
스킵 연결
입력을 몇 레이어 건너뛰어 출력에 직접 더하는 경로.
병목 블록
1×1로 채널을 줄였다가 3×3 후 다시 복원해 연산량을 줄이는 ResNet 블록.
프로젝션 숏컷
입·출력 차원이 다를 때 Skip에 두는 1×1 Conv.
적응형 학습률
파라미터(좌표)마다 서로 다른 유효 학습률을 쓰는 방식. Adam은 √v̂로 조절한다.
편향 보정
m,v를 0으로 시작해 생기는 초반 편향을 1−βᵗ로 나누어 보정하는 절차.
1차 모멘트 m
기울기의 지수 이동 평균. 모멘텀처럼 ‘어느 방향으로 가고 있었는지’를 기억한다.
2차 모멘트 v
기울기 제곱의 EMA. 해당 좌표 기울기가 얼마나 요동치는지(스케일)를 본다.
AdamW
가중치 감쇠를 적응형 스텝과 분리해 θ에 직접 적용하는 Adam 변형. LLM 학습 표준.
내부 공변량 변화
학습 중 앞 층이 바뀌면서 뒤 층 입력 분포가 계속 변하는 현상.
배치 정규화
미니배치 평균·분산으로 활성화를 정규화한 뒤 γ·β로 스케일·이동하는 층.
γ, β 파라미터
BN 정규화 후 표현력을 복원하는 학습 가능 스케일(γ)·이동(β).
Running Statistics
훈련 중 배치 통계를 EMA로 누적한 값. 추론 시 배치 독립적으로 사용.
레이어 정규화
샘플(토큰) 단위로 특징 차원을 정규화. 배치 크기에 독립 → Transformer/RNN 표준.
Pre-LN
서브레이어 입력 전에 LN. 잔차 경로가 깨끗해 훈련이 안정적. 현대 LLM 표준.
Post-LN
잔차 합 뒤에 LN. 원본 Transformer 배치.
RMSNorm
평균 제거 없이 RMS만으로 스케일. 계산 절감, LLaMA 계열 표준.
SwiGLU
Swish 게이트가 달린 FFN 활성화. ReLU 대비 성능↑, LLaMA가 채택.
RoPE
쿼리/키에 회전을 곱해 상대 위치를 인코딩. 현대 오픈 LLM 표준.
오픈 가중치
모델 가중치를 연구/커뮤니티에 공개해 파인튜닝·로컬 배포·내부 탐구를 가능하게 함.
드롭아웃
훈련 스텝마다 뉴런을 확률적으로 꺼 과적합을 줄이는 정규화. 추론 시에는 전체 네트워크를 쓴다.
공동 적응
특정 뉴런이 다른 뉴런의 실수를 항상 보정하며 서로 의존하는 관계. 일반화를 해친다.
Inverted Dropout
훈련 시 1/p_keep으로 스케일해, 추론에서 별도 스케일링이 필요 없게 한 구현.
암묵적 앙상블
드롭아웃이 2ⁿ개 서브네트워크를 암묵 학습하고, 추론은 그 앙상블에 근사.
MC Dropout
추론에서도 드롭아웃을 켜고 여러 번 샘플링해 예측 불확실성을 추정하는 기법.
기울기 소실
역전파 곱셈 체인에서 |λ|<1이 반복되면 초반 타임스텝 기울기가 사라지는 현상.
셀 상태
시퀀스를 따라 흐르는 LSTM의 장기 기억 ‘컨베이어’. 게이트가 선택적으로 더하거나 비운다.
망각 게이트
이전 셀 상태 C_{t-1}을 얼마나 남길지(0~1) 결정. f≈1이면 기울기 하이웨이.
입력 게이트
후보 셀 \tilde{C}_t 중 얼마나 셀에 쓸지 결정.
출력 게이트
tanh(C_t) 중 얼마나 은닉 h_t로 내보낼지 결정.
GRU
업데이트·리셋 게이트 2개로 LSTM을 간소화. 셀/은닉을 합침.
분포 가설
같은 문맥에 나타나는 단어는 의미가 비슷하다 (Firth).
Skip-Gram
중심 단어로 주변 문맥 단어를 예측하는 Word2Vec 아키텍처.
CBOW
주변 문맥으로 중심 단어를 예측. 빠르고 고빈도 단어에 유리.
Negative Sampling
전체 소프트맥스 대신 진짜 1개 + 랜덤 k개만 구별해 학습을 가속.
단어 임베딩
단어를 조밀한 실수 벡터로 표현. 의미 유사도가 거리/내적으로 나타남.
단어 유추
벡터 산술로 A:B ≈ C:D 관계를 근사 (왕−남자+여자≈여왕).
ReLU
f(x)=max(0,x). 양의 구간 기울기 1로 포화·exp를 피한 활성화. AlexNet 이후 표준.
로컬 반응 정규화 (LRN)
인접 채널 활성 에너지로 각 채널을 나눠 측면 억제. AlexNet 기법, 이후 BN이 대체.
최대 풀링
윈도우 최댓값으로 특징맵을 다운샘플. 공간 불변성과 강한 반응 보존.
데이터 증강
크롭·플립·색 변환 등으로 학습 샘플을 늘려 과적합을 줄이는 기법.
듀얼 GPU 학습
커널을 두 GPU에 나눠 올리고 일부 레이어만 교차 통신하는 병렬 학습.
오차 역전파
연쇄 법칙으로 다층망 모든 가중치의 손실 기울기를 O(W)에 계산하는 알고리즘. Autograd의 근간.
연쇄 법칙
합성함수 미분을 국소 미분의 곱으로 분해. 역전파의 수학적 핵심.
오차 신호 δ
각 층에서 기울기를 나르는 벡터. δ_l = (W_{l+1}ᵀ δ_{l+1}) ⊙ σ′(z_l).
계산 그래프
연산을 노드·텐서를 엣지로 둔 그래프. Autograd가 순방향 기록·역방향 미분에 사용.
표현 학습
은닉층이 과제에 유용한 중간 특징을 데이터로부터 자동 학습하는 것. XOR 예가 고전적 시연.
마스크 언어 모델 (MLM)
일부 토큰을 가리고 양방향 문맥으로 원본을 예측하는 사전학습 목표. BERT의 핵심.
다음 문장 예측 (NSP)
두 문장이 실제로 이어지는지(IsNext/NotNext) 맞히는 사전학습. 문장 관계 신호.
[CLS] 토큰
시퀀스 앞에 두는 특수 토큰. 최종 은닉을 분류 등 시퀀스 단위 태스크에 사용.
사전학습 + 미세조정
대규모 비지도 사전학습 후 소량 레이블로 헤드/전체를 미세조정하는 패러다임.
양방향 인코더
매 층 self-attention이 좌·우 문맥을 동시에 보는 인코더. GPT 단방향·ELMo 얕은 양방향과 대비.
자기회귀 언어 모델
이전 토큰(왼쪽 문맥)만으로 다음 토큰을 예측하는 LM. Causal mask를 쓰는 GPT 계열의 기본.
제로샷
태스크 특화 학습·헤드 없이, 자연어 프롬프트만으로 과제를 수행하는 능력.
WebText
Reddit karma ≥ 3 아웃링크로 모은 고품질 웹 코퍼스 (~800만 문서, ~40GB).
BPE 토크나이저
Byte Pair Encoding 서브워드 분할. GPT-2 어휘 약 50,257 토큰.
인컨텍스트 러닝
가중치를 바꾸지 않고, 프롬프트에 넣은 설명·예시만으로 태스크를 수행하는 능력.
퓨샷
프롬프트에 예제 여러 개(K ≤ 수십)를 넣어 형식을 유도. 미세조정 아님.
Chain-of-Thought
최종 답 전에 중간 추론 단계를 생성하도록 유도하는 프롬프팅.
Zero-Shot CoT
예시 없이 “Let’s think step by step” 등으로 단계적 추론을 유도 (Kojima et al., 2022).
Self-Consistency
여러 CoT 경로를 샘플해 최종 답을 다수결. CoT 단독보다 추가 이득.
창발적 능력
작은 모델에서는 거의 없다가 스케일이 커지면 질적으로 나타나는 능력. CoT 이득은 ~100B+에서 뚜렷.
스케일링 법칙
모델·데이터·컴퓨트를 키울수록 성능이 예측 가능하게(멱함수적으로) 향상된다는 경험 법칙.
멱함수 손실
테스트 손실 L이 N·D·C의 거듭제곱으로 감소: L≈(x_c/x)^α.
연산 최적 배분
고정 FLOPs C에서 N과 D를 어떻게 나눌지. Kaplan: N∝C^0.73, D∝C^0.27.
아키텍처 독립성
같은 파라미터 수면 깊이·헤드 배치를 바꿔도 성능이 거의 같음 (극단 제외).
샘플 효율
같은 연산에서 큰 모델이 스텝당 더 많은 정보를 뽑아 소형+장학습보다 유리할 수 있음.
Chinchilla 최적
Hoffmann et al.: 대략 파라미터당 학습 토큰 ~20. Kaplan 대비 데이터를 더 쓰라는 수정.
IsoFLOP
같은 연산량(C)에서 N과 D 조합을 바꿔 손실을 비교하는 실험 설계.
Overtraining
학습 최적보다 많은 토큰으로 더 작은 모델을 학습 — 추론/서빙 비용을 줄이기 위함.
환각
모델이 확신 있는 톤으로 사실이 아닌 내용을 생성하는 현상.
RLHF
인간 선호도 피드백으로 보상 모델을 만들고, 그 보상을 최대화하도록 정책을 강화학습하는 정렬 파이프라인.
SFT
사람이 쓴 이상적 답변으로 지도 학습 미세조정 — RLHF의 1단계.
보상 모델
인간 순위/쌍 선호도를 스칼라 점수 r(x,y)로 예측하는 모델.
KL 페널티
정책이 SFT 참조에서 너무 멀어지지 않게 KL 항으로 제약 — 보상 해킹 완화.
정렬세
RLHF 정렬 후 일부 NLP 벤치마크 성능이 떨어지는 현상. PTX로 완화.
3H (Helpful·Harmless·Honest)
어시스턴트 정렬 목표: 도움이 되고, 무해하며, 정직할 것.
Text-to-Text
모든 NLP 태스크를 입력 텍스트 → 출력 텍스트로 통일하는 프레임워크 (T5).
Span corruption
연속 토큰 구간을 sentinel로 바꾸고 그 span을 복원하는 사전학습 목표.
C4
Colossal Clean Crawled Corpus — Common Crawl에서 정제한 ~750GB 영문 웹 텍스트.
멀티태스크 학습
여러 태스크를 한 모델·한 형식으로 같이 학습. T5는 prefix로 태스크를 구분.
전이학습
대규모 사전학습 후 다운스트림에 파인튜닝해 지식을 옮김. T5가 한계를 체계적으로 탐구.
Constitutional AI
짧은 원칙(헌법)으로 AI가 자신의 출력을 비판·수정하고, 무해성 선호 라벨도 AI가 매기는 정렬 방법 (Anthropic, 2022).
RLAIF
RL from AI Feedback — 인간 무해성 라벨 대신 AI 비교로 선호 모델을 학습한 뒤 PPO. CAI의 RL 단계.
비판–수정 사이클
헌법 원칙을 무작위로 뽑아 응답을 비판한 뒤 수정하고, 이를 여러 번 반복한 최종본으로 지도 학습 (SL-CAI).
헌법 (원칙 집합)
모델 행동을 규율하는 자연어 원칙 목록. 이 논문은 SL/RL 각 ~16개(연구용 ad hoc). 이후 Claude 제품 헌법은 UN·약관 등을 섞음.
Scaling Supervision
AI가 AI를 감독하게 해 인간 감독을 소량·고품질로 줄이는 방향. CAI는 무해성 라벨을 원칙+모델 피드백으로 대체.
이미지 패치
이미지를 P×P 격자로 잘라 각 칸을 하나의 토큰으로 취급. ViT의 핵심 입력 단위 (예: 224×224, P=16 → N=196).
귀납적 편향
모델이 데이터 전에 가정하는 구조. CNN은 지역성·이동 등변성을 층마다 내장. ViT는 패치 자르기 외에 거의 없음.
Vision Transformer (ViT)
이미지를 패치 시퀀스로 보고 표준 Transformer 인코더로 분류. 대규모 사전학습이면 CNN 귀납적 편향을 이김 (ICLR 2021).
CLIP
Contrastive Language-Image Pre-training — 4억 (image, text) 대조 학습으로 공유 임베딩. 텍스트로 제로샷 분류 (OpenAI, ICML 2021).
대조 학습
같은 의미(양성)는 가깝게, 다른 샘플(음성)은 멀게. CLIP은 배치 N×N InfoNCE로 (image, text) 매칭.
WIT (WebImageText)
CLIP 사전학습용 4억 (image, text) 쌍. ~50만 Wikipedia 유래 쿼리로 크롤, 레이블 없음.
멀티모달 임베딩
이미지·텍스트를 같은 d차원 공간에 정렬. CLIP은 L2 정규화 코사인 + 학습 온도 τ.
LLaVA
Large Language and Vision Assistant — CLIP 비전 + 선형 투영 + Vicuna를 GPT-4 생성 지시로 튜닝한 오픈 멀티모달 챗 (NeurIPS 2023).
시각 지시 튜닝
이미지+텍스트 지시–응답 쌍으로 LMM을 SFT해 멀티모달 지시를 따르게 함. LLaVA가 GPT-4 생성 데이터로 확립.
GPT-4 데이터 생성
이미지 대신 캡션·바운딩 박스만 텍스트 GPT-4에 넣어 대화·상세 설명·복잡 추론 QA를 합성 (LLaVA 158K).
투영 커넥터
비전 특징을 LLM 임베딩 공간으로 매핑. LLaVA는 선형 W; LLaVA-1.5는 2-layer MLP.
Flamingo
고정된 NFNet 비전 인코더와 Chinchilla LM을 Perceiver Resampler + gated cross-attention으로 연결한 퓨샷 비전-언어 모델 (DeepMind, NeurIPS 2022).
Perceiver Resampler
고정된 수의 학습 latent 쿼리(Flamingo는 64개)가 크로스-어텐션으로 가변 크기 비전 특징을 고정 길이 토큰열로 압축하는 모듈.
게이트 크로스-어텐션
새 cross-attention 블록의 출력을 tanh(α)로 게이팅하고 α를 0으로 초기화해, 고정 LLM에 비전 정보를 발산 없이 점진적으로 통합하는 기법 (Flamingo XATTN-DENSE).
인터리빙 멀티모달 입력
`<image> 텍스트 <image> 텍스트 …` 처럼 이미지와 텍스트를 한 시퀀스에 자유롭게 섞은 입력. GPT-3식 in-context 퓨샷을 멀티모달로 확장한다.
고정 백본
사전학습된 대형 인코더/LLM의 가중치를 얼려 두고, 그 사이를 잇는 작은 커넥터 모듈만 학습하는 방식. 능력 보존·재앙적 망각 방지·학습 비용 절감.
BLIP-2
고정된 이미지 인코더와 고정된 LLM 사이에 경량 Q-Former(32 query, ~188M)만 학습하는 2단계 비전-언어 사전학습 방법 (Salesforce, ICML 2023).
Q-Former (Querying Transformer)
BERTbase 기반 경량 트랜스포머. 이미지 트랜스포머와 텍스트 트랜스포머가 셀프-어텐션 층을 공유하며, 32개 query가 고정 이미지 특징에 크로스-어텐션해 32 시각 토큰을 뽑는다.
학습 가능한 query 토큰
고정 개수(BLIP-2는 32개)의 학습되는 임베딩. 크로스-어텐션의 query로 쓰여 가변 크기 인코더 출력을 고정 길이 토큰열로 압축한다. Flamingo의 Perceiver latent와 같은 계열.
소프트 시각 프롬프트
이미지에서 뽑은 소수의 임베딩 벡터를 LLM 임베딩 차원에 선형 투영해, 텍스트 토큰 임베딩 앞에 붙인 것. 고정 LLM이 이를 가상의 프롬프트 토큰처럼 조건으로 삼는다.
2단계 사전학습
BLIP-2의 학습 절차. 1단계는 이미지 인코더만 고정하고 Q-Former를 이미지-텍스트 쌍으로 표현 정렬(ITC/ITM/ITG); 2단계는 LLM도 고정하고 Q-Former 출력을 LLM에 소프트 프롬프트로 연결해 생성 학습.
모달리티 갭
고정된 이미지 인코더의 출력 공간과 고정된 LLM의 입력 임베딩 공간이 서로 맞지 않는 간극. BLIP-2는 1단계 표현 정렬로 이 갭을 먼저 좁힌 뒤 2단계에서 LLM에 연결한다.
YOLO (You Only Look Once)
객체 감지를 이미지 전체에 대한 단일 회귀 문제로 재정의한 모델. 후보 영역 생성 없이 한 번의 순전파로 바운딩 박스와 클래스를 동시에 예측해 실시간 처리를 가능케 했다 (2016).
단일 단계 감지 (Single-stage detection)
후보 영역 생성과 분류를 분리하는 2단계(R-CNN 계열) 대신, 하나의 네트워크가 위치와 클래스를 동시에 직접 예측하는 방식. 정확도를 다소 낮추는 대신 속도를 크게 높인다.
그리드 셀 회귀
이미지를 S×S 격자로 나누고, 객체 중심이 속한 셀이 그 객체의 박스 좌표·confidence·클래스 확률을 직접 회귀하도록 학습시키는 방식. 셀마다 B개의 박스를 예측한다.
IoU (Intersection over Union)
두 박스의 겹치는 면적을 합친 면적으로 나눈 비율. 예측 박스가 정답과 얼마나 잘 겹치는지 측정하며, confidence 타깃과 mAP 평가 모두에 쓰인다.
비최대 억제 (NMS)
같은 객체를 가리키는 여러 겹친 박스 중 confidence가 가장 높은 것만 남기고 나머지를 제거하는 후처리. YOLO는 그리드+다중 박스 구조상 중복 검출이 생기므로 최종 출력 전 항상 NMS를 적용한다.