RNN/CNN 없이 어텐션만으로 시퀀스를 모델링한 현대 LLM의 뿌리.
Skip Connection으로 초심층 네트워크의 저하 문제를 푼 현대 CNN의 표준.
모멘텀 + RMSProp을 합친 적응형 옵티마이저. LLM 학습의 사실상 표준.
미니배치로 층 입력을 정규화해 학습을 안정·가속. 딥러닝 표준 레시피의 핵심.
훈련 중 뉴런을 무작위로 꺼 과적합을 막는, 구현은 쉽고 효과는 큰 정규화.
셀 상태와 게이트로 RNN 기울기 소실을 풀어 장거리 의존을 학습.
단어를 조밀 벡터로 배워 의미 유추(왕−남자+여자≈여왕)를 가능하게 한 임베딩.
특징 축으로 정규화해 배치에 독립 — Transformer·RNN의 표준 정규화.
ILSVRC 2012를 뒤흔든 8층 CNN — ReLU·GPU·드롭아웃으로 딥러닝 시대를 연 논문.
연쇄 법칙으로 다층망 기울기를 O(W)에 — 오늘날 Autograd의 수학적 근간.
양방향 인코더 + MLM/NSP 사전학습 — 사전학습·미세조정의 NLP 표준을 연 논문.
1.5B 자기회귀 LM — 미세조정 없이 제로샷 다중 태스크, 스케일의 힘을 보여준 전신.
175B · 인컨텍스트 러닝 — 가중치 업데이트 없이 few-shot으로 NLP 태스크.
RLHF로 GPT-3를 정렬 — 1.3B InstructGPT가 175B GPT-3보다 선호됨.
손실이 N·D·C의 멱함수로 예측 가능 — 대형 LM 설계의 지도 원리.
N과 D를 동등 스케일 — 70B가 280B Gopher를 이김. ~20 tok/param.
공개 데이터 + 소형·과학습 — 13B가 GPT-3(175B)를 많은 벤치에서 능가.
중간 추론 단계를 쓰게 하면 거대 모델의 수학·상식·기호 추론이 급상승.
모든 NLP를 text→text로 통일 · C4 · span 마스킹 · 11B로 다수 SOTA.
헌법 원칙으로 자기 비판·수정 + RLAIF — 무해하면서 회피하지 않는 어시스턴트.
이미지를 16×16 패치 시퀀스로 — 순수 Transformer가 대규모에서 CNN을 이김.
4억 (image, text) 대조 학습 — ImageNet 제로샷 76.2%로 지도 ResNet-50과 동급.
CLIP + Vicuna + GPT-4 생성 158K 지시 — 오픈소스 멀티모달 챗의 기준점.
고정된 NFNet + Chinchilla를 Perceiver Resampler와 gated cross-attention으로 연결 — 인터리빙 이미지·텍스트로 퓨샷 비전-언어.
고정된 이미지 인코더와 고정된 LLM 사이에 경량 Q-Former(32 query)만 학습 — 2단계 사전학습으로 Flamingo-80B를 54× 적은 학습 파라미터로 앞선다.
객체 감지를 이미지 전체에 대한 단일 회귀 문제로 재정의 — 후보 영역 생성 없이 한 번의 순전파로 박스와 클래스를 동시에 예측해 45~155 FPS 실시간 감지를 실현했다.