Paper Understanding

AI 논문을 시각화로 빠르게 이해합니다

Paper Understanding은 Transformer부터 Flamingo까지 핵심 AI 논문을 인터랙티브 시각화, 수식, 개념 사전으로 풀어 설명하는 학습 사이트입니다. 원문의 수치와 구조를 기준으로, 한 페이지에서 그림과 수식을 오가며 이해합니다.

한국어 / 영어 전환 · 인터랙티브 시각화 · 수식·개념 재사용

이런 분께 맞습니다

  • 논문 원문을 읽기 전에 큰 그림과 핵심 수식을 잡고 싶은 학생·연구자
  • Attention, Scaling Laws, RLHF 같은 개념이 논문마다 어떻게 쓰이는지 비교하고 싶은 분
  • 한국어로 먼저 읽고 영어로 용어를 확인하고 싶은 분

어떻게 배우나요

수록 논문

Transformer, ResNet, GPT 계열, BERT, Scaling Laws, LLaMA, T5, ViT, CLIP, LLaVA, Flamingo, Constitutional AI 등을 시각화와 함께 제공합니다.

Foundations · 2017 · visual · formulas

Attention Is All You Need — Transformer

RNN/CNN 없이 어텐션만으로 시퀀스를 모델링한 현대 LLM의 뿌리.

Foundations · 2016 · visual · formulas

Deep Residual Learning — ResNet

Skip Connection으로 초심층 네트워크의 저하 문제를 푼 현대 CNN의 표준.

Foundations · 2015 · visual · formulas

Adam: A Method for Stochastic Optimization

모멘텀 + RMSProp을 합친 적응형 옵티마이저. LLM 학습의 사실상 표준.

Foundations · 2015 · visual · formulas

Batch Normalization: Accelerating Deep Network Training

미니배치로 층 입력을 정규화해 학습을 안정·가속. 딥러닝 표준 레시피의 핵심.

Foundations · 2014 · visual · formulas

Dropout: A Simple Way to Prevent Neural Networks from Overfitting

훈련 중 뉴런을 무작위로 꺼 과적합을 막는, 구현은 쉽고 효과는 큰 정규화.

Foundations · 1997 · visual · formulas

Long Short-Term Memory

셀 상태와 게이트로 RNN 기울기 소실을 풀어 장거리 의존을 학습.

Foundations · 2013 · visual · formulas

Efficient Estimation of Word Representations in Vector Space

단어를 조밀 벡터로 배워 의미 유추(왕−남자+여자≈여왕)를 가능하게 한 임베딩.

Foundations · 2016 · visual · formulas

Layer Normalization

특징 축으로 정규화해 배치에 독립 — Transformer·RNN의 표준 정규화.

Foundations · 2012 · visual · formulas

ImageNet Classification with Deep CNNs — AlexNet

ILSVRC 2012를 뒤흔든 8층 CNN — ReLU·GPU·드롭아웃으로 딥러닝 시대를 연 논문.

Foundations · 1986 · visual · formulas

Learning Representations by Back-Propagating Errors

연쇄 법칙으로 다층망 기울기를 O(W)에 — 오늘날 Autograd의 수학적 근간.

LLM Evolution · 2019 · visual · formulas

BERT: Pre-training of Deep Bidirectional Transformers

양방향 인코더 + MLM/NSP 사전학습 — 사전학습·미세조정의 NLP 표준을 연 논문.

LLM Evolution · 2019 · visual · formulas

Language Models are Unsupervised Multitask Learners — GPT-2

1.5B 자기회귀 LM — 미세조정 없이 제로샷 다중 태스크, 스케일의 힘을 보여준 전신.

LLM Evolution · 2020 · visual · formulas

Language Models are Few-Shot Learners — GPT-3

175B · 인컨텍스트 러닝 — 가중치 업데이트 없이 few-shot으로 NLP 태스크.

LLM Evolution · 2022 · visual · formulas

Training Language Models to Follow Instructions with Human Feedback — InstructGPT

RLHF로 GPT-3를 정렬 — 1.3B InstructGPT가 175B GPT-3보다 선호됨.

LLM Evolution · 2020 · visual · formulas

Scaling Laws for Neural Language Models

손실이 N·D·C의 멱함수로 예측 가능 — 대형 LM 설계의 지도 원리.

LLM Evolution · 2022 · visual · formulas

Training Compute-Optimal Large Language Models — Chinchilla

N과 D를 동등 스케일 — 70B가 280B Gopher를 이김. ~20 tok/param.

LLM Evolution · 2023 · visual · formulas

LLaMA: Open and Efficient Foundation Language Models

공개 데이터 + 소형·과학습 — 13B가 GPT-3(175B)를 많은 벤치에서 능가.

Prompting & Reasoning · 2022 · visual · formulas

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

중간 추론 단계를 쓰게 하면 거대 모델의 수학·상식·기호 추론이 급상승.

LLM Evolution · 2020 · visual · formulas

Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer — T5

모든 NLP를 text→text로 통일 · C4 · span 마스킹 · 11B로 다수 SOTA.

LLM Evolution · 2022 · visual · formulas

Constitutional AI: Harmlessness from AI Feedback

헌법 원칙으로 자기 비판·수정 + RLAIF — 무해하면서 회피하지 않는 어시스턴트.

Vision & Multimodal · 2021 · visual · formulas

An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale — ViT

이미지를 16×16 패치 시퀀스로 — 순수 Transformer가 대규모에서 CNN을 이김.

Vision & Multimodal · 2021 · visual · formulas

Learning Transferable Visual Models From Natural Language Supervision — CLIP

4억 (image, text) 대조 학습 — ImageNet 제로샷 76.2%로 지도 ResNet-50과 동급.

Vision & Multimodal · 2023 · visual · formulas

Visual Instruction Tuning — LLaVA

CLIP + Vicuna + GPT-4 생성 158K 지시 — 오픈소스 멀티모달 챗의 기준점.

Vision & Multimodal · 2022 · visual · formulas

Flamingo: 퓨샷 학습을 위한 비전-언어 모델

고정된 NFNet + Chinchilla를 Perceiver Resampler와 gated cross-attention으로 연결 — 인터리빙 이미지·텍스트로 퓨샷 비전-언어.

Vision & Multimodal · 2023 · visual · formulas

BLIP-2: 고정된 이미지 인코더와 LLM을 잇는 부트스트랩 비전-언어 사전학습

고정된 이미지 인코더와 고정된 LLM 사이에 경량 Q-Former(32 query)만 학습 — 2단계 사전학습으로 Flamingo-80B를 54× 적은 학습 파라미터로 앞선다.

Vision & Multimodal · 2016 · visual · formulas

YOLO: 단일 신경망으로 실시간 통합 객체 감지

객체 감지를 이미지 전체에 대한 단일 회귀 문제로 재정의 — 후보 영역 생성 없이 한 번의 순전파로 박스와 클래스를 동시에 예측해 45~155 FPS 실시간 감지를 실현했다.