Paper Understanding
Papers
Concepts
Formulas
KO
EN
vision_transformer
Vision Transformer (ViT)
이미지를 패치 시퀀스로 보고 표준 Transformer 인코더로 분류. 대규모 사전학습이면 CNN 귀납적 편향을 이김 (ICLR 2021).
관련 수식
패치 개수
ViT 입력 임베딩
ViT 인코더 블록 (Pre-LN)
관련 논문
vit
transformer
bert
clip