vision_transformer

Vision Transformer (ViT)

이미지를 패치 시퀀스로 보고 표준 Transformer 인코더로 분류. 대규모 사전학습이면 CNN 귀납적 편향을 이김 (ICLR 2021).