visual_instruction_tuning

시각 지시 튜닝

이미지+텍스트 지시–응답 쌍으로 LMM을 SFT해 멀티모달 지시를 따르게 함. LLaVA가 GPT-4 생성 데이터로 확립.

관련 논문