본문으로 건너뛰기

Large Vision-Language Model

대형 비전-언어 모델

이미지와 텍스트를 함께 입력받아 시각적 내용을 이해하고 언어로 답하는 모델입니다. 이 논문에서는 2D 이미지에서 가려진 블록과 3D 구조를 추론하는 공간 지능 학습의 대상입니다.