본문으로 건너뛰기

multimodal-llm

멀티모달 대형언어모델

이미지와 텍스트를 동시에 입력으로 받아 시맨틱 캡션을 생성할 수 있는 모델 계열로, 이미지 이해→텍스트 생성 흐름을 한 번의 추론으로 처리한다.