본문으로 건너뛰기

vlms

비전-언어 모델(VLM)

비전-언어 모델(VLM)은 이미지 입력을 받아 텍스트를 생성하거나 텍스트와 결합된 응답을 출력하는 멀티모달 모델이다. 입력 이미지에서 시각적 특징을 추출한 뒤 언어 모듈이 이를 문장화하는 흐름으로 동작하며, 보고서 생성 같은 의료 문서 자동화에 주로 활용된다. RRG 과제에서는 영상→텍스트 변환의 정확성과 임상 용어 보존 여부가 핵심 성능 지표가 된다.