이미지-투-텍스트 생성
이미지-투-텍스트 생성은 입력 문서 이미지로부터 순차적 텍스트를 생성하는 과정으로, 시각 토큰을 텍스트 디코더에 공급하여 시각 표현과 텍스트 레이블을 정렬하는 방식으로 작동한다. 이 논문에서는 시각 표현과 문자 단위의 텍스트를 밀집하게 정합시키기 위해 autoregressive cross-entropy loss로 최적화되었다. 시각적 증거가 약할 때 언어적 신호의 보완을 최소화하고 시각 기반 인식 능력을 높이는 데 핵심 역할을 한다.