전역·지역 시각 표현
이미지 전체를 포착하는 전역 표현과 개별 패치나 객체 수준의 지역 표현을 모두 활용하는 표현 설계이다. 논문은 두 계층의 시각 표현을 동시에 통합해 LLM이 장면 맥락과 세부 정보를 모두 활용하게 했고, 입력 이미지→피처 추출→전역 요약·지역 패치 임베딩→통합의 처리 흐름으로 구현되었다. 이 설계는 단순 전역 요약만 사용하는 접근보다 세부 질의에 대한 응답력이 높아지는 증거로 제시되었다.