어텐션-투-포인트 디코더
MLLM 내부의 어텐션 맵을 입력으로 받아 단일 포인트 중심의 히트맵으로 변환하는 경량 모듈로, 복잡한 파라미터 업데이트 없이 주목 영역을 좌표 중심 예측으로 바꾼다. 디코더는 어텐션의 공간적 분포를 정규화·샘플링해 최종 위치 확률을 출력하며, 포인트 기반 그라운딩 태스크에서 효율적으로 동작한다. 본문에서는 이 디코더를 기존 모델에 추가해 파트 수준 성능을 향상시킨 사례를 다루고 있다.