파트 수준 그라운딩
이미지 속 객체의 전체가 아니라 객체의 특정 부위(예: 손잡이, 버튼)로 텍스트 질의를 정밀하게 연결하는 과제이다. 이 과제는 객체 경계가 아닌 단일 포인트나 작은 영역을 정확히 가리키는 능력을 요구하며, 로봇 조작처럼 세밀한 위치 지정이 필요한 응용에서 중요하다. 본문에서는 MLLM의 기존 객체 수준 성능을 파트 수준 포인트로 전환하는 방법이 핵심이다.