용어 해설
- 지각 기반 물체 계수(Perceptual counting)
- — 이미지 내에서 겹치거나 부분적으로 가려진 물체를 포함하여 정확한 개체 수를 식별하는 과제이다. 이 과제는 단순한 객체 검출을 넘어서서 동일 객체의 중복 판별과 부분 가림, 원근에 따른 크기 변화 등을 처리해야 한다. Blind-spots-bench에서 지각 기반 계수는 VLM의 약점으로 빈번히 오류를 발생시키는 핵심 하위 과제이다.
- 문자 단위 조작(Character-level manipulation)
- — 모델 출력에서 정확한 문자 수, 특정 서브스트링의 존재, 또는 반복되는 문자 패턴을 엄격히 제어하는 과제이다. 서브워드 토크나이저의 분절 영향과 토큰화-디토큰화 과정에서의 미세한 오류가 정답 판정에 큰 영향을 미친다. 본 논문에서는 문자열 길이 제약이나 특정 문자 반복 생성이 빈번한 실패 원인으로 보고되었다.
- 자동 채점기(Automatic Grader)
- — 모델 출력과 구조화된 기준(reference solution)을 비교해 이진 정오판단을 산출하는 자동화된 평가 구성요소이다. 본 데이터셋에서는 코드 실행과 텍스트 검증을 결합하여 하드 제약(예: 정확한 개수, 서브스트링 존재)을 검증하도록 설계되었다. 논문은 자동 채점기의 인간-자동 채점 일치율을 검증해 96.6%(텍스트)와 90.9%(이미지생성)를 보고하였다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



