TL;DR
PerceptionRubrics는 기존 유사도 중심 벤치마크가 실제 지각적 취약성을 은폐하는 문제를 해결하기 위해 설계된 기준이다. 이미지와 캡션을 원자적 검증 단위로 분해해 핵심 사실 하나라도 틀리면 강하게 패널티를 부과하는 방식으로 인간의 비선형적 감수성을 반영한다. 이 접근은 높은 평균 점수에도 불구하고 실제 배포 환경에서 발생하는 치명적 오류를 더 잘 드러내어 모델 개선의 진단력을 높였다.
왜 중요한가
PerceptionRubrics는 기존 유사도 중심 벤치마크가 실제 지각적 취약성을 은폐하는 문제를 해결하기 위해 설계된 기준이다. 이미지와 캡션을 원자적 검증 단위로 분해해 핵심 사실 하나라도 틀리면 강하게 패널티를 부과하는 방식으로 인간의 비선형적 감수성을 반영한다. 이 접근은 높은 평균 점수에도 불구하고 실제 배포 환경에서 발생하는 치명적 오류를 더 잘 드러내어 모델 개선의 진단력을 높였다.
핵심 기여
정보 밀집 이미지와 대규모 원자적 루브릭 데이터셋 구축
1,038개의 정보 밀집 이미지를 선별하고 총 10,718개의 원자적 루브릭을 수집해 인스턴스별로 매핑했다. 각 이미지당 평균 10.33개의 루브릭이 할당되며 Must-Right 4,053개, Easy-Wrong 6,665개로 구성되어 평가 밀도를 높였다. 이 데이터는 장문의 골든 캡션(평균 770.42단어)을 기준으로 루브릭이 추출되어 상세 검증 기준을 제공한다.
Circular Peer-Review로 골든 캡션을 합의 생성
여러 상위 MLLM이 후보 캡션을 생성하고 서로 비교·재작성하는 순환 피어리뷰를 적용해 모델 앙상블의 합의를 유도했다. 합의에 실패한 샘플은 폐기하는 discard-on-divergence 프로토콜을 적용해 인간 검수 자원을 검증 단계에 집중시켰다. 이 프로세스는 노이즈와 편향을 줄인 고정밀 텍스트 참조를 확보하는 데 기여했다.
듀얼 스트림 루브릭과 게이트 점수화 도입
골든 캡션으로부터 Must-Right(필수 사실)와 Easy-Wrong(오류 취약 항목) 두 종류의 루브릭을 생성해 서로 보완하도록 설계했다. Must-Right 항목 하나라도 실패하면 게이트 G가 0이 되어 점수가 사실상 0이 되는 Gated Scoring을 적용하고, 게이트 통과 시 Easy-Wrong 평균으로 최종 점수를 산출했다. 이 평가철학은 국소적 치명적 오류의 영향력을 회복시켜 인간 선호와 강한 정렬을 이루었다.
실험을 통한 신뢰성 격차와 오픈-클로즈드 성능 분화 규명
25개 대표 MLLM을 평가해 Atomic Accuracy와 Must-Right Pass Rate의 괴리를 Reliability Gap으로 규정하고 정량화했다. 상용·프로프라이어터리 모델과 공개 모델 간에 약 8%의 인지 성능 격차(Open-Closed Stratification)를 관찰했고, PerceptionRubrics 점수는 Vision Arena 인간 선호와 Pearson 0.916, Spearman 1.000의 높은 상관성을 보였다. 이 결과는 정밀 지각 능력이 모델 신뢰도의 핵심임을 뒷받침한다.
핵심 아이디어 이해하기
멀티모달 평가에서 기존의 유사도 기반 점수는 전체적 의미 일치(broad semantic overlap)를 측정하는 반면, 인간 지각은 특정 국소 사실의 정확성을 비선형적으로 판단한다. 따라서 이미지 이해를 골든 캡션이라는 고밀도 텍스트로 먼저 변환하고, 그 텍스트에서 원자적 참/거짓 검증 항목을 추출하면 시각적 사실의 정확도를 직접적으로 측정할 수 있다. 이 방식은 Attention이나 임베딩 기반 유사도 계산이 잡아내기 어려운 세부적 환각이나 공간관계 오류를 표면화한다.
방법론
PerceptionRubrics는 설계 원칙으로 'Perceptual Persistence'와 'Calibrating to Human Sensitivity'를 채택해 복잡성 높은 이미지를 우선 선별했다. 이미지 큐레이션 단계에서 Step3-VL-10B 같은 모델로 시각 복잡도와 정보 밀도를 점수화해 도메인별 임계값을 충족하는 샘플을 확보했다. 골든 캡션 생성은 제한된 반복(N ≤ 2)의 Circular Peer-Review로 시작해 모델들이 후보를 비교·순위화·재작성하고 인간은 최종 검증만 수행하는 discard-on-divergence 정책을 적용했다. 루브릭 생성 단계에서는 골든 캡션을 입력으로 도메인 적응형 프롬프트를 통해 Must-Right와 Easy-Wrong 항목을 추출하고, 평가 단계에서는 GPT-OSS-120B를 판정자(judge)로 사용해 각 루브릭에 대해 이진 판정(True/False)을 얻었다. 최종 점수는 식(1)-(2)에 따라 게이트 G의 상태와 Easy-Wrong 평균을 결합해 산출되며, 여기서 게이트는 Must-Right 항목의 논리곱으로 정의되어 하나라도 실패하면 G가 0이 된다.
관련 Figure

상단 좌측에서 모델별 캡션 사례를 보여주고 중앙에서 Circular Peer-Review를 통해 골든 캡션을 생성하는 흐름을 시각화했다. 우측 하단에서는 Must-Right와 Easy-Wrong 루브릭이 어떻게 추출되고 게이트 기반 점수로 결합되는지 단계별로 표시해 방법론의 핵심 구성요소를 연결했다. 이 다이어그램은 방법론의 전체 파이프라인과 각 단계의 입력·출력 관계를 이해하는 데 직접적인 근거를 제공한다.
이 그림은 PerceptionRubrics가 기존 벤치마크와 모델 출력 사례를 비교해 상세 루브릭으로 평가하는 전반적 워크플로를 도식화한 다이어그램이다.

자연장면, 문서 OCR, GUI, 구조화 데이터 등 7개 도메인에 대해 Must-Right와 Easy-Wrong 유형의 루브릭 예시를 제공해 도메인별 검증 포인트의 차이를 명확히 했다. 각 도메인에 맞춘 도메인-특화 프롬프트 설계의 필요성과 루브릭 추출의 분기점을 시각적으로 보강해 구현자가 어떤 항목을 우선 검수해야 하는지를 안내한다. 이 이미지는 데이터 큐레이션과 루브릭 설계의 근거자료로 직접 연결된다.
이 그림은 태스크 도메인별 루브릭 예시와 각 도메인에서 요구되는 성격을 요약한 인포그래픽이다.

도메인별 비중을 통해 데이터셋의 범위가 GUI와 Digital UI/UX 같은 정보밀집 도메인에 중점임을 보여준다. 이 분포는 평가가 정보밀집 입력에서 치명적 실패를 검출하도록 설계되었음을 뒷받침하며, 샘플링 정책과 카테고리 균형의 근거를 제공한다. 따라서 데이터 편향과 도메인 특이적 결과 해석에서 중요한 근거 자료로 작동한다.
이 도식은 PerceptionRubrics의 퍼셉션 루브릭 비중을 도넛 차트로 나타내며 각 도메인의 데이터 비중을 시각화했다.

세 모델로 구성된 앙상블이 초기 후보를 생성하고 순환적으로 서로 평가·수정하는 Circular Peer-Review의 내부 동작을 상세히 표시했다. N ≤ 2의 제한 반복, discard-on-divergence 규칙, 인간 경량 검수로 넘어가는 조건 등을 시각적 흐름으로 제시해 데이터 품질 통제 전략의 구체적 작동 방식을 확인할 수 있다. 이 도식은 골든 캡션 신뢰성 확보 메커니즘의 핵심 근거를 보완한다.
이 그림은 골든 캡션 생성 파이프라인과 후보 캡션의 비교·정렬·재작성 과정을 단계별로 도식화한 플로우차트다.
주요 결과
데이터 통계에서 PerceptionRubrics는 1,038장 이미지와 평균 770.42단어의 골든 캡션, 총 10,718개 루브릭(평균 10.33루브릭/이미지)을 확보했다. 모델 평가 결과 Seed-2.0-Lite가 전체 70.07%로 최고 성적을 기록했고 Gemini-3.5-Flash와 근접한 성적 분포를 보였으며 반면 GPT-4o는 12.59%로 상대적으로 낮은 성능을 보였다. Atomic Accuracy는 전반적으로 높게 측정되었지만 Must-Right Pass Rate는 상당히 낮아 Reliability Gap이 존재했으며 이 격차는 모델 능력 향상에 따라 점차 줄어드는 경향을 보였다. 또한 PerceptionRubrics 점수는 Vision Arena 인간 선호와 Pearson 0.916, Spearman 1.000의 높은 상관을 보여 인간 정렬도가 우수함이 확인되었다.
관련 Figure

캡션 길이의 오른쪽 치우침을 통해 평균(770.42단어)이 중앙값(569단어)보다 크며 일부 캡션이 3,400단어를 초과하는 장기 꼬리를 형성함을 시각적으로 확인할 수 있다. 이 분포는 루브릭의 세분화 가능성과 정보 밀도 기반 평가의 정당성을 뒷받침하며 긴 캡션이 세부적 검증 근거로 사용되는 방식을 설명한다. 또한 길이 편향에 대한 후속 분석의 근거 자료로 기능한다.
이 히스토그램은 골든 캡션 길이 분포를 제시하며 평균과 중앙값의 차이를 보여준다.

Atomic Accuracy와 Must-Right-All-Pass Rate의 차이를 Reliability Gap으로 정리해 모델들이 국소적 정확성은 확보하나 결합적 제약에서는 실패하는 경향을 수치로 제시했다. 또한 모델 간 Open-Closed 성능 격차와 PerceptionRubrics가 Vision Arena 인간 선호와 강한 상관(Pearson 0.916, Spearman 1.000)을 보이는 점을 시각적으로 제시해 평가 정렬성의 근거를 제공한다. 이 그림은 실험적 결론들의 정량적 근거를 직접 보완한다.
여러 모델의 도메인별 점수 분포와 PerceptionRubrics가 기존 벤치마크보다 인간 선호와 더 높은 상관을 보인 결과를 요약한 복합 차트다.
기술 상세
전체 시스템은 캡션 중심 파이프라인으로 구성되어 이미지→골든 캡션→루브릭 추출→LLM 판정자 순으로 처리된다. 골든 캡션 생성은 여러 최상위 MLLM이 후보를 생성하고 순환적으로 비교·수정하는 Circular Peer-Review를 사용하며 합의 실패 샘플은 폐기하는 strict consensus 필터링을 채용했다. 루브릭 생성은 도메인 적응형 프롬프트로 Must-Right와 Easy-Wrong 항목을 추출하며 Easy-Wrong 항목은 실제 모델 예측 풀(𝒫)을 분석해 자주 발생하는 오류를 근거로 구성된다. 평가 단계의 수식적 정의는 게이트 G = ∏ᵢ 𝕀(r_{m,i}=True)로 Must-Right의 논리곱을 계산하고, 게이트가 열린 경우 S = G·(1/k)·Σᵢ 𝕀(r_{e,i}=True)로 Easy-Wrong 평균을 취해 최종 점수를 산출한다. 판정자(judge) 안정성 실험에서 GPT-OSS-120B와 GPT-5.5를 비교한 결과 순위 안정성은 유지되었으나 절대 점수 분포는 약간의 편차(예: GPT-OSS-120B가 평균 약 6% 더 엄격)를 보였다.
한계점
골든 캡션 생성 단계에서 모델 합의에 실패한 샘플을 폐기하는 정책은 고밀도 이미지의 다양성을 일부 축소했을 가능성이 있으며 이는 데이터 분포 편향을 유발할 수 있다. 루브릭과 골든 캡션 생성에 최상위 MLLM을 광범위하게 활용하므로 해당 모델들의 편향이 참조 문장에 일부 반영될 위험이 존재한다. 판정자 선택에 따른 절대 점수 차이는 관찰되었으나 순위 안정성은 유지되어 평가자의 영향이 완전히 배제되지는 못했다.
실무 활용
PerceptionRubrics는 모델의 실제 배포 전 지각적 취약점을 진단하고 개선 우선순위를 결정하는 데 실무적으로 유용하다. 골든 캡션과 루브릭 세트를 활용하면 특정 도메인(GUI, 문서 OCR, 구조화 데이터 등)에서 반복적으로 발생하는 오류 패턴을 정량화해 모델 개선 전략을 세울 수 있다. 공개 저장소에 코드·데이터 메타가 수록되어 있어 재현과 확장이 가능하다.
- 모델 배포 전 리스크 평가용 사내 검증 파이프라인에 PerceptionRubrics를 활용해 치명적 환각을 조기에 탐지할 수 있다.
- 데이터 수집 단계에서 오류 패턴을 분석해 추가 라벨링 대상 또는 강화 데이터 전략을 설계하는 데 사용될 수 있다.
- 루브릭 기반 보상 설계 시 Must-Right 항목을 보상 설계의 제약으로 활용해 hallucination 억제를 목적으로 한 Fine-tuning 전략을 검증할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Gated Scoring
- — 루브릭 결과를 단순 평균 대신 필수 요건(Must-Right)을 게이트로 사용해 한 항목이라도 실패하면 최종 점수를 급감시키는 평가 방식이다. 입력 예측을 개별 루브릭에 대해 이진 평가(True/False)로 판정한 뒤, Must-Right가 모두 통과해야 Easy-Wrong 점수로 최종 점수를 계산한다. 이 방식은 국소적 치명적 오류가 전체 신뢰도를 결정하도록 설계되어 인간의 비선형적 감수성에 대응한다.
- Must-Right
- — 이미지의 핵심 시각 사실들을 원자적 검사 항목으로 분해한 집합으로, 하나라도 실패하면 해당 사례의 전체 평가가 사실상 무효화되는 기준이다. 각 항목은 True/False로 판정되며 모든 항목이 True여야 게이트가 열리고 세부 점수 계산으로 이어진다. 이는 핵심 사실의 누락이나 잘못된 기술을 치명적 오류로 취급하기 위한 설계이다.
- Easy-Wrong
- — 모델이 실제 예측에서 자주 hallucination하거나 누락하는 세부 항목을 식별해 만든 루브릭 집합으로, 세밀한 이해력과 환각 저항성을 측정한다. 응답이 Must-Right를 통과할 때 이 항목들의 평균 통과율로 최종 점수가 산정된다. 데이터 기반 오류 패턴을 반영하므로 현실적 실패 모드를 정량화하는 데 중요하다.
- Circular Peer-Review
- — 여러 최상위 MLLM이 초기 후보 캡션을 생성하고 서로 비교·순위화·재작성하는 반복적 합의 과정이다. 이 과정을 제한된 반복 수(N ≤ 2)로 수행해 모델 앙상블의 집단적 필터링 결과를 얻고 인간 검수로 확정한다. 모델 간 편향과 환각을 줄이는 집단 합의 수단으로 활용되었다.
- Golden Caption
- — Circular Peer-Review와 인간 경량 검수를 통해 확보된 고정밀 텍스트 참조로, 원시 이미지의 상세 정보를 풍부하게 서술한 기준 문장이다. 이 캡션에서 원자적 루브릭이 추출되어 Must-Right와 Easy-Wrong 항목으로 분해된다. 골든 캡션은 비정확한 참조에서 발생하는 평가 편향을 완화하는 역할을 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.