왜 중요한가
현실 문제들은 텍스트만이 아닌 표, 그림, 페이지 레이아웃 등 멀티모달 증거를 포함한 문서로부터 과제별 정보를 얻어야 합니다. CLBench-V는 증거 검색·문맥값 적용·문맥 정의 지식 학습의 세 수준으로 능력을 분리해 어느 단계에서 성능이 무너지는지 측정합니다. 이 계층적 진단은 멀티모달 입력을 받는 최신 모델들이 단순 입력 수용과 실제 맥락 학습 능력에서 서로 다른 한계를 보인다는 점을 드러내며, 연구자와 엔지니어가 개선 타깃을 구체화하는 데 유용합니다.
핵심 기여
세 수준 능력 계층 정의
멀티모달 컨텍스트 학습을 L0 Context Grounding(증거 위치·읽기), L1 New Information Application(문서별 값·사실 적용), L2 New Knowledge Learning(문맥에서 규칙·발견 학습)으로 구분해 실패 원인을 분리했습니다. 이 계층은 동일한 입력에서 증거 접근 실패와 문맥 기반 일반화 실패를 구별하는 분석적 틀을 제공합니다. 계층별로 서로 다른 데이터 소스와 평가 지표를 매핑해 진단력을 높였습니다.
CLBench-V 벤치마크 구축
기존 공개 벤치마크를 변환해 통일된 스키마로 통합하고, 의료 논문 결론 추론과 재무보고 ROE 분석 같은 도메인별 태스크를 새로 생성해 총 3,443개 인스턴스를 모았습니다. 변환 과정에서 시각 의존성·다중 홉 요구·불필요 컨텍스트 최소화 같은 기준을 적용했고 자동 필터링과 수작업 검토를 병행했습니다. 모든 태스크는 통일된 추론·채점 파이프라인으로 실행됩니다.
대규모 자동 합성·필터링 파이프라인
도메인별 데이터 구축 비용을 낮추기 위해 PDF→Markdown 변환과 후보 생성, Qwen3.5-Plus 기반의 자동 검사 및 임계치 필터링을 도입했습니다. 이 과정은 이미지 의존 여부와 단일-span 해결 가능성 같은 단서를 자동으로 제거하고 수작업 검토로 품질을 보강하는 방식으로 동작합니다. 결과적으로 도메인 특화 태스크에서 일관된 품질의 샘플을 확보할 수 있었습니다.
다중 모델·판정자 비교 평가
InternVL3.5-30B-A3B, Qwen3.6-27B, Qwen3.5-Plus 등 6개 멀티모달 모델을 동일한 프롬프트·입력으로 평가하고 LLM 판정자 간 점수 변동을 분석했습니다. 전체 최고 점수는 0.2847에 불과해 현행 모델들이 멀티모달 문맥 학습에서 여전히 약함을 보여주었습니다. 판정자 선택이 열린 응답형 태스크의 성적에 실질적 영향을 미친다는 사실도 보고했습니다.
핵심 아이디어 이해하기
멀티모달 컨텍스트 학습은 주어진 시각·문서 증거에서 먼저 관련 근거를 찾고(L0), 그 값을 기존의 추론 절차에 정확히 바인딩해 적용한 뒤(L1), 필요하면 문맥에서 새 규칙이나 결론을 합성해 일반화(L2)해야 성공합니다. 입력은 PDF 변환 페이지, 표·그림·차트, 웹 스크린샷 등으로 구성되며 모델은 시각 탐색→정보 추출→값 결합→추론·일반화의 순서로 처리합니다. 이 과정에서 근거의 위치·형식·분산 정도가 달라지면 증거 누락, 잘못된 바인딩, 또는 사전 지식의 덮어쓰기 같은 서로 다른 실패 모드가 발생합니다.
관련 Figure

이 그림은 데이터 소스별로 어떤 유형의 증거가 주어지는지와 계층적 평가 목표가 어떻게 연결되는지 입력→처리→오류 유형의 관점에서 시각적으로 정리합니다. 왼쪽의 사례들은 각 레벨에서 요구되는 구체적 작업(예: topology 검증, 숫자 추출, 결론 유도)을 보여주며 중앙의 계층은 증거 탐색→값 적용→지식 학습의 처리 흐름을 직관적으로 제시합니다. 오른쪽의 실패 모드는 실험 결과의 오류 분류와 대응 연구 방향을 연결하는 근거로 사용됩니다.
Figure 1은 CLBench-V의 개요 다이어그램으로, 왼쪽에 멀티모달 문맥 종류(논문 그림·표, 재무보고서, 장문 문서, 지도·경로, 스포츠 장면, 웹·시각 QA)를 열거하고 중앙에 능력 계층(L0~L2)을, 오른쪽에 공통 실패 모드를 배치해 전체 디자인을 한 눈에 보여줍니다.
방법론
CLBench-V는 공개 벤치마크의 정규화된 변환과 도메인별 데이터 구축 두 축으로 구성됩니다. 공개 데이터는 시각 의존성, 불필요 컨텍스트 최소화, 다중 홉 선호, 비비디오 범위 배제의 네 가지 기준으로 선별했고 Qwen3.5-Plus 검사기를 써서 자동 필터링한 뒤 수작업 검토를 거쳤습니다. 도메인 구축 파이프라인은 PDF→Markdown 변환, 후보 생성, 자동 필터링, 인간 검수로 이루어지며 재무 태스크는 DuPont 분해를 기준으로 수치 결합, 논문 태스크는 Result 이전 내용으로부터 결과를 추론하도록 구성했습니다. 모든 태스크는 통일된 입력·프롬프트·추출·채점 프레임워크로 실행해 레벨 간 비교 가능성을 확보했습니다.
주요 결과
총 3,443개 인스턴스에 대해 6개 최신 멀티모달 모델을 평가한 결과 전체 최고 점수는 0.2847로 나타났습니다. 모델별로 능력 프로필이 크게 달랐고 InternVL3.5-30B-A3B가 전반적·L0·L2에서 우세한 반면 Qwen3.5-Plus는 L1에서 가장 높은 성적을 보였습니다. 데이터셋별로도 성능 편차가 크며 Pix2Fact, BrowseComp-V3, CL-Bench-Table, CourtSI 같은 태스크는 모든 모델에서 난도가 높은 것으로 확인됐습니다. 열린 응답형 채점에서는 판정자 모델 선택에 따라 점수가 유의미하게 변동했습니다.
기술 상세
논문은 리스트 수준 채점식과 태스크별 결정론적 평가자를 병행해 평가 체계를 구성했습니다. 논문 결론 추론 채점식은 로 정의되며 여기서 는 참조 발견 수, 는 정답으로 판정된 예측 수, 는 근거 없는 과잉 예측 수입니다. 계산 흐름은 모델 출력 → LLM 판정자로 N_hit/N_extra 산출 → 위 식 적용으로 점수 산정이며 예시로 N_ref=3, N_hit=2, N_extra=0이면 점수는 0.666...이 됩니다. 다중선택은 옵션 추출→정확 일치, 숫자형은 정규화·허용오차·MAE 중 태스크별 규칙을 사용하며 열린 응답형은 사전 추출된 답을 LLM 판정으로 정량화해 집계합니다.
한계점
첫째, 통합된 벤치마크가 여러 공개 소스와 신규 태스크를 혼합하므로 원출처별 주석 스타일과 평가 절차의 이질성이 존재합니다. 둘째, 일부 하위집합은 샘플 수가 작아 포괄적 분포를 대표하지 못하며 진단적 용도로 해석해야 합니다. 셋째, 열린 응답형 채점에 LLM 판정자를 사용하면 판정자 모델에 따른 편향이 남을 수 있고, 이에 대한 보정이 필요합니다. 넷째, 재무 태스크는 현재 최종 ROE 정밀 일치만 채점하고 중간 DuPont 단계 점검은 완전하게 반영하지 않았습니다.
실무 활용
CLBench-V는 연구자와 엔지니어가 멀티모달 입력에서 증거 검색, 문맥값 적용, 문맥 정의 지식 학습 중 어느 지점에서 실패하는지 구체적으로 진단하는 데 적합합니다. 계층적 설계로 특정 능력(예: 지식 학습)에 초점을 맞춘 개선을 실험적으로 검증할 수 있습니다. 통합된 평가 파이프라인은 모델 비교와 판정자 민감도 분석에 즉시 사용할 수 있습니다.
- 멀티모달 LLM의 컨텍스트 그라운딩 성능 개선 실험에서 실패 유형별 A/B 비교.
- 재무·의료 문서 등 도메인별 파인튜닝이나 적응 방법의 유효성 검증용 벤치마크로 사용.
- LLM 기반 채점자(judge) 선택 및 보정 방법 연구에서 판정자 민감도 분석 데이터로 활용.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 컨텍스트 학습(Context learning)
- — 컨텍스트 학습은 사전학습된 파라메트릭 지식에 의존하지 않고 주어진 입력 맥락에서 규칙·사실·절차를 추출해 즉시 문제 해결에 활용하는 능력을 의미합니다. 입력으로는 문서, 표, 그림 등 다양한 증거가 주어지고 모델은 해당 증거를 찾아 결합해 출력 답안을 생성합니다. 이 논문에서는 멀티모달 맥락에서의 찾기(grounding), 적용(application), 지식학습(learning)으로 세 수준을 구분해 평가합니다.
- 멀티모달 장문 맥락(Multimodal long-context)
- — 멀티모달 장문 맥락은 텍스트와 다수의 이미지·도표·표를 포함하는 긴 입력을 말하며, 관련 증거가 여러 페이지와 시각적 항목에 분산되어 있습니다. 모델은 검색·레이아웃 해석·시각적 증거 추출과 결합해 정보를 찾아야 하고, 길이와 이미지 수에 따라 성능이 달라질 수 있습니다. CLBench-V는 이런 입력에서 증거 접근, 값 바인딩, 문맥 정의 지식 획득 능력을 분리해 측정합니다.
- DuPont 분해(DuPont decomposition)
- — DuPont 분해는 재무분석에서 ROE를 순이익률·자산회전율·재무레버리지로 분해해 계산하는 표준적 방법입니다. 입력 문서에서 net income, revenue, total assets, shareholders’ equity 등을 찾아 곱셈으로 결합해 ROE를 얻는 과정이 필요합니다. CLBench-V의 재무보고서 태스크는 이 분해법을 따르며 최종 ROE 정밀 일치 평가를 사용합니다.
코드 예제
def paper_score(n_ref, n_hit, n_extra):
return max(0.0, (n_hit - n_extra) / n_ref)
# Example: n_ref=3, n_hit=2, n_extra=0 -> score = 0.666...논문 결론 추론 태스크의 채점 절차를 간단히 구현한 파이썬 코드입니다. N_ref, N_hit, N_extra 변수를 입력받아 식 (2)에 따른 문서 단위 점수를 반환합니다. 실제 평가 파이프라인에서는 LLM 판정으로 N_hit와 N_extra를 추출한 뒤 이 함수를 호출합니다.
Normalized numeric match: normalize(predicted) == normalize(reference) or abs(predicted - reference) <= tol숫자형 정답의 비교 절차를 서술하는 코드형 문장입니다. 문서에서 추출한 수치를 정규화한 뒤 정확 일치 혹은 허용오차 기반 매칭을 적용할 때 사용합니다. ROE와 같은 재무 값 평가에서 활용됩니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.