TL;DR
장문으로 구성된 실제 보고서에서는 차트와 텍스트가 서로 멀리 떨어져 배치될 수 있어 근거 식별과 통합이 중요하다. SynthDocBench는 이러한 장거리 교차모달 증거 통합 문제를 독립적 변수로 분해해 모델 실패 원인을 계량적으로 밝힐 수 있도록 설계되었다. 이로써 단일 페이지 벤치마크에서 가려진 장문 상황의 취약 지점을 명확히 하고 향후 모델 개선의 진단 신호를 제공한다.
왜 중요한가
장문으로 구성된 실제 보고서에서는 차트와 텍스트가 서로 멀리 떨어져 배치될 수 있어 근거 식별과 통합이 중요하다. SynthDocBench는 이러한 장거리 교차모달 증거 통합 문제를 독립적 변수로 분해해 모델 실패 원인을 계량적으로 밝힐 수 있도록 설계되었다. 이로써 단일 페이지 벤치마크에서 가려진 장문 상황의 취약 지점을 명확히 하고 향후 모델 개선의 진단 신호를 제공한다.
핵심 기여
독립적 축으로 문서 복잡도를 제어하는 합성 벤치마크 설계
문서 길이, 페이지 깊이, 모달리티 구성, 질문 유형을 서로 독립적으로 변동시키는 조합 설계를 적용해 각 요인이 모델 성능에 미치는 영향을 분리했다. 이 설계는 6개 레이아웃 아키타입과 24개 D3.js 차트 타입을 포함해 구조적 다양성을 확보하며 40%의 랜덤 레이아웃 오버라이드를 적용해 주제-레이아웃 상관관계를 억제했다. 결과물은 200개의 합성 리포트와 1,788개의 검증된 QA로 구성되었다.
D3 기반의 이중 레이어 문서 생성 파이프라인으로 결정론적 정답 보장
각 차트는 사용자에게 표시되는 D3 렌더링과 정답 산출용의 구조화된 메타데이터 객체로 동시에 생성되어 모든 정답이 메타데이터에서 결정론적으로 유도되도록 했다. 이 접근은 사람 라벨링이나 후처리 차트 파싱을 불필요하게 하며 자동 검증 단계(수치 재계산·일관성 필터링·샘플 수동 검토)를 통해 품질을 확보했다. QA 항목은 증거 유닛의 합성으로 생성되며 난이도 L1–L5 레이블과 증거 트레이스를 포함한다.
장문 환경에서 드러나는 세 가지 주요 실패 모드의 계량적 증거 제공
200개 리포트에 대해 여덟 개 최전선 VLM을 평가한 결과 문서 길이 증가에 따른 급격한 성능 저하, 문서 중간 구간에서의 체감 난이도 상승(다수 모델에서 middle 구간이 가장 낮은 ACC), 및 장문 상황에서의 정밀 차트 판독 실패가 동시 관측되었다. 특히 일부 모델은 Early→Late 추세에서 최대 8.3 percentage point의 성능 하락을 보였고 교차모달 질문은 전 모델에서 가장 어려운 카테고리로 나타났다.
평가 프로토콜과 재현 가능한 코드·데이터 공개
입력 이미지는 144 DPI로 래스터화하고 최대 120페이지를 5페이지씩 세로 스트립으로 연결하는 표준화된 전처리를 적용했으며, 응답 평가는 GPT-5 저지를 사용해 0–10 점수로 채점하고 τ=6 이상의 경우 정답으로 간주하는 ACC 지표를 사용했다. 평가 파이프라인과 데이터셋은 공개 GitHub 및 Hugging Face 데이터셋으로 제공되어 다른 연구자가 동일한 실험을 재현할 수 있게 했다. 부가 실험으로 페이지/해상도·프롬프트 전략·스트립 길이에 대한 상세한 어블레이션을 포함했다.
핵심 아이디어 이해하기
장문 시각 문서 이해 문제는 텍스트 기반의 장거리 검색과 픽셀 수준의 시각 해독을 동시에 요구하는 복합적 과제이다. 전통적 단일 페이지 VLM 평가는 차트나 텍스트를 고립된 형태로 다루어 두 모달리티가 문서 전체에 분산될 때 발생하는 상호작용을 포착하지 못했다. 따라서 문제의 출발점은 ‘어떤 근거가 어디에 흩어져 있는지’를 안정적으로 추적하고, 그 근거들로부터 수치적·논리적 합성을 수행하는 능력의 정밀한 분해다.
해결 원리는 합성 생성 파이프라인을 통해 문서 속성을 독립 변수로 제어하는 것이다. topic seed에서 시작해 텍스트 백본을 구성하고 레이아웃 아키타입을 샘플링한 뒤 각 차트를 D3 렌더링과 구조화 메타데이터 쌍으로 동시 생성함으로써 정답을 결정론적으로 확보했다. 이 과정은 증거 유닛을 명시적으로 추적하므로 질문 생성 단계에서 L1–L5 난이도와 증거 트레이스를 부여할 수 있어 모델 실패 원인을 난이도·모달리티·위치 축으로 분해할 수 있게 했다.
이 방식은 기존 벤치마크 대비 무엇을 가능케 하는가 하면, 동일한 문서 길이·차트 수를 고정한 상태에서 모달 비중이나 질문 유형만 바꿔도 성능 변화를 계량적으로 측정할 수 있다. 논문에서는 평균 51.1 페이지, 문서당 평균 16.7개의 차트를 사용해 장문·고밀도 환경을 재현했고 이 설정에서 일부 최전선 모델이 단일페이지 성능과는 큰 차이를 보인다는 사실을 수치로 확인했다. 제어된 합성 설계는 모델이 벤치마크 특유의 편향에 과적합했는지 여부를 판별하는 데 유효한 진단 신호를 제공한다.
방법론
전체 파이프라인은 세 단계로 구성되며 첫 단계는 문서 생성이다. 토픽 시드 τ에서 문서 𝒟와 QA 매니페스트 ℳ을 생성하는데, 이때 내용 생성은 주제 관련 증거를 검색해 구조화된 중간 표현으로 재구성하고 레이아웃 아키타입을 샘플링해 페이지 문법과 차트 배치를 결정했다. 레이아웃 샘플링은 아키타입 확률 0.6과 균일 랜덤 오버라이드 0.4를 적용해 주제-레이아웃 상관을 낮추는 방식으로 구현되었다.
두 번째는 시각화 합성으로서 각 차트는 두 형태로 생성되었다. 눈에 보이는 D3.js 렌더링과 정답 산출용의 구조화된 메타데이터 V_k가 쌍으로 생성되어 메타데이터에서 축·데이터 포인트·파생 인사이트가 기록된다. 이 이중 레이어는 정답을 후처리 파싱 없이 메타데이터에서 직접 도출 가능하게 만들며 수치 재계산과 자동 일관성 필터링, 샘플 수동 검토(100샘플, >96% 승인)를 통해 QA 품질을 확보했다.
세 번째는 QA 생성과 검증이다. 파이프라인은 차트·테이블·텍스트 채널에서 증거 유닛을 추출하고 2~4개의 유닛을 합성해 chart-reading, cross_modal, complex multi-hop의 세 가족 질문을 생성하며 각 문항에 L1–L5 난이도를 라벨링한다. 최종 직렬화 전에 잘못 생성된 항목은 자동 필터링과 수치 검증 단계에서 제거되며 이렇게 생성된 1,788개의 질문은 증거 트레이스와 함께 매니페스트 ℳ로 저장된다.
평가 프로토콜은 엄격한 vision-only 설정을 채택했다. PDF는 144 DPI로 래스터화되고 최대 120페이지를 허용하되 기본으로 5페이지 세로 스트립을 사용해 모델 입력 제약을 맞췄으며 응답 평가는 GPT-5 저지를 사용해 0–10 점수로 채점하고 τ=6을 기준으로 ACC를 계산했다. 파싱 실패는 -1 점으로 취급되어 유효 문항 집합에서 제외되었다.
관련 Figure

이 그림은 SynthDocBench가 평균 페이지 약 51과 평균 텍스트 토큰이 높은 영역에 놓여 기존 단일 페이지 벤치마크와 구별된다는 점을 시각적으로 확인시킨다. 좌표는 벤치마크별 평균 페이지와 평균 토큰을 사용해 구성되었고 LongDocURL과 비교해 페이지 수는 비슷하나 토큰 밀도에서 더 높은 위치를 점유하고 있음을 보여준다. 이 시각화는 본 논문이 장문·고밀도 문서 이해를 목표로 설계되었음을 근거로 뒷받침한다.
여러 벤치마크를 평균 페이지 수와 평균 텍스트 토큰 밀도로 비교해 SynthDocBench가 장문·고밀도 영역에 위치함을 시각화한 산점도이다.

세 개의 히스토그램은 각각 페이지, 단어 수, 차트 수가 넓은 꼬리를 갖는 현실 분포가 아니라 제어된 범위 내에 집중되어 있음을 나타낸다. 이 집중된 분포는 논문에서 의도한 바와 같이 특정 축을 고정한 상태에서 다른 축을 조작하는 어블레이션을 가능하게 한다. 따라서 이 그림은 합성 생성 파이프라인이 통제된 실험 조건을 제공함을 수치적으로 뒷받침한다.
문서당 페이지 수, 단어 수, 차트 수 분포를 히스토그램으로 제시해 각 속성이 단봉 분포로 조밀하게 설계되었음을 보여준다.

파이차트는 레이아웃 아키타입별 비중을 보여주어 생성 시 사용된 스타일적 다양성을 한눈에 드러낸다. 레이아웃 다양성은 모델이 특정 레이아웃에 과적합하지 않도록 40% 랜덤 오버라이드와 결합되어 벤치마크의 진단 가치를 높인다. 이 그림은 레이아웃 축이 실험 설계의 핵심 제어 변인임을 보강한다.
문서에 사용된 여섯 가지 레이아웃 아키타입의 비율을 파이차트로 요약해 레이아웃 분포를 시각화하고 있다.
주요 결과
벤치마크 전체에서 Gemini-3.1-Pro가 가장 높은 성능을 보였고 전체 ACC는 0.725, 평균 저지 점수는 7.19였다. 두 번째는 Qwen3.5-VL-122B로 ACC 0.655를 기록했고 Qwen3-VL-235B는 0.586, GPT-5.4는 0.423, GPT-4o는 0.386 등 모델별 순위가 보고되었다. 부트스트랩 95% 신뢰구간은 전체에서 ±0.023 이내였고 하위 집합별로는 ±0.041 이내여서 모델 간 순위 차는 통계적으로 유의했다.
세부 분석에서 복잡도·난이도 축에 따라 대부분 모델은 L1에서 L5로 갈수록 성능이 일관되게 하락했으나 Gemini와 일부 모델은 비교적 완만한 하락을 보였다. OCR 기반 텍스트 전용 처리와의 비교에서 complex 질문은 OCR이 유리했으며 OCR ACC는 0.798, 비전만의 복잡도 ACC는 0.360으로 보고되어 복잡한 증거 합성은 텍스트 회수 능력이 핵심임이 확인되었다. 반대로 차트 판독은 픽셀 디코딩이 핵심이어서 OCR이 0.297인 반면 비전 처리 성능은 0.457로 역전되는 경향이 관측되었다.
위치 민감도 분석에서는 문서의 중간 1/3 구간이 가장 어려운 것으로 나타났고 다섯 개의 모델에서 중간 구간 성능이 최저였다. Early→Late 추세 분석에서 일부 모델은 최대 8.3 percentage point의 성능 하락을 보였고 시각적 환각(visual hallucination)과 figure-not-found, 정밀도 오류가 주요 실패 유형으로 식별되었다. 페이지 스트립 길이와 해상도 어블레이션에서는 Gemini가 스트립 길이 증가에 따라 성능이 개선되어 1페이지 스트립에서 0.369에서 10페이지 스트립에서 0.792로 상승하는 등 다중 페이지 컨텍스트가 성능에 중요한 영향을 미쳤다.
관련 Figure

이 막대그래프는 차트 질문에서는 시각 입력이 우세하고 복잡 질문에서는 OCR 기반 텍스트 접근이 우세하다는 결론을 시각적으로 요약한다. 수치로는 복잡 질문에서 OCR ACC가 0.798로 비전의 0.360보다 훨씬 높게 나타나며 이는 복잡한 증거 합성이 주로 텍스트 회수 능력에 의존함을 시사한다. 이러한 결과는 모델 설계에서 시각-텍스트 통합 전략의 중요성을 강조한다.
GPT-4o(vision)와 OCR+GPT-4o(text-only)를 비교한 막대그래프로서 차트·복잡문항·교차모달별 성능 차이를 제시하고 있다.

에러 분포는 교차모달 실패가 가장 많고 비주얼 환각이 단일 최우선 오류 유형임을 보여준다. 이 패턴은 장문 환경에서 픽셀 수준의 정밀한 수치 판독이 불안정하며 그 결과 모델이 그럴듯하지만 근거가 없는 값을 생성하는 경향이 있다는 점을 뒷받침한다. 해당 그림은 향후 연구에서 픽셀-투-수치 변환의 견고성을 개선해야 할 필요성을 명확히 시사한다.
모든 모델이 실패한 하드 케이스 109문항을 에러 유형(비주얼 환각, 도형 미발견, 정밀도 오류 등)과 질문 하위집합 별로 분해한 막대그래프이다.
기술 상세
데이터 생성 아키텍처는 topic seed → 텍스트 백본 구성 → 레이아웃 아키타입 샘플링 → D3 시각화 및 메타데이터 동시 생성 → HTML/PDF 렌더링(Playwright)로 구성되어 있다. 각 시각화는 화면용 D3 렌더링과 정답 산출용의 구조화 메타데이터 V_k 쌍으로 생성되며 메타데이터에는 축 라벨, 데이터 점, 계산된 파생치가 포함되어 정답이 결정론적으로 도출된다. 레이아웃 샘플링은 아키타입을 주제-조건 분포에서 60% 확률로 선택하고 40%는 균일 무작위로 덮어씌워 주제-레이아웃 상관관계를 줄이는 설계를 적용했다.
평가 파이프라인은 입력 이미지를 144 DPI로 래스터화하고 기본 concat-num을 5페이지 스트립으로 설정했으며 각 스트립은 최대 7,900px·4MB 제약 안에서 API에 전달된다. 모델 응답은 고정 시스템 프롬프트 하에 온도 0으로 생성되며 GPT-5 저지가 각 응답과 정답 쌍을 0–10 점수로 채점한다. ACC는 τ=6을 기준으로 유효 문항(Q_valid)에 대해 평균 1[judge_score ≥ 6]로 계산되며 파싱 실패는 -1로 처리되어 집계에서 제외된다.
무작위성 통제와 검증 절차로는 수치 재계산, 자동 일관성 필터링, 그리고 100샘플 수동 검토(승인률 >96%)가 포함된다. 벤치마크 통계는 문서당 평균 페이지 51.1, 평균 단어 수 20,568, 평균 차트 수 16.7이며 총 200개의 보고서와 1,788개의 QA 항목으로 구성되어 있다. 부트스트랩(2,000 재샘플, seed=42)으로 신뢰구간을 계산해 모델별 차이가 통계적으로 유의함을 확인했다.
한계점
합성 데이터라는 특성상 실제 문서 코퍼스의 장기적 편향·표현 다양성·예외적 포맷을 온전히 반영하지 못해 생태학적 타당성이 제한된다. 논문 저자들은 HTML/D3 기반 렌더링이 특정 모델의 훈련 분포와 유사할 경우 렌더링 친숙성이 성능 우위를 일부 설명할 수 있음을 명시했으며 이를 잠재적 교란변수로 인정했다. 또한 본 벤치마크는 연구용 진단 도구로 설계되어 고위험 의사결정 시스템에의 직접적 적용이나 일반화는 권고되지 않는다.
실무 활용
SynthDocBench는 연구자와 엔지니어가 장문 교차모달 문서 이해에서 모델의 취약점을 체계적으로 진단할 수 있는 도구를 제공한다. 합성 파이프라인과 결정론적 정답 구조는 반복 가능한 어블레이션과 원인 분석을 가능하게 해 모델 개선 방향을 구체적으로 제시한다. 공개된 코드와 데이터셋을 이용하면 새로운 렌더러나 차트 스타일에 대한 검증을 수행해 벤치마크 특이적 과적합 여부를 확인할 수 있다.
- 모델 진단 실험에서 문서 길이·차트 밀도·질문 유형을 독립적으로 조작해 성능 민감도를 측정하는 용도로 활용할 수 있다.
- 교차모달 증거 통합 성능을 개선하기 위한 Retrieval·RAG·아키텍처 변경의 효과를 정량적으로 검증하는 데 사용할 수 있다.
- 차트 판독과 텍스트 기반 추출을 결합하는 멀티모달 파이프라인의 전처리·해상도·스트립 길이 조합에 따른 최적 설정을 찾는 데 적용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Long-Context
- — 문서 내에서 수십에서 수백 페이지에 걸친 텍스트와 시각적 요소를 포괄적으로 참조해야 하는 상황을 의미한다. 이 맥락에서는 정보 탐색과 관련 증거의 원거리 추적이 필요하며 토큰·페이지 수의 증가로 연산·메모리 비용이 급증한다. 장문 맥락의 제어된 실험은 모델의 장거리 검색·집계·교차모달 추론 능력을 분리해 평가하는 데 중요하다.
- Cross-Modal Grounding
- — 텍스트, 표, 차트 등 서로 다른 모달리티에 분산된 증거를 연결해 단일 정답을 도출하는 과제를 뜻한다. 기계는 시각 정보에서 추출한 값과 문서 텍스트의 서술을 매칭하고 합성해야 하므로 정확한 위치 인식과 정량적 정합이 요구된다. 이 논문에서는 교차 모달 질문이 장문 환경에서 특히 낮은 성능을 보인다는 점을 계량적으로 보여주었다.
- Synthetic Benchmark
- — 프로그램적 생성 파이프라인으로 문서와 정답 메타데이터를 동시 생성해 참조 정답을 결정론적으로 확보하는 평가집합이다. 합성 벤치마크는 문서 길이·레이아웃·모달리티·질문 난이도 등 변인을 독립적으로 제어해 실패 원인을 명확히 분해할 수 있게 한다. 단, 실제 문서의 무작위성·편향과 달리 생태적 타당성은 낮을 수 있다.
- Chart Reading
- — 이미지화된 시계열·막대·라인 등 시각적 데이터에서 축, 레이블, 수치값을 정확히 판독해 정량적 응답을 생성하는 작업을 말한다. 픽셀 수준의 정밀한 디코딩과 시각적 요소의 수치 변환이 요구되며 텍스트 기반 OCR만으로는 해결되지 않는 경우가 많다. 본 연구에서는 장문 문서 내 차트 판독 정확도가 기존 분리된 차트 벤치마크 대비 크게 저하됨이 관찰되었다.
- Evidence Trace
- — 질문에 대한 정답을 도출하기 위해 문서 내 어떤 텍스트·표·차트 항목들이 근거로 사용되었는지를 구조적으로 기록한 메타데이터를 의미한다. 합성 파이프라인은 각 질문에 대해 2~4개의 증거 유닛을 연결한 구조적 추적을 생성해 검증과 난이도 레이블링에 활용했다. 증거 추적은 자동 정답 산출과 검증 단계에서 필수적이었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.