TL;DR
LlamaIndex와 Kaggle이 기업 문서에서 구조화 데이터를 추출하는 시스템을 비교하는 공개 벤치마크 ExtractBench를 출시했습니다. 370개 문서, 4,869페이지, 8개 비즈니스 도메인, 67개 문서 유형을 대상으로 14개 시스템을 정확도·인식 품질·표 구조·문서 길이·비용 축에서 규칙 기반으로 평가합니다. 긴 문서에서는 Gemini 3.5 Flash의 정확도가 짧은 문서 87.9%에서 27.9%로 낮아졌지만, LlamaIndex의 Extract Agentic Plus는 94.4%를 유지했습니다. Codex GPT-5.5는 전체 정확도 93.5%와 페이지당 27.8센트, Extract Agentic Plus는 95.6%와 페이지당 8.1센트로 비용 차이도 컸으며, Extract만 추출값마다 원본 위치를 가리키는 bounding box를 반환했습니다.
빠른 이해
새로운 점
기업용 문서 추출을 짧은 문서 중심의 기존 평가에서 분리해 370개 문서와 4,869페이지의 긴·스캔·손글씨·복잡한 표 입력으로 측정하고, 정확도와 비용뿐 아니라 원본 위치 추적성까지 비교합니다.
핵심 메커니즘
문서와 고정 스키마를 입력으로 넣고, 일반 시스템은 전체 문서에서 구조화 필드를 추출하며 Agentic extraction 시스템은 문서를 섹션으로 분할한 뒤 각 섹션을 적합한 모델로 라우팅하고 원본 페이지와 값을 교차 확인하며 낮은 신뢰도 필드를 재시도합니다. 이후 추출된 필드를 결정론적 규칙으로 정답과 비교해 정확도, 인식 품질, 표 구조, 문서 길이, 도메인 범위와 비용을 산출하고, bounding box가 있으면 각 값의 원본 위치까지 검증합니다. 이 파이프라인은 긴 문서의 후반부 누락, 병합 셀에 따른 열 오배정, 빈 필드의 값 생성, 손글씨 인식 실패처럼 전체 점수에 가려지는 오류를 도전 유형별로 분리하는 데 목적이 있습니다.
핵심 수치
- 평가 규모: 370개 기업 문서, 4,869페이지, 8개 비즈니스 도메인, 67개 문서 유형- 14개 시스템을 동일한 고정 스키마로 평가
- Gemini 3.5 Flash 문서 길이별 정확도: 짧은 문서 87.9% -> 긴 문서 27.9%- 긴 문서에서 기록 목록을 끝까지 처리하지 못하는 현상
- Extract Agentic Plus 긴 문서 정확도: 94.4%- 문서 분할 및 원본 페이지 대조 적용
- Codex GPT-5.5: 전체 정확도 93.5%, 페이지당 27.8센트- 100만 페이지 기준 $278,000
- LlamaIndex Extract Agentic Plus: 전체 정확도 95.6%, 페이지당 8.1센트- 100만 페이지 기준 $81,000
- 출처 위치 추적: LlamaIndex의 Extract만 모든 추출값에 bounding box 반환- 검토자가 각 값의 원본 위치를 즉시 확인
섹션별 상세
기업 문서 추출의 병목
ExtractBench의 평가 구성
긴 문서에서 벌어진 성능 차이
정확도와 페이지 비용
Kaggle 공개와 다음 단계
용어 해설
- 문서 추출(Document Extraction)
- — 비정형 문서에서 보험 한도, 날짜, 금액, 표의 행처럼 미리 정한 구조화 필드를 읽어 데이터로 변환하는 작업입니다. 입력 문서의 레이아웃과 시각 정보를 처리한 뒤 필드별 값을 출력하며, 기업용 AI 에이전트가 그 결과를 바탕으로 청구나 규정 준수 업무를 자동 처리하기 때문에 정확성과 출처 추적이 중요합니다.
- VLM
- — 이미지와 텍스트를 함께 처리하는 Vision-Language Model입니다. 스캔 문서, 손글씨, 회전된 페이지, 표 구조처럼 일반 텍스트 모델만으로 다루기 어려운 시각 정보를 읽어 구조화된 값을 생성합니다. 이 글에서는 GPT-5.5, Claude Opus 4.8, Gemini 3 Flash 같은 frontier VLM이 문서 추출 시스템의 한 종류로 평가됩니다.
- 바운딩 박스(Bounding Box)
- — 문서 이미지에서 특정 단어나 값이 위치한 영역을 둘러싼 좌표 정보입니다. 추출된 값과 원본 페이지의 위치를 연결해 검토자가 문서를 다시 검색하지 않고도 근거를 확인하게 합니다. 이 글의 평가에서는 모든 추출 값에 바운딩 박스를 반환한 시스템이 LlamaIndex의 Extract뿐이었다고 집계됩니다.
- 에이전틱 문서 추출(Agentic Extraction)
- — 문서 전체를 한 번에 단일 모델 호출로 처리하지 않고, 문서를 섹션으로 나눈 뒤 각 부분에 적합한 모델을 배정하는 추출 방식입니다. 추출값을 원본 페이지와 대조하고 낮은 신뢰도의 필드를 재시도해 긴 문서와 복잡한 입력의 누락·오류를 줄이는 흐름을 구성합니다.
- OCR
- — 스캔 이미지나 사진 속 문자를 인식해 기계가 처리할 수 있는 텍스트로 바꾸는 기술입니다. 문서 추출에서는 글자 인식뿐 아니라 표의 행·열, 손글씨, 페이지 배치까지 후속 구조화 과정에 영향을 줍니다. LlamaIndex는 앞서 ParseBench를 통해 문서 파싱과 OCR 평가에 엄밀성을 더하는 작업을 진행했다고 밝힙니다.
기술
- ExtractBench
- Kaggle
- ParseBench
- GPT-5.5
- Claude Opus 4.8
- Gemini 3 Flash
- Gemini 3.5 Flash
- Codex
- Claude Code
- Reducto
- LlamaIndex Extract
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
