본문으로 건너뛰기

LlamaIndex·Kaggle, 기업 문서 추출 벤치마크 공개

ExtractBench가 370개 기업 문서로 추출 정확도와 비용을 비교합니다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

LlamaIndex와 Kaggle이 기업 문서에서 구조화 데이터를 추출하는 시스템을 비교하는 공개 벤치마크 ExtractBench를 출시했습니다. 370개 문서, 4,869페이지, 8개 비즈니스 도메인, 67개 문서 유형을 대상으로 14개 시스템을 정확도·인식 품질·표 구조·문서 길이·비용 축에서 규칙 기반으로 평가합니다. 긴 문서에서는 Gemini 3.5 Flash의 정확도가 짧은 문서 87.9%에서 27.9%로 낮아졌지만, LlamaIndex의 Extract Agentic Plus는 94.4%를 유지했습니다. Codex GPT-5.5는 전체 정확도 93.5%와 페이지당 27.8센트, Extract Agentic Plus는 95.6%와 페이지당 8.1센트로 비용 차이도 컸으며, Extract만 추출값마다 원본 위치를 가리키는 bounding box를 반환했습니다.

빠른 이해

새로운 점

기업용 문서 추출을 짧은 문서 중심의 기존 평가에서 분리해 370개 문서와 4,869페이지의 긴·스캔·손글씨·복잡한 표 입력으로 측정하고, 정확도와 비용뿐 아니라 원본 위치 추적성까지 비교합니다.

핵심 메커니즘

문서와 고정 스키마를 입력으로 넣고, 일반 시스템은 전체 문서에서 구조화 필드를 추출하며 Agentic extraction 시스템은 문서를 섹션으로 분할한 뒤 각 섹션을 적합한 모델로 라우팅하고 원본 페이지와 값을 교차 확인하며 낮은 신뢰도 필드를 재시도합니다. 이후 추출된 필드를 결정론적 규칙으로 정답과 비교해 정확도, 인식 품질, 표 구조, 문서 길이, 도메인 범위와 비용을 산출하고, bounding box가 있으면 각 값의 원본 위치까지 검증합니다. 이 파이프라인은 긴 문서의 후반부 누락, 병합 셀에 따른 열 오배정, 빈 필드의 값 생성, 손글씨 인식 실패처럼 전체 점수에 가려지는 오류를 도전 유형별로 분리하는 데 목적이 있습니다.

핵심 수치

  • 평가 규모: 370개 기업 문서, 4,869페이지, 8개 비즈니스 도메인, 67개 문서 유형- 14개 시스템을 동일한 고정 스키마로 평가
  • Gemini 3.5 Flash 문서 길이별 정확도: 짧은 문서 87.9% -> 긴 문서 27.9%- 긴 문서에서 기록 목록을 끝까지 처리하지 못하는 현상
  • Extract Agentic Plus 긴 문서 정확도: 94.4%- 문서 분할 및 원본 페이지 대조 적용
  • Codex GPT-5.5: 전체 정확도 93.5%, 페이지당 27.8센트- 100만 페이지 기준 $278,000
  • LlamaIndex Extract Agentic Plus: 전체 정확도 95.6%, 페이지당 8.1센트- 100만 페이지 기준 $81,000
  • 출처 위치 추적: LlamaIndex의 Extract만 모든 추출값에 bounding box 반환- 검토자가 각 값의 원본 위치를 즉시 확인

섹션별 상세

01

기업 문서 추출의 병목

기업 AI 에이전트는 보험 서류에서 보장 한도를 읽어 청구를 분류하고, 스캔 계약서에서 값을 뽑아 예외를 표시하므로 추출 오류가 곧 잘못된 업무 처리로 이어집니다. 기존 벤치마크는 짧고 디지털로 생성된 문서와 고정 스키마에 집중해 스캔 페이지, 손글씨, 회전 입력, 10페이지 이후의 성능, 값의 원본 추적성, 비용을 충분히 측정하지 못했습니다. ExtractBench는 사람이 결과를 검수할 수 있는 수준이 아니라 에이전트가 결과를 근거로 행동할 수 있는 신뢰성을 평가 대상으로 삼습니다. 긴 기록 목록의 중단, 빈 필드에 대한 값 생성, 인접 필드로의 날짜·식별자·금액 오배정, 병합 셀과 페이지 분할에 따른 표 오류가 실제 비교 항목이 됩니다.
02

ExtractBench의 평가 구성

LlamaIndex와 Kaggle은 370개 기업 문서, 4,869페이지, 8개 비즈니스 도메인, 67개 문서 유형으로 구성된 ExtractBench를 공개하고 14개 시스템을 동일한 고정 스키마에 넣어 비교합니다. 입력 문서에서 시스템이 구조화 필드를 추출하면 규칙 기반의 결정론적 평가가 결과를 정확도, 인식 품질, 표 구조, 문서 길이, 도메인 범위라는 다섯 축으로 채점하며 LLM-as-judge는 사용하지 않습니다. 평가 대상에는 GPT-5.5, Claude Opus 4.8, Gemini 3 Flash 같은 frontier VLM, Codex와 Claude Code 같은 coding agent, Reducto와 LlamaIndex의 Extract Cost Effective·Agentic Plus가 포함됩니다. 여러 페이지 송장의 모든 항목, 스캔 보험 서류의 중첩된 보장 한도, 서명 계약서의 손글씨 주석, 40페이지부터 표가 시작되는 100페이지 규제 제출 문서가 입력과 처리 범위를 넓힙니다.
03

긴 문서에서 벌어진 성능 차이

문서 길이가 늘어나면 개별 값은 맞혀도 전체 기록 목록을 끝까지 처리하지 못하는 현상이 상용 VLM에서 두드러졌고, 첫 10페이지 이후 정확도가 하락했습니다. Gemini 3.5 Flash는 짧은 문서에서 87.9%였던 정확도가 긴 문서에서 27.9%로 떨어졌지만, LlamaIndex의 Extract Agentic Plus는 같은 긴 문서에서 94.4%를 유지했습니다. Agentic Plus는 문서를 여러 섹션으로 나누고 각 섹션의 추출값을 원본 페이지와 대조해 입력을 분할하고 검증한 결과를 구조화 필드로 내보내므로 긴 목록의 조기 중단을 줄입니다. 이 비교는 전체 점수 하나만으로는 문서 길이에 따른 실패 양상을 파악하기 어렵고, 도전 유형별 결과가 시스템 선택에 필요하다는 점을 뒷받침합니다.
04

정확도와 페이지 비용

Codex GPT-5.5는 전체 정확도 93.5%를 페이지당 27.8센트로 기록했고, LlamaIndex의 Extract Agentic Plus는 95.6%를 페이지당 8.1센트로 기록했습니다. 같은 페이지 수를 처리하는 비용을 곱하면 100만 페이지에서 Codex는 100만 × 0.278달러인 278,000달러, Agentic Plus는 100만 × 0.081달러인 81,000달러가 되어 출처가 제시한 비용 차이와 일치합니다. 상용 VLM과 coding agent는 추출값만 반환해 검토자가 원본 위치를 직접 찾아야 하지만, LlamaIndex의 Extract는 모든 추출값에 bounding box를 함께 반환해 값과 페이지 영역을 즉시 연결합니다. 따라서 시스템 비교에는 정확도뿐 아니라 대규모 처리 비용과 사람이 결과를 확인할 수 있는 근거 위치도 함께 포함해야 합니다.
05

Kaggle 공개와 다음 단계

Kaggle은 누구나 시스템을 제출하고 동일한 기준으로 산출된 점수를 확인할 수 있는 공개 환경을 제공하며, 제출 관리와 결과 버전 관리의 운영 부담도 맡습니다. ExtractBench는 시연용 문서가 아니라 실제 기업 업무의 스캔, 손글씨, 복잡한 표, 긴 문서를 기준으로 추출 시스템을 비교하는 장소를 지향합니다. LlamaIndex는 앞으로 새 문서 유형과 더 어려운 예외 사례를 추가하고, 다섯 평가 축별 실패 양상을 더 세밀하게 분류하며, 추출을 전체 에이전트 작업 흐름의 일부로 채점하는 종단 간 평가를 도입할 계획입니다. 리더보드와 코드, 논문을 공개하고 사용자가 자신의 시스템을 실행한 뒤 결과를 제출하는 참여 방식도 함께 열어 두었습니다.

용어 해설

문서 추출(Document Extraction)
비정형 문서에서 보험 한도, 날짜, 금액, 표의 행처럼 미리 정한 구조화 필드를 읽어 데이터로 변환하는 작업입니다. 입력 문서의 레이아웃과 시각 정보를 처리한 뒤 필드별 값을 출력하며, 기업용 AI 에이전트가 그 결과를 바탕으로 청구나 규정 준수 업무를 자동 처리하기 때문에 정확성과 출처 추적이 중요합니다.
VLM
이미지와 텍스트를 함께 처리하는 Vision-Language Model입니다. 스캔 문서, 손글씨, 회전된 페이지, 표 구조처럼 일반 텍스트 모델만으로 다루기 어려운 시각 정보를 읽어 구조화된 값을 생성합니다. 이 글에서는 GPT-5.5, Claude Opus 4.8, Gemini 3 Flash 같은 frontier VLM이 문서 추출 시스템의 한 종류로 평가됩니다.
바운딩 박스(Bounding Box)
문서 이미지에서 특정 단어나 값이 위치한 영역을 둘러싼 좌표 정보입니다. 추출된 값과 원본 페이지의 위치를 연결해 검토자가 문서를 다시 검색하지 않고도 근거를 확인하게 합니다. 이 글의 평가에서는 모든 추출 값에 바운딩 박스를 반환한 시스템이 LlamaIndex의 Extract뿐이었다고 집계됩니다.
에이전틱 문서 추출(Agentic Extraction)
문서 전체를 한 번에 단일 모델 호출로 처리하지 않고, 문서를 섹션으로 나눈 뒤 각 부분에 적합한 모델을 배정하는 추출 방식입니다. 추출값을 원본 페이지와 대조하고 낮은 신뢰도의 필드를 재시도해 긴 문서와 복잡한 입력의 누락·오류를 줄이는 흐름을 구성합니다.
OCR
스캔 이미지나 사진 속 문자를 인식해 기계가 처리할 수 있는 텍스트로 바꾸는 기술입니다. 문서 추출에서는 글자 인식뿐 아니라 표의 행·열, 손글씨, 페이지 배치까지 후속 구조화 과정에 영향을 줍니다. LlamaIndex는 앞서 ParseBench를 통해 문서 파싱과 OCR 평가에 엄밀성을 더하는 작업을 진행했다고 밝힙니다.

기술

  • ExtractBench
  • Kaggle
  • ParseBench
  • GPT-5.5
  • Claude Opus 4.8
  • Gemini 3 Flash
  • Gemini 3.5 Flash
  • Codex
  • Claude Code
  • Reducto
  • LlamaIndex Extract

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 09. 02.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.