TL;DR
작성자는 40달러를 들여 LlamaIndex ExtractBench의 36개 문서를 pypdf로 읽고 Claude Opus 5와 Qwen 계열 모델의 one-shot 구조화 추출 성능을 cell-level F1로 비교했습니다. Claude Opus 5는 약 0.94, qwen3.8-2.4t는 0.936을 기록했으며 후자는 비슷한 성능을 3분의 1 가격에 냈습니다. F1은 추출 값의 개수보다 문서 길이와 더 강하게 반비례했지만, n=36·중단문 중심·텍스트 레이어 문서만 포함·scorer 재구현이라는 한계가 있습니다.
합의점 vs 논쟁점
논쟁점
- 짧거나 중간 길이의 텍스트 문서에서는 coding agent 없이도 one-shot 구조화 추출이 높은 cell-level F1을 낼 수 있다는 해석이 가능합니다. 그러나 표본이 36개이고 긴 문서와 스캔 문서가 제외돼 전체 문서군으로 일반화하기에는 범위가 좁습니다. 특히 원 벤치마크의 scorer가 아닌 재구현 코드를 사용했기 때문에 0.94와 0.936의 절대값을 공식 leaderboard와 직접 동일시하기 어렵습니다.
섹션별 상세
용어 해설
- 문서 추출 벤치마크(ExtractBench)
- — ExtractBench는 정부 문서, 세관 양식, GSA 가격표, 지방자치단체 감사 문서에서 정해진 스키마에 맞춰 값을 추출하는 능력을 평가하는 벤치마크입니다. 정답 데이터와 비교해 필드별 성능을 측정합니다.
- 스키마 기반 문서 추출(Schema-Guided Document Extraction)
- — 스키마 기반 문서 추출은 문서의 자유로운 텍스트에서 미리 정한 필드와 자료형에 맞춰 값을 찾아 구조화하는 방식입니다. 추출 결과를 정답 스키마와 비교할 수 있어 자동화 품질을 수치로 평가하기 좋습니다.
- 셀 단위 F1 점수(Cell-Level F1)
- — 셀 단위 F1은 구조화된 추출 결과의 각 셀을 정답과 대조해 정밀도와 재현율을 함께 계산하는 평가 지표입니다. 문서 전체가 아니라 개별 값의 일치 여부를 반영하므로 필드 추출 성능 비교에 쓰입니다.
- 추론 전 라우팅(Pre-Inference Routing)
- — 추론 전 라우팅은 모델 실행 전에 문서나 요청의 특성을 판단하고 적합한 모델 또는 처리 경로를 선택하는 방식입니다. 문서 길이처럼 사전에 알 수 있는 신호를 이용해 비용과 성능의 균형을 조정합니다.
언급된 도구
스키마 기반 문서 추출 벤치마크인 ExtractBench를 제공하는 라이브러리입니다.
정부 문서와 양식에서 텍스트 레이어를 추출하는 데 사용됐습니다.
Claude Opus 5, qwen3.8-2.4t, qwen3.6-35b에 추출 요청을 보내는 실행 경로로 사용됐습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

