본문으로 건너뛰기
r/LLMDevs조회 1

ExtractBench 소규모 실험에서 Opus 5와 qwen3.8 비교

36개 문서 ExtractBench 실험에서 Claude Opus 5와 qwen3.8-2.4t가 각각 약 0.94와 0.936의 cell-level F1을 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 40달러를 들여 LlamaIndex ExtractBench의 36개 문서를 pypdf로 읽고 Claude Opus 5와 Qwen 계열 모델의 one-shot 구조화 추출 성능을 cell-level F1로 비교했습니다. Claude Opus 5는 약 0.94, qwen3.8-2.4t는 0.936을 기록했으며 후자는 비슷한 성능을 3분의 1 가격에 냈습니다. F1은 추출 값의 개수보다 문서 길이와 더 강하게 반비례했지만, n=36·중단문 중심·텍스트 레이어 문서만 포함·scorer 재구현이라는 한계가 있습니다.

합의점 vs 논쟁점

논쟁점

  • 짧거나 중간 길이의 텍스트 문서에서는 coding agent 없이도 one-shot 구조화 추출이 높은 cell-level F1을 낼 수 있다는 해석이 가능합니다. 그러나 표본이 36개이고 긴 문서와 스캔 문서가 제외돼 전체 문서군으로 일반화하기에는 범위가 좁습니다. 특히 원 벤치마크의 scorer가 아닌 재구현 코드를 사용했기 때문에 0.94와 0.936의 절대값을 공식 leaderboard와 직접 동일시하기 어렵습니다.

섹션별 상세

01
작성자는 LlamaIndex의 ExtractBench에서 제공한 36개 정부 문서, 세관 양식, GSA 가격표, 지방자치단체 감사 문서를 대상으로 소규모 실험을 수행했습니다. pypdf로 텍스트를 추출한 뒤 OpenRouter를 통해 Claude Opus 5, qwen3.8-2.4t, qwen3.6-35b에 one-shot 추출을 실행하고, 벤치마크의 gold standard와 cell-level F1을 비교했습니다. 전체 실행 비용은 40달러였으며, 코드와 실험 노트북도 공개됐습니다.
02
Claude Opus 5는 별도 에이전트 없이 일반 텍스트를 one-shot으로 처리해 약 0.94의 cell-level F1을 기록했습니다. 이 수치는 원 논문에 나온 coding agent 성능과 비슷하면서 페이지당 비용은 더 낮았고, qwen3.8-2.4t는 0.936으로 비슷한 결과를 3분의 1 가격에 냈습니다. 반면 qwen3.6-35b의 구체적인 점수는 글에 제시되지 않았습니다.
03
문서 길이와 F1의 상관계수는 ρ ≈ −0.50으로 나타나 추출해야 할 값의 개수와 F1의 상관계수인 ρ ≈ −0.28보다 강했습니다. 작성자는 이 결과가 문서별 사전 라우팅을 다룬 arxiv 2608.06607의 관찰과 잘 맞는다고 봤습니다. 다만 표본 수가 n=36이고 50페이지가 넘는 문서를 제외했으며, 스캔 양식처럼 텍스트 레이어가 없는 문서는 빠졌고, 평가 코드도 벤치마크 구현을 다시 만든 버전이라 절대 점수에는 차이가 날 수 있습니다.

용어 해설

문서 추출 벤치마크(ExtractBench)
ExtractBench는 정부 문서, 세관 양식, GSA 가격표, 지방자치단체 감사 문서에서 정해진 스키마에 맞춰 값을 추출하는 능력을 평가하는 벤치마크입니다. 정답 데이터와 비교해 필드별 성능을 측정합니다.
스키마 기반 문서 추출(Schema-Guided Document Extraction)
스키마 기반 문서 추출은 문서의 자유로운 텍스트에서 미리 정한 필드와 자료형에 맞춰 값을 찾아 구조화하는 방식입니다. 추출 결과를 정답 스키마와 비교할 수 있어 자동화 품질을 수치로 평가하기 좋습니다.
셀 단위 F1 점수(Cell-Level F1)
셀 단위 F1은 구조화된 추출 결과의 각 셀을 정답과 대조해 정밀도와 재현율을 함께 계산하는 평가 지표입니다. 문서 전체가 아니라 개별 값의 일치 여부를 반영하므로 필드 추출 성능 비교에 쓰입니다.
추론 전 라우팅(Pre-Inference Routing)
추론 전 라우팅은 모델 실행 전에 문서나 요청의 특성을 판단하고 적합한 모델 또는 처리 경로를 선택하는 방식입니다. 문서 길이처럼 사전에 알 수 있는 신호를 이용해 비용과 성능의 균형을 조정합니다.

언급된 도구

LlamaIndex중립

스키마 기반 문서 추출 벤치마크인 ExtractBench를 제공하는 라이브러리입니다.

pypdf중립

정부 문서와 양식에서 텍스트 레이어를 추출하는 데 사용됐습니다.

OpenRouter중립

Claude Opus 5, qwen3.8-2.4t, qwen3.6-35b에 추출 요청을 보내는 실행 경로로 사용됐습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 26.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.